Overview
title: “功能概述” sidebar_label: “总览” sidebar_position: 1
Section titled “title: “功能概述” sidebar_label: “总览” sidebar_position: 1”--- body ---
Hermes Agent 拥有一套丰富的功能,远远超越基础聊天。从持久记忆和文件感知上下文,到浏览器自动化和语音对话,这些功能协同工作,使 Hermes 成为强大的自主助手。
:::tip 不知道从哪里开始?
hermes setup --portal 一条命令即可覆盖模型提供商以及全部四个工具网关(Tool Gateway)工具(网页搜索、图像生成、TTS、浏览器)。参见 Nous Portal。
:::
- 工具与工具集(Tools & Toolsets) — 工具是扩展 Agent 能力的函数。它们被组织成逻辑工具集,可针对每个平台启用或禁用,涵盖网页搜索、终端执行、文件编辑、记忆、委派等。
- 技能系统(Skills System) — 按需加载的知识文档,Agent 可在需要时加载。技能遵循渐进式披露模式以最小化令牌用量,并兼容 agentskills.io 开放标准。
- 持久记忆(Persistent Memory) — 有界、精炼的记忆,跨会话持久存在。Hermes 通过
MEMORY.md和USER.md记住你的偏好、项目、环境以及它学到的东西。 - 上下文文件(Context Files) — Hermes 自动发现并加载项目上下文文件(
.hermes.md、AGENTS.md、CLAUDE.md、SOUL.md、.cursorrules),这些文件塑造它在你项目中的行为。 - 上下文引用(Context References) — 输入
@后跟引用,可将文件、文件夹、Git 差异和 URL 直接注入消息中。Hermes 会内联展开引用并自动附加内容。 - 检查点(Checkpoints) — Hermes 在修改文件前自动快照你的工作目录,提供安全网,以便在出现问题时通过
/rollback回滚。
- 定时任务(Cron) — 使用自然语言或 cron 表达式安排自动运行的任务。任务可以附加技能、将结果投递到任何平台,并支持暂停/恢复/编辑操作。
- 子 Agent 委派(Subagent Delegation) —
delegate_task工具会生成具有独立上下文、受限工具集和自身终端的子 Agent 实例。默认运行 3 个并发子 Agent(可配置),用于并行工作流。 - 代码执行(Code Execution) —
execute_code工具让 Agent 编写调用 Hermes 工具的 Python 脚本,通过沙箱 RPC 执行将多步工作流压缩为单个 LLM 轮次。 - 事件钩子(Event Hooks) — 在关键生命周期点运行自定义代码。网关钩子处理日志、告警和 Webhook;插件钩子处理工具拦截、指标和护栏。
- 批量处理(Batch Processing) — 并行运行 Hermes Agent 处理数百或数千个提示,生成结构化的 ShareGPT 格式轨迹数据,用于训练数据生成或评估。
- 语音模式(Voice Mode) — 跨 CLI 和消息平台的完整语音交互。使用麦克风与 Agent 交谈,聆听语音回复,并在 Discord 语音频道中进行实时语音对话。
- 浏览器自动化(Browser Automation) — 完整的浏览器自动化,支持多种后端:Browserbase 云、Browser Use 云、通过 CDP 的本地 Chrome/Brave/Chromium/Edge,或本地 Chromium。浏览网站、填写表单、提取信息。
- 视觉与图像粘贴(Vision & Image Paste) — 多模态视觉支持。从剪贴板将图像粘贴到 CLI 中,并要求 Agent 使用任何支持视觉的模型分析、描述或处理它们。
- 图像生成(Image Generation) — 使用 FAL.ai 从文本提示生成图像。支持九种模型(FLUX 2 Klein/Pro、GPT-Image 1.5/2、Nano Banana Pro、Ideogram V3、Recraft V4 Pro、Qwen、Z-Image Turbo);通过
hermes tools选择。 - 语音与 TTS — 跨所有消息平台的文本转语音输出和语音消息转录,提供十种原生提供商选项:Edge TTS(免费)、ElevenLabs、OpenAI TTS、MiniMax、Mistral Voxtral、Google Gemini、xAI、NeuTTS、KittenTTS 和 Piper——外加用于任何本地 TTS CLI 的自定义命令提供商。
- MCP 集成 — 通过 stdio 或 HTTP 传输连接到任意 MCP 服务器。访问来自 GitHub、数据库、文件系统和内部 API 的外部工具,无需编写原生 Hermes 工具。包括每服务器工具过滤和采样支持。
- 提供商路由(Provider Routing) — 精细控制哪些 AI 提供商处理你的请求。通过排序、白名单、黑名单和优先级排序优化成本、速度或质量。
- 后备提供商(Fallback Providers) — 当主模型遇到错误时自动故障转移到备份 LLM 提供商,包括为视觉和压缩等辅助任务提供独立的后备。
- 凭据池(Credential Pools) — 将 API 调用分布到同一提供商的多个密钥上。在达到速率限制或失败时自动轮换。
- 提示缓存(Prompt Caching) — 内置的跨会话 1 小时前缀缓存,适用于 Anthropic、OpenRouter 和 Nous Portal 上的 Claude。始终启用,无需配置。
- 记忆提供商(Memory Providers) — 插入外部记忆后端(Honcho、OpenViking、Mem0、Hindsight、Holographic、RetainDB、ByteRover、Supermemory),用于超越内置记忆系统的跨会话用户建模和个性化。
- API 服务器 — 将 Hermes 作为 OpenAI 兼容的 HTTP 端点暴露。连接任何使用 OpenAI 格式的前端——Open WebUI、LobeChat、LibreChat 等。
- IDE 集成(ACP) — 在支持 ACP 的编辑器(如 VS Code、Zed 和 JetBrains)中使用 Hermes。聊天、工具活动、文件差异和终端命令在编辑器内渲染。
- 批量处理(Batch Processing) — 从 CLI 并行运行 Agent 处理多个提示或任务,输出结构化和轨迹捕获,适用于评估或下游训练流程。
- 个性与 SOUL.md — 完全可定制的 Agent 个性。
SOUL.md是主要身份文件,位于系统提示首位,你可以在每次会话中切换内置或自定义的/personality预设。 - 皮肤与主题(Skins & Themes) — 自定义 CLI 的视觉呈现:横幅颜色、旋转图标及动词、响应框标签、品牌文本和工具活动前缀。
- 插件(Plugins) — 无需修改核心代码即可添加自定义工具、钩子和集成。三种插件类型:通用插件(工具/钩子)、记忆提供商(跨会话知识)和上下文引擎(替代上下文管理)。通过统一的
hermes plugins交互式界面管理。