Hermes Agent 实测:会自我进化的开源 AI 助手

Hermes 是一款开源 AI 助手,能从用户操作中学习并将工作流沉淀为跨渠道可复用技能。
Hermes Agent 是一个定位为「长期运行的个人 AI 助手」的开源项目,核心卖点是自我进化:它会将用户的操作对话固化为可复用的"技能",并在出错后自我诊断、把修复方案永久记住。部署上,需要一台 VPS(推荐 4 核 8G/Ubuntu 24.04)并通过向导化流程接入 Telegram,整体比同类项目 OpenClaw 更顺畅。技能一旦创建便可跨手机语音、命令行、WhatsApp 等渠道通用,共享同一记忆与上下文。官方 awesome-hermes-use-cases 仓库还提供了金融交易、实时语音通话、Web 前端等丰富玩法。运行需自备 VPS 和 LLM 订阅或 API,存在一定成本门槛,「比 OpenClaw 更稳定」为单一来源主观评价,实际效果仍需自行验证。
一个能"越用越聪明"的开源 AI 助手
Hermes Agent 是一个开源的 AI 助手项目,定位与 OpenClaw 相似,但它最大的卖点在于自我进化——它会从你的每一次操作中学习,把你的工作流沉淀为可复用的"技能"(skills),并随着使用不断打磨优化。用得越多,它就越懂你。
需要先厘清 Hermes 的定位:它不是 Codex、Claude Code 这类编程 Agent 的替代品,也不是 ChatGPT 这样的对话工具,而是一个长期运行的个人 AI 助手。它可以设置提醒、闹钟,在获得授权后读取邮件,甚至帮你打理日常事务。核心理念是「一个和你共同成长、专属于你的 Agent」。
据这位 YouTube 创作者的实测体验,相比 OpenClaw,Hermes 明显更稳定、更少报错、更易上手。他回忆第一次配置 OpenClaw 时遇到大量问题,而部署 Hermes 几乎一次成功,大部分功能第一次尝试就能跑通。这一点是本文作者的主观评价,仅代表单一来源观点。
从零部署:VPS + Telegram 全流程
要让 Hermes 24 小时在线运行,需要先准备一台 VPS(虚拟专用服务器)。视频中使用的配置是 4 核 CPU、8GB 内存,运行 Ubuntu 24.04 LTS,足以支撑 Hermes 的日常负载。

登录服务器后,安装流程相当直接。先执行 sudo apt update 更新软件源,再安装关键依赖 libatomic1,否则 Hermes 无法正常安装。

随后从官网复制安装命令粘贴执行,剩下的基本就是跟着向导走。安装向导提供三种模式:
- Quick setup:使用官方托管的门户服务(proprietary)
- Full setup:自己配置全部选项(视频选择此项)
- Blank state:所有功能关闭的空白状态
最关键的一步是选择智能来源:可以用订阅、API Key 或本地模型。视频中选择了 OpenAI ChatGPT Codex 订阅,通过浏览器打开链接、输入验证码即可完成授权(首次使用可能需要在 OpenAI 安全设置中开启设备码授权)。模型则选了较省钱的 5.4 mini。
VPS(Virtual Private Server,虚拟专用服务器)是通过虚拟化技术从物理服务器上划分出的独立云主机,用户拥有完整的 root 权限,可以全天候运行后台服务,而不像本地电脑那样受限于开机状态和家庭网络。常见的 VPS 服务商包括 DigitalOcean、Linode、Vultr、Hetzner 等,月费从几美元到几十美元不等,取决于配置。对于 Hermes 这类需要 24 小时在线、随时响应消息的 Agent,VPS 是最低成本的部署方案——它避免了把个人电脑长期开机的能耗与噪音问题,也比自建服务器更容易维护。Ubuntu 24.04 LTS 中的"LTS"代表 Long-Term Support(长期支持),官方提供五年安全更新,是服务器部署的主流首选。
Telegram 一键接入与工具配置
消息平台环节,视频选择了 Telegram 作为与助手的沟通渠道。

对比 OpenClaw 需要手动找 BotFather 创建 Bot、填 ID 的繁琐流程,Hermes 提供了自动化路径:直接生成链接创建 Bot,系统还会自动检测你的 Telegram 用户 ID,无需手动获取。这种"开箱即用"的体验正是它相对 OpenClaw 的优势所在。
接下来是一系列工具开关,包括图像生成、视觉识别、文件操作、终端命令、定时任务(cron jobs)、Spotify 集成等,大多可保持默认。浏览器使用选择本地的 browser use,语音合成用免费的 Microsoft Edge TTS,搜索引擎选 Exa 免费版。

值得留意的是,Telegram 相关配置需要重复设置一遍(搜索、图像、TTS 等)。最后一步选择将 gateway 安装为后台服务,确保 Agent 全天候运行。安装完成后,可以用 hermes 直接进入命令行、hermes config edit 修改配置、hermes setup 重跑向导、hermes doctor 检查运行状态。
学习循环实战:把对话变成可复用技能
这是 Hermes 最具特色的部分。视频演示了一个完整的"技能诞生"过程:
首先给 Agent 下达任务——「汇总过去七天重要的 AI 模型发布,来源仅限 Hacker News」。它调用了 grounded citations 技能,抓取 Y Combinator 网站内容并生成摘要。接着追加指令「转成 PDF 并发到聊天里」,它自动调用内置的 PDF 技能完成排版,全程无需手动配置。
关键一步来了:满意结果后,作者说「把这个流程变成一个技能,以后我只要说『每周 AI 摘要』就执行这套操作」。Hermes 用一个叫 skill authoring 的技能,将整段对话固化为名为 weekly AI summary 的可复用技能。
更值得关注的是技能跨渠道通用——无论从手机语音、命令行终端还是 WhatsApp,只要触发"weekly AI summary",同一个技能都会生效,因为它们共享同一套记忆与上下文。作者甚至用语音备忘录直接触发,系统转录文字后自动执行。
Hermes 的"技能"(skill)机制在设计理念上类似于宏录制或 RPA(机器人流程自动化),但底层由大语言模型驱动。传统宏录制依赖精确的点击坐标与固定步骤,一旦界面变动即失效;而 Hermes 的 skill authoring 将一段自然语言对话的意图与操作路径抽象为结构化的描述,再由模型在下次调用时动态解析执行。这意味着技能对环境变化有一定容错能力,也可以被自然语言触发,而不需要记忆特定命令格式。Grounded citations 是指在生成内容时附带可验证来源链接的能力,能有效减少模型"幻觉"——对于需要准确性的资讯汇总场景尤为重要。
自我修复:错误也能沉淀为经验
视频里最能体现"自我进化"的,是一个 cron 定时任务的调试过程。作者要求创建一个每天定时抓取近 24 小时 AI 资讯并推送 PDF 到 Telegram 的任务,结果第一次没触发成功。
作者直接问 Agent「我的结果呢?发生了什么?」,Hermes 自己诊断出问题:cron 在 21:30 之后才触发,旧的检查逻辑返回了静默状态而非生成 PDF。它随即修正触发条件——改为按小时和分钟检查,而非精确到秒。
这正是作者反复强调的核心价值:「它第一次几乎从不成功,但一旦搞清哪里出错,它就能把修复方案作为技能永久记住」。系统不是简单执行任务,而是在与用户的磨合中持续变强。经过重新调度,任务最终在 21:35 成功运行,约 3 分半钟就交付了 PDF 摘要。
玩法远不止于此:use cases 灵感库
视频展示的只是最基础的 Telegram 连接与简单自动化。官方有一个名为 awesome-hermes-use-cases 的 GitHub 仓库,提供大量玩法灵感:
- 金融交易:例如在 Polymarket 上做天气预测交易,仓库提供 MD 文件说明思路
- 前端界面:接入 Open WebUI 作为浏览器聊天界面
- 实时语音:Hermes live voice 插件支持持续、可打断的语音会话,相当于能和 Agent 打电话
整体思路清晰:把 Agent 部署在 VPS 上,通过任意即时通讯工具连接,用文字、语音甚至通话与它交互。它学习你的工作流与处理习惯,逐渐成为专属于你的完美助手。
Open WebUI 是一个开源的本地化聊天界面项目,设计初衷是为 Ollama 等本地模型提供类 ChatGPT 的操作体验,支持多模型切换、对话历史管理、插件扩展等功能。将其与 Hermes 对接后,用户可以通过浏览器以图形界面与 Agent 交互,适合不习惯命令行或 Telegram 的用户。Polymarket 是一个基于区块链的预测市场平台,用户可以对现实世界的事件结果(如选举、天气、体育赛事)下注,价格反映市场对该事件发生概率的集体判断。将 AI Agent 接入预测市场,本质上是让模型自动分析信息、评估概率并执行交易指令,属于 AI 与 DeFi 结合的前沿实验性玩法,风险较高,仅适合有相关经验的用户尝试。
小结
Hermes Agent 值得关注的地方,在于它把"Agent 会学习"这件事做成了可感知的产品体验——技能可沉淀、可跨渠道复用、出错后能自我修复。加上相对顺畅的部署流程,对想拥有一个 24 小时在线私人助手的用户来说是个不错的开源选择。当然,「比 OpenClaw 更稳定」是视频作者的单一来源主观体验,实际效果仍需读者自行验证。此外,运行它需要自备 VPS 和 LLM 智能来源(订阅或 API),存在一定成本门槛。
相关推荐

Firebase 8月更新:AI Logic 安全升级与 CLI Agent 模式详解
Firebase 8月版本更新详解:AI Logic 默认开启 App Check 安全防护、新增 Gemini 模型与 TTS,Firebase CLI 支持 AI Agent 非交互模式,Firestore 安全规则可视化管理,以及 Extensions 与 Firebase ML 的弃用迁移路径。

无需写代码:用Microsoft Foundry门户搭建你的第一个AI智能体
无需编写代码,使用Microsoft Foundry门户从零搭建生产就绪的AI智能体:部署模型、构建agent、接入MCP工具、检查traces追踪并运行评估的完整可视化流程。

微软四大IQ详解:为AI智能体提供上下文的接地能力
微软 Build 推出的 Foundry IQ、Fabric IQ、Work IQ、Web IQ 四大能力究竟是什么?本文解析这四种接地能力如何分别为 AI 智能体提供知识、业务数据、办公应用与实时网络的上下文支持。