Hermes智能体八大更新实测:AI自动化与自我进化全解析

AI Agent 从对话到自主行动
AI Agent(智能体)的概念源于多年前的人工智能研究,但真正进入实用阶段是在大语言模型(LLM)兴起之后。传统聊天机器人只能被动响应单轮或多轮对话,而 Agent 的核心区别在于具备"规划-执行-反馈"的闭环能力:它可以将一个复杂目标分解为多个子任务,调用外部工具(如浏览器、文件系统、API),并根据执行结果动态调整策略。
推动这一演进的关键技术包括 ReAct(Reasoning + Acting)框架、函数调用(Function Calling)以及工具使用(Tool Use)能力。要理解 ReAct 的突破性意义,需要先了解其前身——思维链(Chain-of-Thought, CoT)提示技术。CoT 由 Google Brain 团队于2022年在论文《Chain-of-Thought Prompting Elicits Reasoning in Large Language Models》中正式提出,核心发现是:当模型被引导逐步输出中间推理过程时,复杂数学和逻辑任务的准确率显著提升。CoT 的灵感来源可追溯至更早的"scratchpad"研究——让模型在输出最终答案之前先生成"草稿纸式"的中间步骤,本质上是模拟人类解题时的逐步演算过程。然而 CoT 的根本局限在于,推理链完全在模型的"想象空间"中进行,无法获取最新信息或验证外部事实,因而容易产生"幻觉"(Hallucination)——即模型以高度自信的口吻生成与事实不符的内容,这在需要引用实时数据或精确计算的场景中尤为致命。
ReAct 由谷歌研究团队于2022年提出(出自论文《ReAct: Synergizing Reasoning and Acting in Language Models》),其核心思想是将语言模型的"推理"(生成思维链)与"行动"(调用外部工具)交织进行,形成"思考→行动→观察→再思考"的迭代循环。与 CoT 的关键区别在于:ReAct 将搜索引擎查询、计算器调用等外部操作结果作为真实"观察"注入推理链,从而将模型的推理根植于可验证的现实反馈之上,从根本上克服了纯推理模式下信息"幻觉"的问题。值得注意的是,ReAct 框架与强化学习中的"行动-奖励"循环存在概念上的呼应:外部工具的返回结果扮演了即时反馈信号的角色,引导模型在下一步推理中修正方向——只是这里的"修正"发生在上下文层面而非权重层面。这些技术使模型不再局限于生成文字,而是真正能与外部世界交互。
AI Agent(智能体)正在从"能对话"迈向"能自主干活"的新阶段。近期,Hermes 智能体迎来了被作者称为"史上最大更新"的版本,一次性带来八项重要功能升级。本文基于 B站UP主的实测演示,梳理这次更新的核心变化,并分析它对个人自动化工作流意味着什么。
移动端接入:原生 iMessage 支持
这次更新最直观的变化,是 Hermes 智能体开始原生支持 iMessage。用户可以直接在 iPhone 上通过短信应用与自己的智能体对话,无需再打开专门的 App。
据UP主演示,他在外出途中发送一句"告诉我美光股价和今天波动的原因",智能体便直接在 iMessage 中完成查询并回复,且支持全部富媒体功能。更关键的是,这个移动端入口直接连接着桌面端的 Hermes——也就是说,你在手机上发一句指令,它可以在你的电脑上打开浏览器、移动文件,甚至在本地部署模型。

技术实现上,这一切通过一个名为 Photon 的免费服务运行。理解这里的技术架构需要先了解 iMessage 本身的安全设计:iMessage 基于苹果的 APNS(Apple Push Notification Service) 构建——这是苹果于2009年推出、覆盖全球数十亿设备的推送基础设施。APNS 采用长连接的持久化 TCP 通道,使服务器能够主动向设备推送消息,而无需设备频繁轮询,这一设计大幅降低了移动端的电量消耗,成为现代移动推送的架构范本。iMessage 在此之上叠加了完整的端对端加密(E2EE)体系:发送方设备首先从苹果 Identity Service(IDS)服务器获取收件方的公钥证书,使用**椭圆曲线 Diffie-Hellman(ECDH)**协议协商会话密钥,再以 AES-128-CTR 模式加密消息正文,消息签名则采用 ECDSA 算法防止篡改。整个加密过程在设备本地完成,苹果服务器仅负责密文的存储与转发,理论上苹果自身也无法解读内容。ECDH 之所以被广泛采用于移动通信加密,在于其相比传统 RSA 能以更短的密钥长度(256位即可达到 RSA 3072位的安全强度)实现等效安全性,显著降低了移动设备的计算开销。
然而,正因为这套加密架构的封闭性,第三方服务若要接入 iMessage 生态,通常借助"虚拟号码"方案:申请一个真实可收发短信的号码,通过 SMS 网关桥接到自定义后端逻辑。Photon 正是扮演这一中间层角色,负责号码的分配与消息的双向路由。需要特别注意的是,这种桥接方式意味着消息在到达苹果生态之前需经过第三方服务器的明文中转,打破了原生 iMessage 的安全链条。这一安全风险的本质是"信任边界的转移"——用户原本只需信任苹果,现在还需信任 Photon 服务的数据处理政策与服务器安全防护。用户在传输账户密码、财务信息等敏感内容时需审慎权衡。这种设计的优势在于零 App 安装门槛,但隐私边界是使用者必须清醒认识到的代价。
作者也给出了实用的使用分工建议:出门在路上用 iMessage 发快捷指令,坐在电脑前用桌面应用,需要处理多话题的复杂深度任务时则用 Telegram(因其支持话题分组)。
后台智能体与子智能体树:告别长任务阻塞
第二项更新解决了 AI Agent 使用中的一大痛点:长任务阻塞。
过去在 Hermes 中,后台智能体需要手动开启开关。所谓后台智能体,是指让主智能体创建"子智能体"在后台执行任务,从而不占用主对话通道。此前布置一个长任务,往往需要干等数小时才能继续交互。
现在,后台智能体变为自动触发——只要提示词足够复杂,系统就会自动派生子智能体。作者演示了一个"为多家已投资AI公司撰写复杂研究报告"的任务,系统随即启动了 5 个子智能体并行执行 28 次工具调用。
子智能体(Sub-agent)架构本质上是多智能体系统(Multi-Agent System, MAS) 在个人工具中的落地实践。MAS 是分布式人工智能的核心研究领域,其理论根基可追溯至1980年代 Victor Lesser 等人在黑板系统(Blackboard System)上的开创性工作——黑板系统以一块共享的"黑板"数据结构作为多个专家模块的通信媒介,各模块异步读写黑板上的中间结果,这一思想直接影响了后来的 MAS 协调理论。MAS 长期聚焦于协调(Coordination)、通信(Communication)与协商(Negotiation)三大核心问题。在现代 LLM Agent 的实现中,这一理论被映射为"Orchestrator-Worker"模式:主智能体负责任务分解、优先级排序和结果聚合,工作智能体专注执行原子化子任务。并行执行的工程挑战主要有两个:一是上下文隔离,每个子智能体需要独立的 Token 预算以防止信息干扰;二是工具竞争,多个子智能体同时访问同一资源(如文件系统)时需要锁机制或队列管理,防止数据竞争——这与操作系统中经典的"读写者问题"(Readers-Writers Problem)在本质上属于同一类并发控制挑战。这与 OpenAI 的 Swarm 框架、Anthropic 的 Claude 多 Agent 方案、微软的 AutoGen 思路一致,区别在于 Hermes 将其封装为消费级产品,并提供可视化的"子智能体树"让普通用户也能监控执行状态。
配合这项功能的是全新的**子智能体树(sub-agent tree)**可视化界面。用户可以点进去实时查看每个子智能体正在做什么、调用了哪些命令。更妙的是,在子智能体工作期间,用户依然可以与主智能体继续对话——比如临时补充"把英伟达也加进研究列表",系统会再派生一个子智能体去处理。这种"边聊边干"的并行体验,是 Agent 走向实用化的关键一步。
MCP 生态扩展:从 Unreal Engine 到桌面端体验升级
第三项更新颇具想象力:Unreal Engine 5.8 的 MCP 支持。

要理解这项更新的意义,需要先了解 MCP(Model Context Protocol) 的技术规范与战略价值。MCP 于2024年11月由 Anthropic 开源发布,其设计目标是解决 AI 工具集成的"M×N 问题":此前每种 AI 模型要接入每种外部工具,都需要定制化的集成代码,M 个模型与 N 个工具之间需要 M×N 个适配器,开发成本极高且生态碎片化严重。这一困境与2000年代初期 Web Service 集成领域极为相似——彼时 SOAP 协议试图通过复杂的 WSDL 描述文件解决异构系统互联问题,但其高度复杂性最终催生了更轻量的 REST 规范取而代之。MCP 在某种程度上正在扮演 AI 工具集成领域"REST 化"的历史角色。
MCP 在技术层面基于 JSON-RPC 2.0 规范构建——这是一种轻量级的远程过程调用协议,广泛应用于语言服务器协议(LSP)等开发工具生态中。JSON-RPC 2.0 的设计哲学是"极简主义":仅定义请求(Request)、响应(Response)和通知(Notification)三种消息类型,不绑定任何传输层协议,使其既可运行于 HTTP 之上,也可通过 Unix Socket 或 stdio 管道通信。MCP 定义了三类核心原语:Resources(结构化数据,如文件内容、数据库记录)、Tools(可执行操作,如发送邮件、查询 API)和 Prompts(可复用的提示词模板)。MCP Server 通过标准化的 Schema 声明自身能力,所有兼容的 AI 客户端(如 Hermes)作为 MCP Client,按协议发现并调用这些能力,整个交互过程对底层传输层(stdio、HTTP/SSE 等)保持无感知。这与 Web 领域的 REST API 规范、硬件领域的 USB 协议扮演着相似的标准化角色——Anthropic 选择完全开放规范,换取开发者社区的广泛采纳,这与当年 Google 开放 Android 生态的策略如出一辙。截至2025年,已有 GitHub、Slack、Figma、Stripe 等数百个主流服务发布官方 MCP Server,MCP 正在成为 AI 工具集成领域事实上的行业标准。
Unreal Engine 作为最流行的游戏引擎之一,首次通过 MCP 向 AI 开放意味着用户可以直接用 Hermes 智能体来搭建复杂的三维游戏——用自然语言指令创建关卡、放置资产、调整光照,从 FPS 到第三人称射击皆可实现。Unreal Engine 本身拥有成熟的蓝图(Blueprint)可视化脚本系统和 Python 自动化 API,MCP 集成实际上是在这些现有接口之上架设了自然语言层,将原本需要专业开发者掌握的引擎操作转化为普通用户可用的对话指令。相比过去用 3JS 做浏览器小游戏,接入 Unreal 后可以做出更专业、可发布到 Steam 的作品,且整个过程"不用花一分钱"。这也体现出 MCP 协议正在把 AI Agent 的能力边界从纯软件操作扩展到专业创作工具领域。
第四项则是桌面端应用的多项体验优化:
- 多窗口支持:右键任意聊天记录即可在独立窗口打开,首次实现多个 Hermes 智能体并排同时运行;
- 模型选择器:底部新增快捷切换入口,无需再输入斜杠命令或翻配置文件,还能选择思考级别;
- 内置终端:在 Hermes 内直接打开终端跑命令,无需切换到外部终端应用。
个人档案、技能中心与自我进化
第五、六项更新围绕**仪表盘(Dashboard)**展开。在终端输入 Hermes Dashboard 即可打开网页化的管理界面。

其中重点是全新的个人档案(Profile)构建器。个人档案用于快速启动多个不同定位的智能体——作者自己就配置了默认 Hermes、负责编程的 GPT-MES、以及管理记忆的 Librarian 等多个档案。过去搭建档案需要手动改配置文件,现在通过引导式流程即可轻松完成。个人档案在架构上类似于操作系统的用户账户切换或浏览器的"配置文件"功能——每个档案拥有独立的系统提示、工具权限集合与记忆隔离空间,使同一套底层模型能呈现出截然不同的行为特征与专业深度。
第六项是技能中心(Skill Hub)。智能体的"技能(Skill)"在 Hermes 体系中以 Markdown 文件形式存储,本质上是结构化的提示词模板与工具调用说明的集合,类似于传统软件的插件或脚本。技能中心的社区共享模式借鉴了 VS Code 插件市场或 npm 包管理器的生态逻辑,允许用户发布、复用他人的自动化能力。值得注意的是,以纯文本 Markdown 作为技能载体是一种刻意的设计选择:相比编译后的二进制插件,Markdown 格式使普通用户无需任何编程知识即可阅读、审查甚至手动修改技能内容,这在一定程度上降低了恶意代码注入的安全风险——但也意味着提示词注入(Prompt Injection)攻击面的存在,即恶意技能文件可能通过精心构造的指令欺骗智能体执行非预期操作。用户不仅能查看已安装技能,还能浏览成百上千的社区技能,并查看详情做安全检查。作者分享了一个值得借鉴的实践:与其直接下载技能,不如拿到技能的 MD 文件后,让智能体"自己做一个安全的定制版本",专门适配自己的使用场景。

第七项最能体现 Agent 的进化能力:更智能的记忆与技能自我编辑。Hermes 现在会更频繁地自主创建、寻找并更新技能,形成持续的自我改进循环。
这一"自我进化"机制的技术核心在于 in-context 优化,其能力积累模式与认知科学中的"程序性记忆"(Procedural Memory)有着深刻的类比关系。传统机器学习通过梯度下降更新模型权重来实现学习,成本高昂且需要大量数据。而 in-context 优化不触碰底层权重,而是将"经验"以结构化文本的形式写入提示词模板、工具调用说明或记忆文件,在下次调用时作为上下文注入模型,从而改变其行为输出。从信息论的角度来看,in-context 优化本质上是在利用 LLM 强大的"上下文学习"(In-Context Learning, ICL)能力——大模型在预训练阶段已经学会了如何从少量示例中归纳模式,持久化存储的技能文件正是在每次会话开始时为模型提供这样的"few-shot 示例",引导其复现过去成功的行为策略。这与认知心理学中程序性记忆("如何骑自行车"的技能性知识)的运作方式高度相似——经验通过重复实践逐渐内化为可自动调取的能力模式。Hermes 通过将技能以持久化 Markdown 文件存储,使优化成果能跨会话保留,形成类似"程序性记忆"的长期能力积累——智能体在使用某项技能时,若遭遇错误或效果不佳,会将失败案例写入记忆,并在后续对话中主动修订技能文件。这种方式迭代速度极快(一次对话即可生效)、成本接近零,代价则是依赖外部存储系统的可靠性以及对上下文窗口长度的持续消耗。
作者以 Unreal Engine MCP 技能为例——初期使用略显生疏,但在几次对话后,智能体不断修补优化自身技能,最终对该工具驾轻就熟。这种自我进化机制意味着:用户只需多下指令、多派任务,系统会随着使用自动打磨能力。
Telegram 富文本格式化
第八项更新对应 Telegram 平台的全面集成。智能体现在可以在 Telegram 中输出表格、列表、加粗等丰富格式。作者演示中,智能体生成了一份完整的股票表格,包含描述、股价、市值等字段,排版整洁清晰,文字滚动也更加流畅。这一改进的底层技术依托于 Telegram 的 Bot API 与其自有的 MarkdownV2 及 HTML 两套富文本渲染规范——Telegram 的富文本支持在即时通讯软件中属于相对开放的体系,开发者可通过官方 Bot API 精确控制消息的排版样式,这也是它相比 iMessage、WhatsApp 等更适合作为 Agent 输出载体的重要原因。这一改进让 Agent 返回的数据告别难读的纯文本,实用性明显提升。
总结:AI Agent 走向"可并行、能自进化"
综观这八项更新,可以看到当下 AI Agent 产品演进的几条主线:多入口接入(iMessage/Telegram/桌面)降低使用门槛,后台与子智能体并行打破长任务阻塞,MCP 生态扩展让 Agent 触达专业工具,而技能中心 + 自我进化则构建了持续增强的能力闭环。
从更宏观的视角来看,这些演进方向折射出整个 AI Agent 行业的技术共识:ReAct 式的推理-行动闭环正在成为标配,MCP 协议正在统一工具集成的碎片化生态,而 in-context 优化则提供了一条无需重新训练即可持续进化的低成本路径。值得关注的是,这三条技术路线在成熟度上存在明显差异:ReAct 框架已有充分的学术验证,MCP 协议正处于快速扩张的早期标准化阶段,而 in-context 优化的长期可靠性——尤其是在复杂任务中技能文件膨胀导致的上下文污染问题——仍有待工程实践的检验。Hermes 的价值在于将这些企业级概念封装为普通用户可以上手的消费品,尽管在隐私边界(如 iMessage 的第三方中转)和技能安全审查方面仍需用户保持足够的自主判断。
需要提醒的是,本文基于单一UP主的实测演示,其中带有一定的推广色彩(如反复出现的社区推荐),读者在实际使用时仍需结合自身场景验证功能表现,尤其是安装第三方技能时务必做好安全检查。对于关注个人 AI 自动化工作流的用户来说,这次更新提供了不少值得尝试的新范式。
核心要点
核心要点
核心要点
相关推荐

WorkBuddy安装MCP连接器与Skill技能同步完整教程
详解WorkBuddy安装本地MCP连接器,通过AI对话实现Skill技能在Cursor等多个AI工作台间一键迁移与自动同步的完整操作流程。

激光雷达揭秘古城:LiDAR如何重写失落文明史
探索LiDAR激光雷达技术如何穿透沙漠与丛林,揭示约旦塞拉古城的地下水窖系统和太平洋南马都尔水上巨城的隐藏建筑,重新书写失落文明的历史。

阿波罗计划的灾难与荣耀:重返月球前必须回望的历史
从阿波罗1号的致命火灾到阿波罗8号的绕月冒险,再到阿波罗11号的成功登月,回顾阿波罗计划中那些鲜为人知的灾难、恐惧与妥协,以及对当下重返月球的深刻启示。