开源Agent工具Proma v0.15:Pi内核上线,兼容全主流大模型

文章正文
开源通用 Agent 工具 Proma 迎来了 v0.15.0 大版本更新,最核心的变化在于:它现在支持使用 Pi(PyAgent)作为运行内核。这一改动不仅提升了工具的自由度和执行效率,也为后续更大的功能升级铺平了道路。本文基于 B 站作者的更新演示,梳理这次版本迭代的关键信息与背后的设计思路。
Pi 内核:告别单一格式,兼容所有主流大模型
此次更新最重要的改进,是 Proma 将运行内核切换到了 Pi(PyAgent)。在 Agent 模式下,用户现在可以在三种内核之间自由选择:Claude、Agent SDK,以及新增的 Pi。
理解"内核"的含义:Pi(PyAgent)是一种基于 Python 的 Agent 执行内核,其核心职责是管理大语言模型与工具调用(Tool Calling)之间的编排循环。在现代 Agent 框架中,"内核"(Runtime Kernel)决定了任务分解、工具调用序列、错误恢复以及上下文管理等底层行为。不同内核在稳定性、兼容性和调度灵活性上差异显著——Claude 内核通常与 Anthropic 的原生 API 深度绑定,其工具调用协议采用专有的 tool_use / tool_result block 结构,与 OpenAI 的 function_calling 格式存在根本性差异,这使得基于 Claude 内核构建的 Agent 框架难以平滑迁移到其他模型。
值得注意的是,Pi(PyAgent)的设计哲学本身源于对早期 Agent 框架在生产环境中暴露出的工程化痛点的系统性反思。以 LangChain 的 AgentExecutor 为例,其早期版本将模型调用与工具编排逻辑高度耦合,导致切换底层模型时需要大量重写上层业务代码;AutoGen 虽然引入了多智能体对话范式,但其会话状态管理在高并发场景下存在明显瓶颈。PyAgent 在此基础上进一步抽象,将"思考-行动-观察"的 ReAct 循环封装为与模型无关的有限状态机(FSM),每个状态转换仅依赖标准化的中间表示(Intermediate Representation),从而在框架层面实现真正的跨模型可移植性。这种架构设计使得 Pi 内核在面对新兴模型(如国产大模型、开源本地模型)时,只需添加对应的适配器(Adapter)而无需修改核心调度逻辑,大幅降低了接入成本。
作者直言,过去依赖 Claude 内核时体验并不稳定——"实在是有点太作了",让人"非常的不保险"。相比之下,Pi 内核经过近期打磨已经相当成熟,Proma 团队目前所有的 debug 和新功能开发都基于 Pi 展开。
更关键的收益在于模型兼容性。过去 Proma 只支持 Anthropic 风格的 message 格式,切换到 Pi 内核后,几乎所有主流大模型的接口格式都能被支持。这一兼容性问题有其深刻的技术背景:当前主流大语言模型 API 在消息格式上存在显著差异,其根源在于各家厂商不同的工程哲学。Anthropic(Claude)偏向"会话即文档"的结构化思路,将系统指令、用户输入与模型输出严格区分存储,并以 XML 风格标签界定工具输出,其 messages 数组结构包含特殊的 system prompt 分离方式;OpenAI(GPT 系列)则更侧重于函数调用的精确性,采用 role/content 键值对,通过 JSON Schema 强约束工具的输入输出规范,工具调用通过 functions 字段或更新的 tools 字段声明,返回格式包含 tool_calls 对象数组;Google Gemini 的多模态优先设计使其 contents + parts 的嵌套结构天然支持文本、图片、音频等混合内容的统一表达,并以 functionDeclarations 定义可调用工具;国内厂商如 DeepSeek、智谱 GLM 等大多兼容 OpenAI 格式,但在细节实现上仍有出入。
Pi 内核通过统一的适配层(Adapter Pattern),将各厂商格式归一化为内部标准表示后再驱动 ReAct 循环,本质上扮演了"协议翻译器"的角色,使用户接入任意大语言模型都可以直接使用完整的 Agent 能力,自由度大幅提升。

作者特别提到 GPT 系列近期表现出色,Proma 官方版本目前为 GPT 系列提供两折折扣,速度也很快,团队近期的开发工作基本都在用 GPT 完成。
Codex 一键授权:ChatGPT 订阅直连 Proma
这次更新还带来了一个实用的授权功能。在添加授权时,用户可以选择 ChatGPT 的订阅选项,进入 Codex 后点击授权按钮,即可将 Codex 直接授权到 Proma 中使用。
关于 Codex 授权机制:OpenAI Codex 最初是 2021 年发布的专为代码生成优化的语言模型(基于 GPT-3 微调),曾作为 GitHub Copilot 的底层引擎。但在当前产品语境中,"Codex"已演变为 OpenAI 面向开发者的云端代码执行与 Agent 服务品牌,其 2025 年推出的新版 Codex 是一个能够在沙箱环境中自主运行、读写代码、执行命令的 AI 编程 Agent,通过 ChatGPT Pro 订阅即可访问。
Proma 的一键授权功能本质上实现了 OAuth 2.0 风格的授权委托流程:用户通过标准的授权跳转将 ChatGPT 账户的访问权限委托给 Proma,Proma 在后台获取对应的访问令牌(Access Token),并将其安全存储于本地加密凭证管理器中。这一流程与主流第三方应用接入 Google、GitHub 账户的授权模式高度相似——用户无需向 Proma 暴露原始账户密码,授权范围受到严格限制,且可随时通过 ChatGPT 账户设置撤销授权。从算力复用的角度看,Proma 将用户已有的 ChatGPT 订阅算力映射到自身调度体系中,避免了重复付费,对于已订阅 ChatGPT Pro(每月 200 美元)的用户而言,Codex 的计算配额可直接在 Proma 更强大的并发调度框架下被更高效地消耗。

这就引出了一个自然的疑问:既然可以直接用 Codex,为什么还要用 Proma?
作者的回答是——Proma 在多个环节做了深度优化。以本次更新为例,Proma 在并行任务处理和子会话管理上的表现都优于 Codex 本身。
在 Agent 系统中,"并行任务处理"指将一个复杂目标拆解为多个可并发执行的子任务,通常基于**有向无环图(DAG,Directed Acyclic Graph)**建模任务依赖关系。DAG 中每个节点代表一个独立子任务,边代表依赖约束——只有所有前置节点完成后,当前节点才能开始执行。通过拓扑排序(Topological Sort)算法,调度器可以识别出哪些节点处于同一"层级"(即无依赖约束),并通过异步事件循环(如 Python 的 asyncio)或线程池同时推进这些独立分支,从而将原本串行的 O(n) 执行时间压缩至接近关键路径长度的理论最优。"子会话管理"则涉及为每个子任务维护独立的上下文窗口(Context Window),防止不同任务的信息相互污染,同时支持父会话对子会话结果的聚合与协调——这在技术上需要实现类似"会话树"(Session Tree)的层级化状态管理结构,并在内存与持久化存储之间实现高效的上下文换入换出。原生 Codex UI 通常只支持单线程对话,而 Proma 这类专用框架可以在调度层实现更精细的并发控制,这正是两者在执行效率上产生显著差距的根本原因。
换句话说,Proma 并不是简单地做一层封装,而是在 Agent 调度和会话编排上构建了自己的核心优势。
"用更多 Token 换更多智能"的产品理念
Proma 的核心产品理念是:用更多的 token 换取更多的智能。作者认为,对很多用户而言,token 算是已经"富裕到用不完"。
这一判断有其坚实的行业背景:Token 成本在过去几年经历了数量级级别的下降。以 GPT-3.5 Turbo 到 GPT-4o mini 为例,每百万 token 的处理费用已从约 2 美元降至 0.15 美元,降幅超过 90%;而 DeepSeek-V3、Gemini Flash 等新兴模型甚至将成本进一步压低至每百万 token 不足 0.1 美元。与此同时,各大厂商的订阅制(如 ChatGPT Plus 每月 20 美元、Pro 每月 200 美元)提供了近乎无限的使用配额,导致大量用户处于"token 富裕"状态——算力已充足,稀缺的反而是能充分利用算力的使用场景与工具。
这种"token 富裕"状态催生了全新的产品设计范式,其理论基础正是近年来 AI 研究领域最重要的发现之一——Test-Time Compute Scaling(推理阶段计算扩展)。OpenAI o1、DeepSeek-R1 等推理模型的成功证明:在推理阶段投入更多计算资源(即生成更长的思维链、执行更多验证步骤),可以在不改变模型参数的前提下显著提升复杂任务的解题质量。这与训练阶段的 Scaling Law(更大模型、更多数据带来更好效果)形成了互补——前者是"训练时买入智能",后者是"推理时消费智能"。当边际成本趋近于零时,合理的策略不是节约 token,而是通过更多的推理步骤(如 Chain-of-Thought、Tree-of-Thought、Self-Consistency 多数投票等)、更丰富的上下文注入和更主动的自动化行为来换取更高质量的输出结果。Proma 的产品哲学正是这一趋势在工具层的具体落地:不是让用户手动节省每一次调用,而是构建自动化的"算力消费引擎",让冗余算力持续转化为用户价值。

基于这个判断,Proma 会在如何利用冗余算力上持续发力。作者透露了几个探索方向:
- 定时任务:让 Agent 在后台按计划自动执行
- 偏好学习:根据用户习惯持续优化行为
- 主动探索:在算力富裕时自动进行一些探索性尝试
为配合这一理念,上次更新已加入实用小功能——所有配置进来的订阅计划都能显示剩余用量。作者自己就把多个订阅(包括 Codex 订阅)都配置了进来,可以直观看到各渠道的剩余额度,从而更合理地分配和消耗算力。
开源版与商业版:灵活选择,按需使用
Proma 提供开源版和商业版两种选择:
- 开源版:可接入各种折扣模型,性价比高,用户可自由配置各类订阅计划。项目目前已获得约 1.25k star,欢迎社区参与 star、fork、PR。
- 商业版:针对第三方订阅访问稳定性问题,商业版依托 Proma 自有渠道,用户充值少量费用即可体验更多功能,保障使用稳定性。
这种开源与商业并行的双轨模式,在 AI 工具生态中已形成成熟的商业化路径——开源版本承担社区建设与技术验证的功能,贡献者通过 PR 和 Issue 持续改善产品质量,形成正向飞轮;商业版则通过 SLA 保障、专属渠道和高级功能实现收益,反哺开源研发投入。这与 LangChain(LangSmith 商业化)、AutoGen(Azure 集成)等主流 Agent 框架的商业化策略一脉相承,也印证了"开源引流、商业变现"在开发者工具领域的普遍适用性。对于企业用户而言,商业版的稳定性保障和专属渠道意味着更低的运维风险;而对个人开发者和研究者来说,功能完整的开源版已足以满足大多数探索性需求。

作者坦言,v0.15.0 并没有带来大量全新功能,更多是完成了内核层面的底层切换。但正是因为完成了向 Pi 内核的迁移,Proma 才获得了更高的自由度——团队将从现在开始着手推进较大规模的新功能更新。
小结
Proma v0.15.0 是一次"打地基"式的版本迭代。Pi 内核的引入解决了两个关键问题:一是通过统一适配层摆脱了对单一模型格式的依赖,实现全主流大模型兼容;二是为团队后续功能开发提供了更稳定、更灵活的基础。
对于关注开源 Agent 工具的用户来说,Proma 在并行任务、会话管理上的优化,以及"用 token 换智能"的产品理念,都值得持续关注。随着底层内核趋于稳定,Proma 接下来有望带来更多围绕自动化与主动探索的实用新功能——在算力成本持续走低、Test-Time Compute Scaling 理念日益普及的大背景下,这类"主动消耗算力"的 Agent 工具或许将成为效率工具的下一个重要方向。当训练时代的 Scaling Law 红利趋于饱和,推理阶段的算力调度能力将成为下一个关键差异化维度,而 Proma 这类专注于 Agent 编排的工具,正站在这一范式转变的前沿。
核心要点
相关推荐

开源权重模型之争:安全与开放如何平衡
深入分析开源权重模型的核心争论:模型权重公开发布带来透明度与创新,但也引发安全滥用风险。本文探讨分级发布、红队测试等折中方案,解读开源AI背后的行业博弈与治理挑战。

抱怨如何侵蚀你的心智:注意力自我强化效应解析
习惯性抱怨正在训练大脑发现更多负面信息,形成恶性循环。本文从注意力自我强化机制出发,解析抱怨的心理侵蚀过程,并提供主动管理注意力、跳出负面循环的实用方法。

Steam恶意软件溯源:比特币、Cookie和外卖订单如何锁定攻击者
一起Steam恶意软件案件中,调查人员通过比特币交易链、Google Cookie和Uber Eats外卖订单三条线索交叉验证,成功溯源攻击者真实身份。深入解析数字取证技术与匿名幻觉。