DeepSeek开源Harness框架:AI竞争从模型转向智能体与基础设施

过去两周的AI行业可谓神仙打架,从开源框架到前沿数学突破,再到晶圆级芯片带来的推理提速,五大热点密集释放。一个清晰的信号正在浮现:AI竞争的主战场,正从单一模型能力向智能体框架、底层基础设施与生态体系全面扩散。本文将逐一拆解这些关键节点,并分析背后的行业走向。
DeepSeek开源Harness:从模型竞争到智能体框架竞争
8月13日,DeepSeek以MIT协议开源了智能体框架Harness,同时旗舰模型V4 Pro正式版同步上线,Agent能力全面升级。这标志着开源竞争已经从模型本身向上延伸到了智能体框架层。
MIT协议是目前最为宽松的开源许可证之一,允许任何人自由使用、修改、分发代码,甚至用于商业项目,唯一要求是保留版权声明。相比GPL协议要求衍生作品也必须开源、Apache 2.0增加专利授权条款,MIT协议意味着企业可以将Harness框架直接集成到闭源商业产品中,无需担心法律风险。这极大降低了采用门槛,也是该项目能在极短时间内获得海量关注的重要原因之一。
Harness的核心设计理念是「一切皆插件」——模型、工具、缓存、沙箱、UI等所有组件全部可插拔、可替换。这种彻底解耦的架构,让开发者能够像搭积木一样自由组合智能体的各个模块,极大降低了构建复杂Agent系统的门槛。
要理解Harness的定位,需要了解智能体框架在AI技术栈中的角色。智能体(Agent)框架是介于大语言模型与最终应用之间的中间层软件架构,负责编排模型调用、管理工具使用(如搜索引擎、代码执行器、数据库查询)、处理上下文记忆、协调多步骤任务流程。当前主流的智能体框架包括LangChain、AutoGen、CrewAI等,但它们往往存在耦合度高、扩展性受限的问题。Harness采用的「一切皆插件」设计哲学,本质上是将微服务架构的思想引入AI系统,每个组件通过标准化接口通信,开发者可以在不改动其他模块的前提下替换任意单元——比如将底层模型从DeepSeek换成Claude,或将向量数据库从Pinecone换成Milvus。这种极致的解耦程度在此前的开源智能体框架中十分罕见。
值得进一步说明的是,微服务架构最早在2010年代的互联网公司(如Netflix、Uber)大规模普及,其核心理念是将单体应用拆分为多个独立部署、独立扩展的服务单元,每个服务通过API(应用程序编程接口)进行通信。将这一思想引入AI智能体领域意味着:开发团队可以由不同小组分别维护记忆模块、工具调用模块、模型路由模块等组件,独立迭代而不相互阻塞。这对于企业级部署尤为重要——当某个组件出现性能瓶颈或安全漏洞时,可以单独升级而不影响整体系统的运行。此外,插件化架构还天然支持A/B测试,企业可以同时运行多个模型版本并实时对比效果,这在传统紧耦合框架中几乎不可能实现。
开源的影响力立竿见影。据统计,GitHub仓库公开后仅12小时内便狂揽5万星标,成为史上增长最快的开源项目之一。

这一现象背后反映出一个趋势:MIT宽松协议加上高度模块化的设计,正在成为开源项目快速扩散的关键组合。当模型能力逐渐趋同,谁能提供更完善的智能体基础设施,谁就能在生态争夺中占据先机。
Claude挑战黎曼猜想:AI在前沿数学领域的实质突破
第二个重磅热点来自Anthropic。据披露,研究版Claude自主攻关约一天半时间,将黎曼Zeta函数零点下界从41.6%提升到67.2%,并给出了可形式化验证的结果。

要理解这一成果的分量,需要了解黎曼猜想的背景。黎曼猜想是数学史上最著名的未解决问题之一,由德国数学家黎曼于1859年提出,被列为克雷数学研究所七大千禧年奖励问题之一,悬赏百万美元。该猜想断言黎曼Zeta函数所有非平凡零点的实部都等于1/2。零点下界问题是该猜想的一个重要子方向——研究者试图证明在临界线上的零点比例至少达到某个百分比。此前最好的结果由Conrey在1989年证明的41.6%,这一纪录保持了数十年之久。Claude将这一比例大幅提升至67.2%,意味着我们对零点分布的理解取得了量级上的进步。
为了更好地理解零点下界41.6%到67.2%这一跃升的数学意义:黎曼Zeta函数的非平凡零点分布直接关联着素数在自然数中的分布规律——这是数论的核心问题。如果黎曼猜想完全成立,则100%的非平凡零点都在临界线上。Conrey的41.6%意味着我们只能确认不到一半的零点符合猜想预测;而67.2%则意味着我们可以确认超过三分之二的零点在临界线上,这不仅是数值的提升,更可能意味着证明方法论的根本性突破——因为从41.6%到67.2%的跨越,通常需要引入全新的数学工具或分析技巧,而非简单的参数优化。
这项工作的技术细节同样值得关注:Claude调度了约60个子智能体协同作业,累计消耗约3100万Token。这种大规模多智能体协作的模式,恰好印证了智能体框架的价值所在——单一模型难以完成的复杂任务,正在通过智能体编排的方式被逐步攻克。
从经济和技术角度进一步分析这一数据:3100万Token的消耗在当前API定价体系下意味着可观的计算成本。以Claude最新定价粗略估算,这次数学攻关的直接API成本可能在数万至十几万美元量级。而60个子智能体的协同作业涉及复杂的任务分解与结果汇聚机制:主智能体负责将大问题拆分为可并行处理的子问题,各子智能体独立探索不同证明路径,然后通过评估机制筛选有效结果并合并。这种模式类似于蒙特卡洛树搜索在围棋中的应用,通过大规模并行探索来发现人类难以直觉到达的证明路径。能够在一天半内完成这一人类数学家花费数十年未能突破的工作,说明AI在「深度搜索+逻辑验证」这一组合范式上已经展现出独特的结构性优势。
这里提到的蒙特卡洛树搜索(MCTS)是一种通过随机模拟来评估决策树中不同路径价值的算法,最著名的应用即AlphaGo在围棋中击败人类冠军。将这一思路类比到数学证明中:每个子智能体相当于一条搜索路径,独立尝试不同的引理组合、不等式估计或函数变换策略;主智能体则充当评估器,判断哪些路径更有希望到达有效证明。与围棋不同的是,数学证明的搜索空间是离散且无界的,但AI的优势在于可以同时维持数十条探索路径,并利用模型的语义理解能力对中间结果进行快速评估,从而实现对证明空间的高效遍历。
外界普遍将此视为AI首次在前沿数学领域留下实质性突破。需要说明的是,这里的「突破」并非解决黎曼猜想本身,而是在相关下界估计上取得可验证的进展。但即便如此,AI能够在如此严苛的数学证明领域产出可形式化验证的结果,其意义已经远超以往的辅助计算范畴。
所谓形式化验证,是指使用计算机证明助手(如Lean、Coq、Isabelle等)将数学证明的每一步都转化为机器可检验的逻辑推导。与传统的人工审稿不同,形式化验证不存在人为疏忽或逻辑跳跃的可能,一旦通过验证即可视为绝对正确。具体而言,形式化验证系统要求证明者显式声明每一个前提假设、每一步推理规则的应用,系统内核逐条检查其合法性——如同一位永不疲倦、永不犯错的审稿人。近年来,数学界已有多个重要定理通过形式化验证得到确认,如2023年Terence Tao团队对多项式Freiman-Ruzsa猜想的形式化证明。Claude的结果能够通过形式化验证,说明其产出的不是一个「看起来正确」的论证,而是经得起最严格逻辑审查的完整证明链条——这才是真正令数学界震动的地方。
补充一个重要的方法论视角:在形式化验证的语境下,AI生成数学证明的工作流程通常分为两个阶段——「探索阶段」和「翻译阶段」。探索阶段中,AI使用自然语言推理寻找可能的证明思路;翻译阶段则将自然语言证明逐步转化为形式化语言(如Lean 4的tactic语法)。这两个阶段的难度截然不同:前者需要创造力和数学直觉,后者需要严格的逻辑精确性。Claude同时完成了这两个阶段的工作,尤其是翻译阶段的成功完成,说明大语言模型已经具备了将模糊的数学直觉转化为精确逻辑表达的能力——这在一年前还被认为是极其困难的任务。
OpenAI晶圆级芯片:推理速度提升14倍进入全新档位
第三个焦点聚焦基础设施层。OpenAI发布了Ultrafast预览模式,搭载Cerebras晶圆级芯片,使GPT-5.6级别的推理速度飙升14倍,每秒可输出高达750个Token。

Cerebras的核心创新在于将整片晶圆(约300mm直径的硅片)作为一颗完整芯片使用,而非传统做法中将晶圆切割成数百颗独立芯片。其最新一代WSE-3(Wafer Scale Engine 3)集成了约4万亿晶体管和90万个AI核心,片上内存高达44GB SRAM,内存带宽达到21 PB/s。这种架构最大的优势在于消除了芯片间通信的瓶颈——传统GPU集群中大量时间消耗在芯片之间的数据传输上,而晶圆级芯片将所有计算单元集成在同一硅片上,数据可以在极短物理距离内高速流动,这使其在推理任务中能够实现远超传统GPU方案的吞吐量和延迟表现。
要更深入理解这一架构选择的意义,需要了解传统方案的局限。传统AI推理依赖NVIDIA GPU(如H100/B200),单颗芯片面积约800平方毫米,而一片完整晶圆面积约46,000平方毫米——相差近60倍。传统做法中,晶圆被切割成数十颗独立芯片,再通过PCB、NVLink或InfiniBand等互连技术组成集群。这种方式不可避免地引入通信延迟和带宽瓶颈,尤其在自回归生成(每个Token的生成依赖前一个Token)这种串行度极高的任务中,芯片间通信开销会严重拖慢整体速度。Cerebras的WSE架构通过将计算、存储和互连全部集成在单一硅片上,将数据移动距离从米级(机架间)缩短到毫米级(片上),从根本上消除了这一瓶颈。其44GB片上SRAM虽然容量远小于GPU的HBM显存(如H100配备80GB HBM3),但SRAM的访问延迟仅为HBM的约十分之一,带宽密度极高,特别适合推理场景中频繁的小粒度内存访问模式。
从半导体制造的角度补充一个关键挑战:晶圆级芯片面临极高的良率风险。传统芯片制造中,一片晶圆上如果有缺陷,只会废弃受影响的个别芯片,其余仍可使用。但当整片晶圆作为单一芯片时,任何位置的缺陷都可能影响整颗芯片。Cerebras通过在设计中引入大量冗余核心和片上容错路由来解决这一问题——WSE-3的90万个核心中,有一部分是专门用于替代缺陷核心的备用单元,系统启动时自动绕过有缺陷的区域。此外,晶圆级芯片的散热也是巨大挑战:单片WSE-3的功耗高达数千瓦,需要专门设计的水冷系统来维持正常运行温度。这些工程挑战解释了为什么尽管晶圆级概念早已提出,但直到Cerebras才真正实现商用。
每秒750个Token的输出速度意味着什么?以中文为例,一个Token大约对应1-2个汉字,750 Token/s相当于每秒生成约500-700个汉字。这个速度已经远超人类阅读速度(通常每分钟200-300个中文字),意味着AI的输出瓶颈不再是生成速度,而是人类的消化能力。对于机器对机器的场景——如智能体之间的对话、自动化代码生成流水线、实时金融决策——这种速度使得多轮复杂推理可以在秒级完成,彻底改变了AI系统的响应时间预期。
将这一速度放入更具体的应用场景:一个典型的智能体任务(如研究报告撰写)可能需要模型生成数万Token的中间推理和最终输出。在传统50 Token/s的速度下,生成3万Token需要10分钟;而在750 Token/s下仅需40秒。这意味着原本需要人类「等待」的交互体验变成了近乎即时的响应。更关键的是,在多智能体协作场景中,智能体之间的对话轮次可能达到数百甚至数千次——每一轮都需要模型推理,累积的时间节省是指数级的。这也解释了为什么Anthropic的黎曼猜想攻关选择了大规模并行架构:如果底层推理速度足够快,更多的并行探索路径变得经济可行。
这一提速带来的不仅是数字上的变化,更是应用场景的质变。实时语音交互、金融分析、安全响应等对延迟极度敏感的场景,全部得以进入全新的速度档位。当推理速度快到接近实时,许多此前受限于延迟的应用形态将被彻底激活。
你可能没注意到,OpenAI选择晶圆级芯片这条路线,本身就是对AI基础设施竞争的一次押注。当模型能力的边际提升越来越难,通过底层硬件优化来释放性能红利,正成为头部厂商拉开差距的重要手段。
行业快讯:资本、组织与生态的连锁反应
除了三大核心热点,还有一系列值得关注的行业动向:
- Anthropic计划10月上市,估值已超2万亿美元,有望成为史上最大规模的IPO。Anthropic由前OpenAI核心成员Dario和Daniela Amodei兄妹于2021年创立,主打AI安全研究方向,此前已获得亚马逊(累计超80亿美元)、谷歌等科技巨头的巨额投资。超2万亿美元的估值使其有望超越此前的IPO纪录,这一数字也反映出资本市场对AGI(通用人工智能)赛道头部公司的极度看好——作为对比,英伟达市值约3万亿美元,而Anthropic尚未实现大规模盈利。
将这一估值放在更大的资本背景中,2024-2025年AI领域的私募融资总额已超过千亿美元,但绝大部分集中在少数头部公司。Anthropic、OpenAI、xAI形成了第一梯队。IPO(首次公开募股)意味着公司从私募市场进入公开市场,需要接受更严格的财务披露和监管审查。历史上最大的科技IPO包括阿里巴巴(2014年,250亿美元募资)和沙特阿美(2019年,294亿美元募资)。值得注意的是,高估值也意味着市场对其未来营收增长抱有极高预期——当前AI公司普遍面临收入增速能否匹配估值的挑战。这一体量级的资本运作,将进一步改写AI行业的竞争格局。
Anthropic的IPO还有一个值得关注的维度:其独特的公司治理结构。Anthropic采用了「公益公司」(Public Benefit Corporation)的法律形式,并设立了长期利益信托(Long-Term Benefit Trust)来监督公司行为,确保AI安全使命不会在商业压力下被稀释。这种治理设计在上市后如何与股东利益最大化的传统预期共存,将成为AI行业公司治理的一个重要实验。此外,亚马逊和谷歌的巨额投资使得这两家科技巨头都在Anthropic中持有显著股权——IPO后的股权结构和投票权安排将直接影响AI行业的战略版图。

- 谷歌DeepMind换帅,创始人Hassabis卸任,组织层面的调整往往预示着战略方向的转变。Demis Hassabis于2010年创立DeepMind,2014年被谷歌收购后一直担任CEO,领导团队完成了AlphaGo、AlphaFold等里程碑式的工作。他的卸任标志着一个时代的结束,也可能意味着谷歌希望将DeepMind从研究导向进一步转向产品化和商业化落地。
Hassabis的贡献对AI发展史具有标志性意义。AlphaGo在2016年击败围棋世界冠军李世石,是AI领域的「斯普特尼克时刻」,直接催化了全球范围内对深度学习的投资热潮。AlphaFold则在2020年解决了蛋白质折叠预测这一困扰生物学界50年的难题,被《Science》评为年度十大突破之首。Hassabis本人于2024年获得诺贝尔化学奖。他的卸任时机耐人寻味——恰在AI竞争从基础研究转向产品落地的关键窗口期,谷歌可能判断需要一位更具产品思维和商业执行力的领导者来推动Gemini系列模型的全面商业化。
- Claude Code自动模式默认开启,其安全拦截率远超人工审批,反映出AI在代码安全审查上的能力已具备实用价值。所谓自动模式,是指Claude Code在执行代码操作(如文件读写、命令执行、网络请求)时,无需每次都向用户请求确认,而是由AI自主判断操作的安全性。安全拦截率超过人工审批,意味着AI能够捕获人类开发者容易忽略的安全隐患——如SQL注入漏洞、未经验证的用户输入、敏感信息泄露等。
这一功能的默认开启反映出AI代码助手正在从「建议者」角色转变为「执行者」角色。在传统开发工作流中,代码安全审查主要依赖人工Code Review和静态分析工具(如SonarQube、Snyk),但人工审查的覆盖率和一致性难以保证,尤其在高强度迭代的开发节奏下。AI自动模式的安全拦截本质上是将安全检查前置到代码生成阶段——问题在产生的那一刻就被识别和阻止,而非事后修复。这与DevSecOps(开发安全运维一体化)的「安全左移」理念高度一致,代表着AI工具正在深度融入软件工程的核心流程。
- Grok视频生成升级至1.5版,原生支持1080P,多模态生成能力持续演进。
AI竞争主战场转移:从模型参数到生态体系
综合这两周的行业动态,一个核心判断愈发清晰:模型之外,竞争正在转向智能体与基础设施。
从DeepSeek的Harness框架,到Anthropic的多智能体协作攻关,再到OpenAI的晶圆级芯片提速,三条主线分别对应着智能体层、应用层与基础设施层的角逐。当单纯的模型参数和评测分数不再是唯一的护城河,谁能构建起完整的智能体生态、谁能在底层算力上建立优势、谁能吸引更庞大的开发者社区,才是决定最终胜负的关键。
这种竞争格局的转变有其历史先例。移动互联网时代,操作系统(iOS vs Android)的生态之争最终比任何单一应用都更具决定性意义;云计算时代,AWS通过丰富的服务生态而非单一计算能力胜出。AI行业正在经历类似的演化——从比拼单点模型能力,走向比拼系统级的生态完整性。智能体框架相当于AI时代的操作系统,底层芯片相当于AI时代的基础设施,而开发者社区则是生态繁荣的核心驱动力。
进一步展开这个类比:Android的成功并非因为它是最好的操作系统,而是因为它的开放性吸引了最大的开发者生态和硬件合作伙伴网络;AWS的领先地位并非来自单一服务的性能优势,而是200多项云服务形成的完整解决方案使客户迁移成本极高。AI行业正在形成类似的锁定效应——当一个智能体框架积累了足够多的插件、工具集成和社区贡献时,开发者的切换成本将指数级增长。这就是为什么DeepSeek选择MIT协议、为什么Harness设计为极致模块化——这些决策本质上都是在争夺AI时代的「开发者心智份额」(Developer Mindshare)。一旦形成社区惯性,先发优势将极难被后来者打破。
这场从模型蔓延至智能体、基础设施与生态的全面竞争,才刚刚拉开序幕。谁将成为最终赢家,仍有待时间给出答案。
核心要点
- DeepSeek开源Harness框架,MIT协议+插件化架构使其12小时获5万星标,AI竞争从模型层延伸至智能体框架层
- Claude调度60个子智能体,将黎曼猜想零点下界从41.6%提升至67.2%,产出可形式化验证的数学证明,标志着AI在前沿数学领域的实质突破
- OpenAI搭载Cerebras晶圆级芯片实现750 Token/s输出速度,14倍提速开启实时AI应用新档位
- Anthropic计划10月IPO,估值超2万亿美元,AI行业资本格局加速重构
- 行业竞争主战场正从单一模型能力向智能体生态、底层基础设施和开发者社区全面扩散
相关推荐

RisenX详解:DeepSeek官方推荐的编程智能体
RisenX是DeepSeek官方API文档收录的原生编码智能体,支持缓存优先循环、工具调用修复和Flash/Pro智能切换。本文详解其核心设计、安装配置和完整功能。

ChordViz评测:MIDI与音频实时可视化工作台
深度解析ChordViz音乐可视化工具,支持实时MIDI与音频输入,提供和弦可视化、乐谱记谱及音频响应视觉三种模式,可集成OBS、TouchDesigner与Resolume,适合音乐教师与现场表演创作者。

3D打印机器人台灯:如何让机器像皮克斯角色一样有生命感
探索一位独立开发者如何用3D打印、ROS 2和自制动画编辑器,将皮克斯经典小台灯变成真实的机器人角色。从硬件外壳设计到动画编排,再到强化学习驱动的自主行为,完整解析这个融合机械、视觉与AI的开源机器人项目。