DeepSeek Harness开源Agent框架:48小时9万星爆火解析

GitHub史上增长最快的开源项目:48小时9.5万星
48小时,9万5千颗星。这可能是GitHub历史上增长最快的开源项目,没有之一。而它的背后,是中国AI公司DeepSeek。
这个名为DeepSeek Harness的开源Agent框架,几乎在一夜之间引爆了整个AI开发者圈。要理解它为什么这么火,首先要搞懂DeepSeek给出的一个核心公式:
Model + Harness = Agent
翻译成大白话:模型是大脑,Harness是手脚。以前的DeepSeek只能给你建议,像一个顾问;现在有了Harness,它能自己写代码、调工具、跑测试,直到把活干完再交给你。

这是一次从「顾问」到「员工」的角色升级——你说出目标,它自己想办法搞定。这也正是AI从「聊天」走向「干活」的关键分水岭。
从技术演进的角度来看,AI从「聊天」到「干活」经历了几个关键阶段:第一阶段是纯文本对话(2022年ChatGPT),模型只能生成文字回复;第二阶段是函数调用(Function Calling,2023年),模型可以结构化地请求外部工具执行特定操作——比如查询天气API或执行数据库查询,但每次只能完成单一动作;第三阶段是多步骤推理与执行(如ReAct范式),模型能在「思考-行动-观察」的循环中自主完成多步任务,这一范式由Google Research在2022年底提出,其核心思想是让模型交替进行推理(Reasoning)和行动(Acting),每一步行动的结果都作为下一步推理的输入;第四阶段就是当前的完整Agent系统,具备持久记忆、自主规划、错误恢复和多工具协调能力。DeepSeek Harness所代表的正是第四阶段的基础设施——它不仅让模型能调用工具,还提供了完整的执行环境、状态管理和人机交互界面。
DeepSeek Harness爆火的三个核心原因
MIT协议完全开源,零成本使用
DeepSeek Harness采用MIT协议,源码全部公开、完全免费。这与Claude Code等商业化收费路线形成了鲜明对比。对开发者而言,零成本、零授权门槛的诱惑力是巨大的。
MIT协议(Massachusetts Institute of Technology License)是目前最宽松的开源许可证之一,它允许任何人自由使用、复制、修改、合并、发布、分发、再授权和销售软件副本,唯一的要求是在软件副本中包含原始版权声明和许可声明。相比之下,GPL协议(GNU General Public License)要求所有基于GPL代码的衍生作品也必须以GPL协议开源,这种「传染性」让许多商业公司望而却步;Apache 2.0协议则在宽松的基础上附加了专利授权条款,要求贡献者明确授予专利使用权。MIT协议的极简特性使得商业公司可以毫无顾虑地将其整合进自有闭源产品中——这也是为什么React、jQuery、Node.js、Vue.js等全球广泛使用的开源项目都选择MIT协议的原因。对于DeepSeek Harness而言,选择MIT意味着任何企业——无论是三人团队的初创公司还是万人规模的大厂——都可以在此基础上构建商业产品而无需支付任何费用或开源自己的代码,这极大地降低了生态参与者的决策成本。
一切皆插件的乐高式架构
在Harness的设计中,模型、工具、会话、沙箱、界面全部可以替换,堪称「AI界的乐高」。这种插件化架构意味着开发者可以自由组合、自定义Agent能力,而不被锁死在某一套固定方案里。
从技术架构角度来看,AI Agent框架是连接大语言模型与外部世界的中间层软件。在完整的Agent架构中,核心组件通常包括:规划模块(将复杂任务分解为可执行的子步骤,类似项目经理拆解工作)、记忆模块(短期工作记忆用于维持当前任务上下文,长期知识存储用于跨会话复用经验)、工具调用模块(API调用、代码执行、文件操作、数据库查询等具体动作的执行器)以及反馈循环(根据执行结果判断是否达成目标,若失败则自动修正策略重新执行)。此前主流的Agent框架各有局限:LangChain虽然生态丰富但配置繁琐且抽象层级过多,AutoGPT在自主性上走得最远但稳定性堪忧,CrewAI擅长多Agent协作但架构相对封闭。DeepSeek Harness的「一切皆插件」设计理念,本质上是将上述每个组件都抽象为可热插拔的标准化接口,开发者可以自由替换底层模型(不限于DeepSeek,理论上可接入任何兼容模型)、沙箱执行环境(Docker容器、WebAssembly沙箱等)甚至前端界面,这种解耦设计在软件工程中被称为「关注点分离」(Separation of Concerns),其核心优势是让每个模块可以独立演进而不影响整体系统。
一行命令开箱即用
只要装好Node.js,敲一行命令,浏览器里就能直接跑起来。对比动辄需要复杂配置的其他Agent框架,这种开箱即用的体验大大降低了尝鲜成本。这一设计哲学与Docker的「一行命令启动任何应用」、Create React App的「零配置创建项目」一脉相承——在开发者工具领域,降低上手门槛往往是决定采用率的第一道关卡。当一个开发者从看到项目到跑通Demo的时间从30分钟缩短到3分钟,传播系数会呈指数级增长。
Node.js本身是基于Chrome V8引擎的JavaScript运行时环境,选择它作为运行基础意味着DeepSeek Harness天然继承了全球最大开发者生态(npm注册表拥有超过200万个包)的红利。前端开发者、全栈工程师、甚至非传统意义上的「AI工程师」都可以无障碍上手——这与Python生态中动辄需要配置虚拟环境、解决依赖冲突、安装CUDA驱动的AI工具形成了鲜明对比。更值得注意的是,基于浏览器的交互界面意味着用户无需安装任何桌面客户端,这进一步降低了非技术用户的尝试门槛。
实测体验:DeepSeek Harness真的能干活
实际安装后让Harness完成了几个任务。比如让它重构一个网页——它自己写代码、修改、预览,全程无需人工触碰键盘。

更极端的案例是,有人给它装了浏览器插件,让它自动打开B站、给视频点赞投币,全流程自动化完成网页操作。这类演示直观地展示了Agent能力的边界正在被快速拓宽——AI不再只是回答问题,而是真正地「代替你操作」。这种能力在技术上通常被称为RPA(Robotic Process Automation,机器人流程自动化)与LLM的结合。传统RPA(如UiPath、Automation Anywhere等工具)需要开发人员预先录制或编写固定的自动化脚本,一旦网页界面发生变化(按钮位置移动、元素ID更改),脚本就会崩溃,维护成本极高。而AI Agent驱动的自动化具有根本性的不同:它通过视觉理解或DOM语义分析来识别界面元素,能理解自然语言指令(如「给这个视频点赞」而非「点击坐标(342,567)处的按钮」),并在界面发生变化时自动适应。这使得自动化脚本的编写从「精确的程序化描述」变为「模糊的自然语言意图」,大幅降低了自动化的创建和维护门槛。
当然,这类自动化操作也带来了值得警惕的一面:当Agent能自主控制浏览器执行任意操作时,权限管理与安全边界将成为绕不开的话题。如何在赋予Agent足够自主权的同时防止越权操作(如误删重要文件、未经授权的支付行为),将是Agent框架走向生产环境必须解决的核心挑战。业界目前正在探索的解决方案包括:分级权限系统(低风险操作自动执行,高风险操作需人工确认)、沙箱隔离(Agent在受限环境中执行,无法触及系统关键资源)、以及操作审计日志(所有Agent行为可追溯、可回滚)。这些机制类似于企业IT系统中的最小权限原则(Principle of Least Privilege)——只赋予Agent完成当前任务所必需的最小权限集合。
中国开发者社区的创作力爆发
让人意外的是,Harness开源仅两天,GitHub插件榜的第一名和第三名,竟然都是B站UP主的作品。

- 第一名:TitanWings的Kalix Skill,能把同事的知识蒸馏成AI技能,已收获两万颗星
- 第三名:LittleWish的OpenBillyClub,一个跨平台AI内容发现Agent
「知识蒸馏成AI技能」这一概念值得展开理解。在传统AI语境中,知识蒸馏(Knowledge Distillation)指的是将大模型的知识压缩迁移到小模型中;而这里的「蒸馏」更接近于一种隐喻——将个人或团队的专业经验、工作流程、决策逻辑编码为Agent可执行的技能包。想象一个资深运维工程师诊断服务器故障的思维过程:先查看错误日志,再检查CPU和内存使用率,然后排查最近的代码部署变更——这套流程过去只存在于个人头脑中,现在可以被结构化为一个Agent技能,使得团队中的任何人都能通过调用该技能获得专家级的诊断能力。这本质上是组织知识管理(Knowledge Management)在AI时代的升级形态。
目前已有超过700个插件仓库涌现。有人用它做电子宠物、18款小游戏,甚至复刻了2005年风格的复古广告界面。这说明一个耐人寻味的现象:中国开发者社区的创作力,可能比DeepSeek本身还要猛。 一个好的基础设施,一旦开放,就能激发出远超预期的生态活力。
插件生态的战略价值可以从历史中找到参照。2008年苹果App Store上线时,初期只有500个应用,但开放的开发者生态在两年内催生了超过30万个应用,这些应用反过来成为iPhone的核心竞争力——用户买的不是硬件,而是生态。类似地,WordPress的插件市场拥有超过6万个插件,使其占据了全球43%的网站市场份额;Chrome的扩展商店拥有超过18万个扩展,牢牢锁住了开发者和用户的使用习惯。在AI Agent时代,插件生态的网络效应同样关键:更多插件吸引更多用户,更多用户产生的需求和反馈又激励开发者创建更多插件,形成正向循环。经济学中将这种现象称为「双边市场」或「平台经济」——平台的价值不在于自身功能有多强,而在于它连接的两端(开发者与用户)的数量和活跃度。DeepSeek在48小时内涌现700多个插件仓库,正是这种飞轮效应的早期信号。
开源生态 vs 商业产品:两条路线的对决
很多人会拿DeepSeek Harness和Claude Code对比。两者的差异代表了两条截然不同的AI Agent路线:
| 维度 | DeepSeek Harness | Claude Code |
|---|---|---|
| 授权 | MIT开源、免费 | 商业产品、收费 |
| 架构 | 一切皆插件 | 相对封闭 |
| 商业化 | 生态驱动 | 年化收入25亿美元 |

Claude Code是Anthropic公司推出的AI编程Agent产品,它直接集成在终端中,能够理解整个代码库的上下文并执行跨文件的复杂编程任务。Anthropic作为OpenAI的主要竞争对手之一,由前OpenAI核心成员创立,其产品走的是典型的商业化路线:按token计费或包月订阅制,年化收入25亿美元的数字印证了市场对AI Agent付费的强烈意愿。但封闭产品的天花板在于:用户只能使用Anthropic提供的模型和功能,无法自定义底层组件,一旦Anthropic调整定价或服务策略,用户缺乏替代选项——这正是开源替代方案最具吸引力的地方。
在能力层面,据引用的数据,在Terminal Bench跑分上,DeepSeek V4 Pro拿到了87.9分,而Claude Opus 4.8为85分。这意味着在Agent任务上,国产模型的实测表现已经不落下风。
Terminal Bench是专门评估AI Agent在真实终端环境中执行能力的基准测试,它不同于传统的语言模型评测——MMLU(Massive Multitask Language Understanding)测试的是模型在57个学科上的通用知识水平,HumanEval测试的是模型生成独立函数代码片段的正确性,而Terminal Bench考察的是模型在给定高层目标后,能否通过一系列终端命令、文件操作、环境配置、调试修复等步骤完成复杂的端到端任务。例如,一道典型的Terminal Bench题目可能是「在一个存在多个bug的Python项目中,定位错误原因并修复所有测试用例」——这要求模型不仅要写出正确代码,还要理解项目结构、解读错误日志、协调多个工具、并在遇到意外情况时自主调整策略。这类评测更接近软件工程师的真实工作场景,因此被认为是衡量Agent实用性的最佳指标之一。87.9分vs85分的差距虽然在数值上不大,但考虑到此前国产模型在此类需要强执行力的实操评测中通常落后于Anthropic和OpenAI的顶级模型5-10个百分点,这一结果具有里程碑意义——它表明中国AI公司在「让模型干活」这件事上已经达到了世界一流水平。
需要强调的是,这并非简单的「谁替代谁」,而是两种路线的对决:一边是开源生态,一边是商业化闭源产品。DeepSeek选择的开源路线,其颠覆性可能比模型本身更强。这与历史上Linux vs Windows、Android vs iOS的路线之争如出一辙——开源路线短期内可能缺乏直接营收,但通过生态效应建立的护城河往往更深更宽。Linux如今运行着全球90%以上的云服务器和所有前500名超级计算机,Android占据全球72%的移动操作系统份额,都是开源路线长期胜出的典型案例。值得注意的是,开源并不等于没有商业模式——Red Hat通过为Linux提供企业级支持和服务实现了年收入超过34亿美元(后被IBM以340亿美元收购),Elastic、MongoDB等公司围绕开源项目构建了市值数十亿美元的商业公司。DeepSeek的开源策略同样蕴含着多条潜在的商业化路径:企业版付费支持、云端托管服务(类似GitHub Copilot的订阅模式)、以及通过生态绑定推动自有模型API的调用量增长。
从「卖模型」到「卖结果」:AI行业的转折点
这次发布的意义,早已超出一款产品本身。它标志着AI行业正在从「卖模型」向「卖结果」转变——用户真正关心的不是模型多强,而是它能不能把活干完。这一转变类似于云计算行业从IaaS(Infrastructure as a Service,基础设施即服务)向SaaS(Software as a Service,软件即服务)的演进:在IaaS阶段,AWS卖的是虚拟机、存储和网络等原始计算资源,用户需要自己搭建应用;在SaaS阶段,Salesforce、Slack等产品直接交付业务价值,用户无需关心底层基础设施。类似地,AI行业正从「卖裸模型API」(按token计费的IaaS模式)向「卖任务完成」(按结果收费的SaaS模式)演进。当AI Agent能够可靠地交付工作成果时,底层模型的品牌和参数量都将退居幕后,「结果交付能力」将成为唯一的竞争维度。
这种转变的深远影响在于定价模式的革命:传统的AI API按输入/输出token数量计费,这对用户而言是不透明的成本——完成同一个任务,不同的提示词策略可能导致10倍的token消耗差异。而在「卖结果」的模式下,定价将趋向于按任务复杂度和完成质量收费,类似于自由职业平台上按项目报价的逻辑。这不仅让成本更可预测,也让AI服务提供商有动力优化执行效率而非单纯增加模型参数。
而「开源 + 插件化 = 抢生态」的策略核心在于:谁拿到了插件生态,谁就拿到了Agent时代的入口。 在移动互联网时代,应用商店是入口;在Agent时代,插件生态很可能扮演同样的角色。掌握入口意味着掌握分发权、数据流向和用户注意力——这在任何技术范式中都是最具战略价值的位置。回顾科技史,掌握入口的公司往往获得了远超其直接产品价值的商业回报:Google通过搜索入口构建了2000亿美元的广告帝国,微信通过社交入口成为中国互联网的超级连接器,App Store通过分发入口每年为苹果贡献超过200亿美元的服务收入。AI Agent的插件生态入口,其潜在价值可能同样巨大。
从这个角度看,国产AI已经不再只是「追评」和跟随,而是在Agent基础设施这条赛道上,有了领跑的可能性。这头「黑马」到底能干多少活,值得持续关注。
注:本文数据与观点主要来自B站UP主对DeepSeek Harness的首发实测分析,部分跑分与营收数据为视频引用,供参考。
相关推荐
观点碰撞Scaling Law再思考:参数不是唯一答案
深度解析Scaling Law从Kaplan到Chinchilla再到MoE时代的演进历程,探讨为什么盲目堆参数是误区,以及GLM-5.3如何通过后训练证明扩展存在多个旋钮。

本地AI Agent部署太慢?轻量级优化实战指南
本地部署AI Agent速度慢、频繁超时?本文从Agent框架隐藏开销、硬件瓶颈出发,提供精简配置、轻量工具选择、模型量化等针对性优化方案,并介绍通过Telegram Bot远程交互的实用技巧。

AI专业选电脑:MacBook还是NVIDIA笔记本?深度对比指南
AI专业大学生选电脑深度分析:MacBook Air M5搭配远程GPU vs NVIDIA独显笔记本,从CUDA支持、便携性、续航、性价比等维度全面对比,附实操建议。