DeepSeek Harness深度体验:不做Agent做基建的野心

一夜爆火的开发者预览版
DeepSeek 终于把自家的 Agent 产品落地了,名字叫 Harness(音译"哈尼斯")。据 B 站 UP 主克罗猫的体验分享,稿件撰写时该项目在 GitHub 上的 star 数已经冲到了 3.7 万,增长速度堪称离谱。
但热度归热度,争议同样不小。喜欢的人认为它代表了 Agent 的未来,不喜欢的人则直呼"什么鬼东西"。这种两极分化的评价,恰恰说明它是一个有明确设计理念、而非讨好所有人的产品。要理解这份争议,得先搞清楚它到底是什么。
不做终端Agent,做Agent基础设施
为什么它叫 Harness(挽具/框架),而不叫 Code 或 Build?因为 DeepSeek 做的根本不是一个终端 Agent 应用,而是一套 Agent 基础设施。
在AI开发领域,Agent(智能代理)是指能够自主感知环境、做出决策并执行动作的AI系统。当前主流的Agent产品如GitHub Copilot Workspace、Cursor、Devin等,都采用了封闭式架构——厂商预先定义好Agent能调用哪些工具、在什么环境中运行、如何编排任务流程。这种做法的优势是用户体验统一、上手门槛低,但劣势是灵活性受限,开发者无法根据自身需求深度定制Agent的行为逻辑。DeepSeek选择做"基础设施"而非"终端应用",本质上是在这条光谱上选择了完全相反的一端。
官网上有一句核心公式:Agent = Model + Harness。也就是说,你日常用的各类编程助手、代码 Agent,本质上都是套在模型外面的那一层"壳"。这层壳里包含了工具调用、沙箱环境、任务调度、子 Agent、工作流等一整套机制。

过去,这层壳是被厂商封死的——工具、沙箱、调度全藏在后面,用户既看不见也改不了。而 DeepSeek Harness 的做法非常激进:把这一切全部拆成插件。所有能力你都能自己插、自己拔、自己换。这是一种从"黑盒"到"可组装"的思路转变,也是它区别于市面上其他 Agent 产品的根本所在。
热插拔(Hot-swapping)原本是硬件领域的概念,指在系统不停机的情况下更换组件。在软件工程中,这意味着程序运行期间可以动态加载、卸载或替换模块,而不需要重启整个系统。传统Agent框架的工具链是在启动时静态绑定的,一旦运行就无法改变。Harness通过将所有能力抽象为独立插件,并由Codex内核统一管理其生命周期,实现了运行时的动态组装。这类似于操作系统的驱动程序模型或浏览器的扩展机制,但应用在了AI Agent的能力层面。
Codex内核:让Agent学会自我进化
Harness 的核心叫做 Codex 内核。据克罗猫介绍,这个内核的作者已经加入了 DeepSeek,并发表了一篇长达 88 页的论文来阐述其设计。
这个内核的设计哲学是"极其克制"——它只负责插件的加载、下载和依赖管理,其他一概不碰。这种设计在软件架构中被称为"微内核"(Microkernel)模式,经典案例包括操作系统领域的Mach内核和L4内核——它们只负责最基本的进程间通信和内存管理,将文件系统、网络协议等功能全部外置为独立服务。微内核的优势在于系统稳定性高(核心极小意味着出错概率低)、可扩展性强(新功能以插件形式添加而非修改内核)。论文长达88页这一细节也说明,这不是一个简单的工程实现,而是经过严谨理论推导的架构设计。
但正是这份克制带来了一个关键能力:它能让 Agent 在运行过程中随时更换插件,而运行状态不会崩溃。

这意味着什么?想象一个场景:Agent 跑着跑着,发现自己缺少某项能力,于是现场造一个插件,挂到自己身上,然后接着干活。用视频作者的话说:"这不是工具,这是自我进化。"这种运行时热插拔的能力,是传统封闭式 Agent 框架难以实现的,也是 Harness 最具想象力的部分。
四种运行模式详解:本质是四个预设模板
Harness 提供了四种运行模式,但别被吓到,它们本质上只是四个预设模板:
标准模式:开箱即用
什么都有——文件读写、Shell、搜索、子 Agent、工作流,开箱即用。对新手最友好,无脑选这个就行。
TTC模式:省Token但难调试
让模型写一段 TypeScript,把多个工具调用压缩成一次执行。优点是节省 Token,缺点是调试难度陡增。新手不建议碰。
Token是大语言模型处理文本的基本单位,每次API调用都按Token数计费。在Agent场景中,一个复杂任务可能需要模型进行数十次工具调用,每次调用都伴随上下文传递,Token消耗呈指数级增长。TTC(Think-Then-Code)模式的核心思路是让模型先"想清楚",然后生成一段TypeScript代码一次性执行多个操作,而非逐步交互。这类似于数据库中"批处理"与"逐条处理"的性能差异。但代价是:当代码出错时,你面对的是一整段逻辑而非单个步骤,调试复杂度显著上升。
极简模式:测试裸能力
只给你两个工具:一个 Shell(Bus)和一个文件编辑器。主要用于测试模型的裸能力对比。作者直言:"日常用,你会想打电脑。"

创造模式:真正的杀手锏
这才是 Harness 最值得关注的能力。它能让 Agent 检查自己身上的插件,发现缺失就现场造一个挂上去。你甚至可以对它说:"给我做一个只读代码、不改文件的安全审计模式",它真的能给你搭建出来。这种"按需生成能力"的思路,把 Agent 从固定工具的执行者,变成了能够自我扩展的构建者。
创造模式触及了当前AI研究的前沿命题——工具制造(Tool Making)。2023年以来,学术界已有多篇论文探讨让LLM自主创建工具的可能性,如LATM(LLMs As Tool Makers)框架。其核心思想是:与其给AI预设无穷多的工具,不如赋予它"造工具"的元能力。Harness的创造模式是这一理念的工程化落地。值得注意的是,这也引发了安全性讨论——一个能自我扩展能力的Agent,如何确保它不会"创造"出超出预期的危险操作?这可能是后续版本需要重点解决的问题。
值得一提的是,Harness 并没有把用户锁死在 DeepSeek 模型上。你可以接入其他厂商的模型,通过自定义 base URL,想用谁就用谁。这种开放态度,对于一个想做"基建"的产品来说,是必要的姿态。
门槛不低:这是给开发者的产品
说完了亮点,也得说句实话。这东西对普通用户真的不友好——术语太多、门槛太高、功能偏糙、体验原始,几乎每一步都在"劝退"。

它现在就是一个开发者预览版,需要全世界的开发者进来一起查漏补缺,把生态做起来。从这个角度看,3.7 万 star 更像是一种社区共建的号召,而非一个成熟消费级产品的市场表现。这种"先开源、后生态、再商业化"的路径在开发者工具领域并不罕见——Kubernetes、Docker、VS Code都走过类似的道路。关键在于能否在早期吸引到足够多的高质量贡献者,形成正向的网络效应。
结语:探索未知之境
回过头看,DeepSeek 可能本来就不打算做消费级产品,而是定位为一个"极客产品"的团队。它的 Slogan 写着"探索未知之境"(Explore the unknown),这句话某种程度上解释了 Harness 的全部气质。
Harness 是不是"封神",现在下结论还太早。但它把 Agent 的"壳"彻底打开、交给社区去定义的做法,确实提供了一条与主流封闭式产品不同的路径。对于关注 Agent 底层架构的开发者来说,它值得装一个跑起来试试——毕竟,浏览器一开就能用。
相关推荐

本地Ollama小模型全自动逆向3Dmigoto Mod实战教程
详解如何使用本地部署的Ollama小模型实现3Dmigoto Mod全自动逆向,涵盖接入配置、硬件选型、实操演示及注意事项,零成本批量处理Mod的完整方案。

n8n入门教程:从零搭建AI自动化工作流完整指南
详解n8n工作流平台的核心特点、AI Agent构建方法及RAG系统搭建。涵盖n8n节点体系、Chain节点、工具节点三大AI板块,附完整学习路径,助你快速掌握低代码AI自动化开发。

自研GPU内核让AlphaFold蛋白模型提速6.8倍
开源GPU内核库fast_trimul专门优化AlphaFold3家族模型中的三角乘法更新运算,在短序列场景下实现4.5至6.8倍速度提升,显存占用降低2.2至2.4倍,支持即插即用集成与跨硬件兼容。