DeepSeek Harness实测:零成本搭建专属编程Agent

DeepSeek Harness将编程Agent的模型层与框架层彻底解耦,让Harness本身成本归零。
DeepSeek开源的Harness项目在GitHub迅速积累19万星标,其核心主张是将AI编程Agent拆解为两个独立层次:作为"大脑"的模型,以及负责上下文、工具、插件、状态管理的Harness框架。与Claude Code等封闭产品不同,DeepSeek Harness把所有内部决策对用户开放,支持接入任意模型Provider(包括本地Ollama部署),使Harness层成本可归零。其全链路可追溯能力允许逐字查看每次工具调用与推理过程,任务中断后可精确续接。更独特的是,它内置了将Claude Code和Codex作为子进程调用的能力,定位为驱动现有Agent的上层协调框架,而非竞争替代品。项目当前处于开发者预览阶段,仍有破坏性变更风险。
DeepSeek Harness是什么:模型是大脑,Harness是外壳
DeepSeek近期开源了一个名为DeepSeek Harness的项目,短时间内GitHub星标数就冲到了19万,被不少开发者称为"免费版Claude Code"。这位海外UP主没有停留在阅读文档层面,而是完整走了一遍安装、配置和实测流程,验证它是否真的能撑起一个属于你自己的编程Agent。
理解这个项目的关键,在于分清"模型"和"Harness"两个概念。模型是大脑,而围绕大脑的一切——上下文、工具、插件、MCP服务器、权限、记忆——都属于Harness。UP主给出的核心观点是:Claude Code也是一种Harness,但它是别人替你做好了所有内部决策、并把这些决策封闭起来的Harness;而DeepSeek Harness把同样的这些决策全部开放,运行时你都能干预。
这意味着什么?在普通编程Agent里,抽掉一个组件它就崩了,任务进行到一半丢了依赖它也崩了(除非你提前硬编码了Plan B)。而在DeepSeek Harness里,每个组件都会声明自己需要什么,运行时会为它做的每一次改动保留"撤销"能力。没有东西被硬编码,因此没有东西非得重启。
"Harness"这个词在软件工程中原指"测试框架"或"驱动外壳",即围绕核心逻辑提供运行环境、工具接入、状态管理的脚手架层。在AI Agent语境下,Harness承担的是:决定模型能看到哪些上下文、能调用哪些工具、如何处理错误与重试、如何保存和恢复状态。Claude Code、Cursor、Codex这些产品本质上都是各家厂商预先设计好的Harness,只是它们把内部决策封装起来不对外暴露。DeepSeek Harness的差异在于它把这一层完全开放并可编程化——这也是为什么它能接入任意模型而不是只能用DeepSeek自家的API。
安装与配置:模型也是插件,成本可以归零
安装过程相当简单。从官网或GitHub仓库复制安装命令,在终端粘贴回车,大约五分钟即可完成。安装结束后会自动打开一个本地Web应用仪表盘,首次加载时会要求填入DeepSeek的API Key。

值得关注的是——你并不需要填DeepSeek的Key。可以点击"稍后配置",然后接入任何你想用的模型。UP主在设置的模型页面添加了一个Provider,接入了自己每月10美元的GLM订阅,连接成功后状态变绿即可使用。
这里体现了项目的核心设计理念:模型本身就是一个插件。你不会因为DeepSeek写了这个Harness就被绑死在它的付费API上。如果想真正做到零成本运行,可以添加自定义Provider,填入本地模型(比如通过Ollama部署)的Base URL和API Key即可。
不过UP主给出了一个诚实的提醒:免费托管模型都有额度上限。Google的免费Gemini层级同样能接入,但它已经停止公布限额。唯一真正无限的免费路径,是在自己的机器上运行模型权重——如果显卡够用,Ollama提供了很好的一键安装方案,完全不计量。他坦言自己的硬件跑不动,所以没演示这部分,不愿展示自己实际运行不了的东西。
Ollama是一个本地大模型运行时,允许开发者在自己的机器上一键下载并运行开源模型权重(如Llama 3、Mistral、Qwen等),对外暴露一个与OpenAI API格式兼容的本地接口(默认为 http://localhost:11434)。由于它完全在本地运行,没有网络请求、没有Token计费、没有隐私泄露风险。DeepSeek Harness支持自定义Provider的Base URL,因此只需将Ollama的本地地址填入,即可实现真正零成本、零网络依赖的编程Agent闭环。瓶颈在于本地显卡显存:7B参数的模型大约需要8GB显存,70B级别则需要多张高端GPU,这是"完全免费"方案的硬件门槛。
全链路可追溯:每一次调用都能回看
真正让UP主开始认真对待这个工具的,是它的可追溯性(traceable)。当一个任务运行时,你能实时观察它做的每一件事:上下文、助手、工具调用、每一个报错,全都可追溯——不是概括总结,而是逐字可查。

打开一次运行的轨迹(trajectory),你能看到它使用的确切系统提示词、逐字注入的上下文、哪些技能被加载哪些没有以及原因、每一次工具调用的载荷和返回结果、思考过程、每一步耗时。这种透明度是Claude Code或Codex都给不了的。
为了验证"组件可安全进出"不是空话,UP主直接在任务执行中途把它杀掉,然后要求它"从上次中断处继续"。结果它真的凭借保留下来的完整数据——相同的上下文、相同的用户偏好、相同的助手与工具调用记录——精确地接续了下去。

他也如实说明这是一个开发者预览版,唯一的标记发布是Release Candidate,README里用大写字母明确写着"会有破坏性变更"。但正因为组件化和状态可恢复的设计,即使出问题,它也能"复活"。
"轨迹(Trajectory)"是强化学习与Agent系统中的标准术语,指一个任务从起点到终点经过的完整状态-动作序列。在编程Agent里,一条轨迹通常包含:初始提示→模型推理→工具调用(如读文件、执行命令)→工具返回→再次推理→……→最终输出。大多数商业产品只展示最终结果或简化日志,而轨迹级别的可追溯性意味着你能在任意节点审查"模型为什么做出这个决定",这对调试失败任务、优化提示词、核查安全边界都有直接价值。这也是为什么任务被中断后能精确续接——状态被完整持久化在轨迹数据里,而非仅存在于内存中。
一切皆插件:亲手造一个官方都没有的工具
DeepSeek官网首页的标语就是"Everything is a plugin"(一切皆插件),而且比想象中更字面。在设置的插件页面,里面几乎每一样东西都是可以启用/禁用的插件,包括侧边栏、命令等等。你可以随意添加、创建插件到Harness中。
UP主选择了Creator Mode(创作者模式),这个预设会自动加载插件开发技能。然后他给出了一个提示词:做一个在任务运行结束时触发桌面通知的插件,并把token数量和花费成本直接写进通知里。这正是他一直想要、但所有编程Agent都没有做的功能——经常在另一个窗口跑着九分钟的任务却忘了它,从没看到它跑完。
经过几轮迭代(修复黑底黑字看不清的问题、改成白色文字、修复计数器),这个通知栏插件真的做出来了。这种从零创建、自由启停、任意定制的能力,是Claude Code和Codex都无法提供的。
与Claude Code的关系:不是对手,而是可以驱动它的一层
仓库里有两个几乎没人讨论的包:sub-agent-claude-code和sub-agent-codex。它们不是模型Provider,而是会把Claude Code和Codex作为子进程真正拉起来,并交给它们任务。

这样你的Agent就多了两个工具——sub-agent-claude和sub-agent-codex,它可以自行判断某个任务更适合交给Claude Code处理,然后去调用它。关于这一点有三个要点:
- 一次性调用:每次调用都会启动全新进程和一段无法恢复的对话,一个任务一个答案,没有后续追问。
- 默认休眠:两个Provider都是休眠加载的,需要预设主动把工具交给你的Agent,首次打开默认不开启。
- 会剥离凭证:它会故意从环境中剥离凭证相关变量,你Shell里已有的Key不会传给子进程,必须显式传入。
因此这不是你正在付费的Agent的竞争者,而是一层可以"驱动"它的东西。所有把它框定为"DeepSeek vs Claude Code""vs 你现有Agent"的说法,方向都错了。文档本身就说明:Anthropic、OpenAI、Bedrock、Vertex、Codex都在DeepSeek Harness自带的Provider列表里。你完全可以添加Anthropic、填入Key,就在这个免费Harness里运行Opus,同时享受完整trace和插件能力。
Sub-agent模式在多Agent系统架构中是一种常见设计模式:主协调Agent(Orchestrator)负责任务拆解与路由,将子任务分发给具有不同专长的子Agent执行,再汇总结果。DeepSeek Harness将Claude Code和Codex作为子进程拉起的方式,实际上实现了一种轻量级的Multi-Agent编排。需要注意的是,这种调用方式意味着主Agent无法访问子Agent的内部推理过程,只能获得其最终输出——这与Claude Code本身的封闭Harness特性一脉相承。这种架构的实用价值在于:对于需要Claude Code强项(如深度代码理解、Artifact生成)的子任务,可以按需路由过去,而无需将整个工作流都迁移到Claude的生态里。
核心结论:Harness和模型本就是两笔账,其中一笔归零了
UP主的总结很直接:过去两年里,Agent和模型是捆在一起卖的一个产品,你想要好模型,就得接受它绑定的那个Harness。现在这件事不再成立了。
真正的问题从来不是"选DeepSeek还是Claude",而是Harness和模型本就是两笔独立的支出,如今其中一笔(Harness那部分曾经要花钱的能力)归零了。唯一的现实限制是:接入Claude用的是API Key而非Claude订阅,而Claude API并不便宜。
他给出的建议是:如果今天从零开始,就先装上它、指向一个免费或便宜的模型,用一周时间处理那些不需要顶级大脑的工作,看看这能覆盖你一个月里多少任务量。对于成本敏感又想拥有完全可控编程Agent的开发者来说,这确实是一个值得动手一试的方向。
相关推荐

如何量化评估Agent系统工程质量?六维度评估体系全解析
抛开底层模型能力,如何量化评价Agent系统的工程质量?本文从效果、过程、可靠性、成本、可观测性、安全六大维度,配合每成功任务成本北极星指标、四层评估器与发布门禁飞轮,系统拆解Agent评估体系,工程落地必看。

AI Agent搭建师:零基础入门大模型落地新风口
AI Agent正成为大模型落地核心,本文解析AI Agent搭建师这一潜在新职业、中小企业需求缺口、零基础入门门槛,以及从学习到交付的完整实操闭环,帮你理性看待这一技术风口。

AI漫剧零基础入门:从剧本到成片的六步制作全流程
AI漫剧零基础入门教程:拆解从剧本、分镜脚本到成片的六大核心流程,详解定身份、提任务、设格式的万能AI提问公式,以及适配AI绘图的时长限制与画面描述避坑技巧。