DeepSeek Harness实测:一切皆插件的透明AI编程框架

一款颠覆传统思路的AI编程框架
DeepSeek发布了一款名为 DeepSeek Harness 的开发者预览版工具。与市面上主流的AI编程助手(如Claude Code)不同,它采用了一套极为独特的设计理念,让不少开发者眼前一亮。据YouTube频道NeuralNine的实测演示,这款工具目前虽然还是预览版本、处理流程略显粗糙,但其底层架构思路已经足够引人注目。
它的核心卖点可以概括为两点:一切皆插件,以及一切皆可追踪。这两个特性恰恰击中了当前AI编程工具的两大痛点——功能封闭和过程黑盒。
一切皆插件:极致的模块化设计
Harness最激进的设计在于,它把工具本身的每一个组成部分都抽象成了插件。无论是UI侧边栏、两种能力系统(capabilities),还是系统提示词,都可以被独立启用或停用。
插件化架构(Plugin Architecture)是软件工程中一种经典的设计模式,其核心理念是将系统功能拆分为可独立加载和卸载的模块。这种设计在IDE领域有着悠久的历史——Eclipse、VS Code都采用了类似架构。VS Code的扩展系统允许第三方开发者通过API接入编辑器的各个层面,从语法高亮到调试器都可以被替换。但Harness的激进之处在于,它不仅让"扩展功能"成为插件,连系统本身的核心组件(如UI、系统提示词)都被插件化了,这意味着系统的"骨架"本身也是可拆卸的,这在AI编程工具中属于首创。值得注意的是,这种设计哲学与Unix的"一切皆文件"理念异曲同工——通过统一抽象来降低系统复杂度,使得任何组件都可以用相同的方式被创建、组合、替换和销毁。
换句话说,你在界面上看到的每一个功能、每一个界面元素,背后都对应着一个可开关的插件。这种细粒度的模块化让整个系统变得异常灵活——你可以根据需要裁剪出一个极简的编程环境,也可以叠加各种自定义能力。

目前的插件开关还需要通过配置文件手动实现。在实测中,作者进入 profiles/web 目录下的 cordis-patch.yaml 文件,只需添加插件的 id 并设置 isDisabled: true,重新加载后侧边栏就会消失。Harness使用的这套Cordis配置系统基于依赖注入(Dependency Injection)和响应式编程(Reactive Programming)理念,允许开发者通过声明式配置来管理组件间的依赖关系。依赖注入是一种控制反转模式,组件不再主动获取自己的依赖,而是由外部容器负责"注入"——这使得组件之间的耦合度大幅降低,每个组件只需声明自己需要什么,而无需知道依赖来自哪里。响应式编程则确保当某个插件的状态发生变化时,所有依赖它的下游组件能够自动响应更新,这类似于Excel中修改一个单元格后所有引用它的公式自动重算。YAML作为配置格式更适合人类阅读和手动编辑,而声明式依赖管理的优势在于,当某个插件被禁用时,系统可以自动处理所有依赖该插件的下游组件,避免级联故障——这与Kubernetes中声明式资源管理的思路一脉相承,用户只需描述"期望状态",系统自动计算如何从当前状态到达目标状态。这套机制虽然还不够"用户友好",但未来版本预计会提供一键式的按钮操作。
Creator Mode:用对话创造新功能
如果说插件系统只是让功能可以自由拆装,那么 Creator Mode(创作者模式) 则把可扩展性推向了新的高度。
通过自然语言提示词开发插件
在Harness的Agent预设中,除了标准模式、代码模式、极简模式之外,还有一个专门的Creator模式。这个模式的用途是:通过自然语言描述,让Harness自己开发并激活新功能。
Creator Mode本质上是一种"元编程"(Metaprogramming)在AI工具中的实现——即用程序来生成程序。这个概念在计算机科学中并不新鲜,Lisp语言的宏系统允许程序在编译时生成和变换代码,Ruby的元编程能力让开发者可以在运行时动态定义类和方法,JavaScript的eval函数也能执行动态生成的代码字符串。但将元编程与大语言模型结合,让自然语言成为"元语言",这是AI时代的独特创新。从技术实现角度看,Creator Mode需要解决几个关键问题:代码生成的沙箱安全性(防止恶意代码逃逸到宿主系统,类似于浏览器沙箱阻止网页代码访问本地文件系统)、动态加载的热插拔机制(无需重启即可加载新代码,这在传统编译型语言中极为困难,但在JavaScript/TypeScript的动态特性下更容易实现)、以及生成代码与现有系统的接口兼容性(确保新插件能正确调用系统API,这需要提供严格的类型定义和接口契约)。这与浏览器扩展的安全模型有相似之处——Chrome扩展运行在隔离的content script环境中,只能通过预定义的消息通道与页面交互,既保证了扩展的功能性,又限制了其潜在危害的范围。
作者在实测中给出了两个直观的例子。第一个是让它创建一个ASCII猫咪动画覆盖层,会在屏幕底部左右来回移动;第二个则是在右下角添加一个GUI计算器插件。整个过程中,用户只需用提示词描述需求,Harness在Creator模式下会自动加载编程技能,开发出对应插件,并在确认后动态加载到当前会话中。

更值得一提的是,这些新增插件可以实时启用、停用甚至移除,整个过程几乎不会带来意外的副作用。作者演示了如何随时"叫停"猫咪动画又重新启动,这种动态可组合的体验,正是Harness底层设计的直接体现。这种无副作用的动态组合能力在传统软件中极难实现——通常动态加载的模块会修改全局状态、注册事件监听器或分配系统资源,移除时很容易留下"残留物"导致内存泄漏或行为异常。Harness能做到这一点,正是得益于其底层的形式化理论保证。

背后的数学理论:Quartus演算体系
DeepSeek Harness基于一个名为 Quartus 的项目,并配有一篇正式的数学论文。其核心思想是:每个动作都可被逆转——每个操作都有一个对应的"反向动作"或"回退动作",本质上是一个逆操作。
这一思想在计算机科学中有着深厚的理论根基。可逆计算(Reversible Computing)最早由Charles Bennett和Rolf Landauer在物理学和信息论的交叉领域提出。Landauer原理指出,不可逆计算的每一次信息擦除都必然产生热量(具体为kT·ln2焦耳/比特)——这从热力学第二定律的层面证明了可逆计算不仅是编程技巧,更是物理世界的基本约束。在数学上,这与群论(Group Theory)中的逆元概念密切相关——在一个群中,每个元素都存在唯一的逆元素,两者组合等于单位元(恒等操作)。将系统操作建模为群结构,意味着系统状态变换具有严格的代数性质,可以进行形式化验证和推理。在软件工程实践中,这一理论的典型应用包括数据库的事务回滚(Transaction Rollback,通过Write-Ahead Log记录操作前状态,确保任何失败的事务都能完整撤销)、Git的版本控制(每次commit都是一个可逆的快照,git revert通过生成"反向补丁"来撤销变更)、以及Redux等状态管理库中的时间旅行调试(Time-travel Debugging,通过记录每次状态变更的action序列来实现任意时间点的状态重放和回退)。Harness将可逆计算理论应用于插件系统,意味着每次插件加载都会记录足够的信息来支持完美回退,这从数学上保证了系统状态的一致性,而非依赖经验性的"尽力而为"式撤销。
正是这套形式化的演算体系,保证了插件的动态组合、时间可组合性(同一插件在不同时间点的加载和卸载可以正确嵌套,不会出现"先开后关"与"先关后开"产生不同结果的情况)与空间可组合性(多个插件可以在同一时间安全共存而互不干扰,每个插件的状态空间是正交的),以及组件间依赖的声明式响应管理。这也解释了为什么用户可以随时添加或移除任意组件而不引发系统混乱。
一切皆可追踪:完全透明的AI执行过程
Harness的第二大特性是完全透明。作者特别强调,这一点"与Anthropic隐藏思考过程的做法完全相反"。
这里的对比指的是Claude在使用扩展思考(Extended Thinking)功能时,其内部推理链条(Chain of Thought)对用户部分不可见,OpenAI的o1模型同样如此——用户只能看到最终的"摘要"而非完整的推理步骤。这些公司的理由是出于安全和对齐(Alignment)考虑——暴露完整推理过程可能被用于越狱攻击(Jailbreaking)或提示注入(Prompt Injection),攻击者可以通过分析推理过程来反向工程出模型的安全护栏并加以绕过。此外,完整推理链条也可能暴露训练数据中的敏感信息或模型内部的"系统提示词"。这反映了AI行业中"透明度"与"安全性"之间的根本张力——一个长期存在于密码学(Kerckhoffs原则主张算法公开、密钥保密)、开源软件(Linux的安全性来自代码公开审查而非隐藏实现)等领域的经典辩题。DeepSeek选择完全透明的路线,既是技术差异化的选择,也暗示了其对开发者信任和AI可审计性(Auditability)的不同哲学立场,更接近开源社区"安全性应来自设计而非隐蔽"(Security through design, not obscurity)的理念——系统的安全不应依赖于攻击者不知道内部机制,而应依赖于即使完全了解机制也无法攻破的设计。
每一步推理过程都可追溯
在Harness中,每一次运行、每一条消息、每一次工具调用、每一个加载的技能,都可以被详细记录和图形化分析。这实际上属于AI系统可观测性(Observability)这一新兴技术领域。可观测性概念源自控制理论——匈牙利裔美国工程师Rudolf Kálmán在1960年提出,一个系统是"可观测的"当且仅当仅通过观察其输出就能完全确定其内部状态。在传统软件领域,可观测性的"三大支柱"是日志(Logs,记录离散事件)、指标(Metrics,衡量系统健康度的数值时序数据)和追踪(Traces,记录单个请求在分布式系统中的完整路径)——Google的Dapper分布式追踪系统和由此衍生的OpenTelemetry开放标准是这一领域的里程碑。随着AI Agent变得越来越复杂——涉及多轮工具调用、上下文切换、技能加载、多步推理等环节——传统的日志记录已经远远不够,因为开发者需要理解的不仅是"发生了什么",更是"AI为什么做出这个决定"。业界已经出现了LangSmith(LangChain团队开发的Agent追踪平台)、Weights & Biases(机器学习实验追踪工具)、Phoenix(Arize AI开发的LLM可观测性工具)等专门的AI可观测性产品,但这些通常是外部附加工具,需要额外的SDK集成和数据上报配置。而Harness将可观测性作为一等公民内建到系统核心中,这意味着每个操作在设计之初就考虑了如何被追踪和审计——不是事后添加的"遥测层",而是系统架构的基本组成部分。
作者在演示中创建了一个简单的Flask待办应用,随后进入"轨迹视图"(Trajectory View),可以逐步查看:系统提示词内容、用户提示词、加载的上下文、助手的思考过程与消息,以及具体的工具调用(比如调用Bash读取目录的确切载荷和返回结果)。这种细粒度的追踪使得开发者可以精确定位AI在哪一步做出了错误决策——例如,是因为系统提示词中缺少某条指令,还是因为工具返回了意外格式的数据,亦或是模型在多步推理中丢失了关键上下文。这对于构建可靠的AI驱动工作流至关重要,因为与确定性程序不同,AI Agent的行为具有概率性,同样的输入可能产生不同的输出路径,只有完整的执行追踪才能帮助开发者理解和改进系统行为。

此外,系统还提供了详细的统计数据,包括耗时、轮次、调用时间和持续时长。所有会话都可以导出为ZIP包,内含 session.json.l 文件——这种JSON Lines格式(每行一个独立的JSON对象,也称为JSONL或NDJSON)是大规模日志系统的标准做法。与普通JSON文件不同,JSONL格式无需解析整个文件就能读取单条记录(普通JSON必须完整解析才能访问任何字段),支持流式追加写入(无需像JSON数组那样维护闭合括号),且天然适合MapReduce等并行处理框架——因为每一行都是独立的处理单元,可以被任意分片和并行处理。OpenAI的微调数据格式、Amazon Kinesis的数据流、Elasticsearch的Bulk API都使用JSONL作为标准格式。它也方便开发者用grep、awk、jq等Unix命令行工具进行快速筛选和分析——例如 grep "tool_call" session.json.l | jq . 就能快速提取所有工具调用记录并格式化输出。从中可以逐行看到完整的执行过程。对于希望审计AI行为、调试Agent流程、或满足合规要求(如SOC 2审计要求所有系统操作可追溯、GDPR的数据处理记录义务)的开发者而言,这种透明度极具价值。
灵活的多模型接入方案
除了插件和可追踪性,Harness在模型接入上也相当开放。虽然首次运行会要求填入DeepSeek的API密钥,但用户完全可以在设置中接入其他提供商。
作者实测中通过OpenCode接入了GPT系列模型,还连接了本地运行的Ollama。Ollama是一个开源的本地大模型运行框架,它极大地简化了在个人设备上部署和运行开源LLM的流程——用户只需一条命令(如 ollama run llama3)即可下载并运行Llama、Mistral、Gemma等模型,无需手动处理模型量化(将32位浮点参数压缩为4位或8位整数以减少内存占用)、显存分配、推理引擎配置等复杂环节。Ollama在底层使用了llama.cpp(由Georgi Gerganov开发的纯C/C++推理引擎,以极高的效率在CPU和GPU上运行量化模型)等高效推理库,并提供了与OpenAI兼容的REST API接口(endpoint为 localhost:11434),这使得任何支持OpenAI API格式的工具都能通过简单修改base URL无缝接入本地模型。
作者具体跑在一台Dell Pro Max搭配GB10(即NVIDIA GB10超级芯片,这是基于Blackwell架构的AI工作站级芯片,提供高达数百TOPS的AI算力和大容量统一内存——统一内存架构允许CPU和GPU共享同一块内存池,避免了传统架构中CPU内存到GPU显存之间的数据拷贝瓶颈,对大模型推理尤为关键)的设备上,并在其上加载了包括1200亿参数的开源模型和Gemma模型。本地部署的优势在于数据隐私性(代码不离开本机,不经过任何第三方服务器,从根本上消除了数据泄露风险)和零API成本(推理时无需按token付费,对于高频使用场景可节省大量费用——以GPT-4o的定价为例,每百万输入token约2.5美元,密集编程助手使用每天可能消耗数百万token),但代价是需要昂贵的硬件投入——1200亿参数模型即使经过4位量化压缩(体积约缩减至原来的1/8),也需要至少64GB以上的统一内存或显存才能流畅运行,且推理速度通常远低于云端专用推理集群。
Harness支持Ollama接入意味着企业用户可以在完全离线(Air-gapped,即物理隔离、无任何网络连接)的环境中使用AI编程能力,这对涉及敏感代码的场景(如金融机构的交易系统需要满足监管数据本地化要求、国防承包商的项目受ITAR出口管制约束、医疗系统需遵守HIPAA对患者数据的严格保护规定)极为重要。用户既可以添加自定义提供商,也可以用API密钥接入。不过作者提到,目前无法直接连接ChatGPT订阅账户——这是因为ChatGPT Plus/Pro订阅的聊天接口(chat.openai.com)与OpenAI的开发者API(api.openai.com)是完全独立的产品和计费体系,前者是面向终端用户的固定月费制(每月20或200美元),后者是面向开发者的按用量计费制(按token数量收费),两者的账户系统、认证方式和接口协议完全不同。
值得关注但仍处于早期阶段
综合来看,DeepSeek Harness展现出了一条与Claude Code等主流工具截然不同的路线:极致模块化、完全透明、开放接入,再加上通过对话动态生成功能的Creator Mode。
不过需要清醒认识到,这仍然只是开发者预览版。正如作者反复强调的,目前很多操作流程还比较粗糙——插件开关需要手动改配置文件,生成的插件功能也不够完善(比如计算器按钮布局混乱)。这些插件目前也只对当前会话生效,尚需手动保存。这些都是"开发者预览"阶段的典型特征——系统的核心架构和概念验证(Proof of Concept)已经完成,但用户体验层面的打磨还未开始。在软件产品的成熟度模型中,这相当于从Alpha阶段向Beta阶段过渡——核心功能可用但边缘情况处理不完善、错误提示不友好、文档不完整。
但其未来前景值得期待:随着时间推移,Harness可能会形成一个成熟的插件生态系统,类似于VS Code的Extension Marketplace(目前拥有超过5万个扩展)或Obsidian的社区插件库(超过2000个社区插件)那样,由社区贡献的插件不断丰富工具的能力边界。如果Creator Mode成熟到足够可靠,它甚至可能模糊"用户"与"开发者"的界限——任何人都可以通过自然语言"开发"自己需要的功能,这与"无代码/低代码"(No-Code/Low-Code)运动的终极愿景不谋而合,但实现路径截然不同——传统无代码平台通过可视化拖拽来降低门槛,而Creator Mode则通过自然语言理解和代码自动生成来消除编程壁垒。对于关注AI编程工具演进方向的开发者来说,这个项目值得持续关注。它是否真能挑战Claude Code尚言之过早,但它提出的"透明+插件化"思路,无疑给整个领域提供了新的想象空间。
相关推荐

Claude Code创建者建议:大改动别急着写代码,先对齐再动手
Claude Code创建者Boris分享AI编程协作最佳实践:面对大改动,先读仓库提问、确认方案再编码、写完立刻验证。掌握这套流程,避免AI沿错误方向返工,提升编程效率。

HydraNet-VSM架构解析:Mamba与注意力机制并行融合的推理新思路
深入解析HydraNet-VSM混合架构设计提案,探讨Mamba状态空间模型与Attention注意力机制并行融合方案,以及Verified Step Memory验证循环如何解决思维链推理不忠实问题。

Seed7编程语言:无GC实现内存安全的独特设计
深入解析Seed7编程语言如何在不依赖垃圾回收(GC)的情况下实现内存安全,探讨其AOT编译、可扩展语法、整数溢出检查等核心特性,以及与C++、Rust、Java等主流语言的对比。