DeepSeek Harness实测:安装配置+ComfyUI插件驱动AI创作全流程

前言:国产Agent终于能打了
在AI编程与Agent工具长期被Claude Code、Codex等海外产品主导的当下,DeepSeek Harness的出现让国内开发者眼前一亮。B站UP主欧阳经过一周的深度体验后给出了三字评价:"行到爆"。简单来说,它已经具备了成为国内"国民级"AI Agent工具的潜质。
AI Agent(智能体)是指能够自主感知环境、制定计划并执行任务的AI系统,区别于传统的单轮问答模型。在编程领域,Agent工具能够理解代码库上下文、调用终端命令、读写文件并进行多步推理。Claude Code由Anthropic推出,Codex由OpenAI推出,二者均基于各自的大语言模型构建,具备代码生成、调试和重构能力。这类工具的核心技术架构包括工具调用(Tool Use/Function Calling)、上下文窗口管理以及ReAct(Reasoning + Acting)推理框架,使模型能够在思考与行动之间交替迭代,最终完成复杂任务。具体来说,ReAct框架让Agent在每一步先生成推理链("我需要先读取这个文件来理解项目结构"),然后选择并执行一个具体动作(调用文件读取工具),再根据返回的观测结果进行下一轮推理。这种"思考-行动-观察"的循环使Agent能够处理需要多步规划的复杂任务,而Tool Use机制则为模型提供了与外部世界交互的标准化接口——模型输出结构化的函数调用指令,由运行时环境解析并执行对应的系统操作。
本文将基于其实测经验,系统梳理DeepSeek Harness的入门配置方法,并重点解析一个能够驱动ComfyUI工作流的自研插件——这或许代表了国产AI工具链走向成熟的一个缩影。
DeepSeek Harness入门:从安装到模型配置
三种安装方式,桌面版最亲民
DeepSeek Harness官方提供了两种主流安装方式:一是通过NPX命令(需预装Node.js),二是通过Git源码本地编译启动。这两种方式对新手并不友好。
NPX是Node.js生态中的包执行器(Package Runner),随npm 5.2+版本自动安装,它允许开发者无需全局安装即可直接运行npm包中的命令行工具。Node.js则是基于Chrome V8引擎的JavaScript运行时环境,使JavaScript能够在服务器端运行。许多现代AI工具选择Node.js作为运行时,是因为其事件驱动的非阻塞I/O模型非常适合处理大量并发的API请求和流式输出——当Agent同时等待多个API响应时,Node.js的事件循环(Event Loop)机制可以高效地在单线程中调度这些异步操作,避免了传统多线程模型中的线程切换开销和资源竞争问题。这也解释了为什么从Claude Code到DeepSeek Harness,主流Agent工具不约而同地选择了Node.js技术栈。通过Git源码编译则需要开发者具备版本控制工具Git的使用经验,以及对依赖管理(如npm install解析package.json中的依赖树)和构建流程(如TypeScript编译、资源打包)的基本理解。
更推荐的做法是使用社区提供的桌面版(DSH Desktop)。这个开源方案有官方上游团队成员参与,可以视为变相的官方桌面客户端。它已兼容Windows和Mac系统,目前最新版本为2.02,下载安装文件后一键运行即可,无需任何命令行操作。桌面版本质上是基于Electron框架封装的客户端应用,Electron通过将Chromium浏览器内核与Node.js运行时打包在一起,使Web技术构建的界面能够以原生桌面应用的形式运行,VS Code、Slack等知名工具均采用相同的技术方案。

API Key配置与第三方模型接入
首次运行需要在DeepSeek开放平台创建API Key并填入。API Key是一种身份认证令牌,用于标识调用者身份并进行用量计费。开发者在DeepSeek开放平台注册后,系统会生成唯一的密钥字符串,每次API请求都需在HTTP请求头的Authorization字段中携带该密钥(通常格式为Bearer sk-xxxx)。服务端通过验证Key的有效性来决定是否处理请求,同时将每次调用的Token消耗量关联到该Key对应的账户进行扣费。出于安全考虑,API Key应被视为密码级别的敏感信息,不应硬编码在公开代码仓库中。启动后的界面极其简洁,UP主形象地将其类比为"DeepSeek版的Codex"——旁边只有一个聊天栏,但实际功能要比Codex更丰富,同样支持插件生态。
在模型配置上,除了直连DeepSeek官方,还可以接入第三方中转API。第三方中转API(如文中提到的端脑云)本质上是API网关代理服务,它们批量采购模型供应商的调用额度,再以更低的单价分销给终端用户,这种模式类似于云计算中的RI(预留实例)转售。从技术角度看,中转服务充当了反向代理(Reverse Proxy)的角色:客户端请求先到达中转服务器,中转服务器在请求头中替换为自己的高权限API Key后转发至原始模型服务商,响应数据再原路返回给客户端。这种架构还带来了额外的好处,比如请求负载均衡、多供应商故障切换以及统一的用量监控面板。UP主实测使用的是端脑云(CEP)的端点,通过"添加自定义提供方"填入Base URL和Key,即可检索并勾选所需模型(如Flash、智谱GLM等)。其Base URL是中转服务的API端点地址,替换官方的默认地址后,请求会先经过中转服务器再转发至模型提供方,从而实现价格优惠和多模型聚合。第三方渠道的优势在于价格通常比官方更低,且模型选择更丰富——用户可以在同一个接口下切换使用DeepSeek、智谱、Qwen等不同厂商的模型。
三种工作模式的差异
Harness提供了三种运行模式,理解它们的区别对高效使用至关重要:
- 标准模式:具备全部Harness功能,包括命令行、Agent调度、子Agent、Skills加载等,是日常办公的首选。子Agent(Sub-Agent)是指由主Agent动态生成的独立执行单元,负责处理特定子任务——例如主Agent在分析一个大型项目时,可能派生出一个子Agent专门负责代码审查,另一个子Agent负责文档生成,各自独立运行后将结果汇总给主Agent。
- PTC模式:支持工具的连续链式调用,适合批量脚本操作,在已有完整Skills办公流程时效率更高。PTC(Persistent Tool Chain)模式下,Agent会将多个工具调用串联为一条执行链,中间步骤的输出自动作为下一步的输入,减少了每步推理的开销。
- 创造模式:可查看并修改所有插件,用于构建自己的插件、改写Harness框架。这种模式赋予了开发者对Agent行为的完全控制权,类似于软件开发中的"开发者模式"。
Harness插件生态:真正的杀手锏
插件市场安装方法
桌面版初始并未内置插件市场,需要手动安装。方法是访问社区的awesome-DSH-plugin项目,复制其安装命令行,在Harness的工作区对话中发送即可自动完成安装。这种通过对话安装插件的方式本身就体现了Agent工具的独特交互范式——用户用自然语言下达指令,Agent解析意图后自动执行git clone、依赖安装、配置注册等一系列操作。安装后重启应用,设置页面就会出现"插件市场"选项。
值得一提的是使用体验:由于底层跑的是DeepSeek Flash模型,每秒token输出可达100多,效率远超需要解决网络问题的Codex或Claude Code。Token是大语言模型处理文本的基本计量单位,模型并不直接处理字符或单词,而是将文本切分为Token——中文场景下约1.5-2个汉字对应一个Token,英文中一个常见单词通常为1个Token,而编程语言中的特殊符号可能独占一个Token。模型的输入输出长度、处理速度和计费都以Token为单位衡量。每秒100+ Token的输出速度意味着每秒可生成约50-70个汉字,接近人类正常阅读速度,这使得Agent的执行过程几乎可以实时跟随。UP主强调"一行一行很舒服,它会告诉你在做什么",且缓存命中率高达91%,大幅降低了实际成本。所谓缓存命中率指的是KV Cache(键值缓存)的复用率——当连续对话中前缀内容与上一轮相同时,模型可以直接复用已计算的注意力矩阵,无需重新计算。KV Cache的原理源于Transformer架构中的自注意力机制:每一层网络都会为每个Token计算Key和Value向量,这些向量在生成后续Token时需要被反复引用。如果对话的前N个Token与上次请求完全相同,服务端可以直接从缓存中加载这些已计算的KV对,仅需为新增的Token执行前向传播。DeepSeek的缓存命中Token价格仅为未命中价格的十分之一,因此高缓存命中率意味着实际费用大幅下降。以91%的命中率为例,实际平均单价约为标准价格的19%(0.91×0.1 + 0.09×1.0),这也解释了为什么Agent工具的多轮对话场景特别适合DeepSeek的计费模型——因为每轮对话都会携带大量重复的上下文前缀。

丰富的UI增强插件推荐
插件市场内容极为丰富且每日更新,涵盖UI增强、用量统计、主题外观等多个维度。UP主推荐安装类似Codex右侧扩展窗口的插件,可以直观查看文件夹内容、预览文件结构和代码。此外还有集成任务看板、桌宠、终端、浏览器等功能的WebUI插件供选择。
安装过程中若遇到脚本被拦截,只需点击"放行脚本"即可继续。这种安全机制类似于浏览器的内容安全策略(CSP),默认阻止未经授权的脚本执行以防止恶意代码注入,用户需显式授权后才能运行第三方插件的脚本。安装完成后,界面会新增检测更新、文件夹面板、终端等按钮,整体布局趋近于VS Code的开发体验。这也印证了插件的本质:每个插件都是Harness产品的一部分,通过不同插件的组合,用户可以打造属于自己的差异化工具界面。 这种设计哲学与VS Code的Extension生态一脉相承——核心程序提供最小化的基础框架,所有高级功能都通过插件按需加载,既保证了轻量启动又提供了无限的扩展可能。
核心亮点:ComfyUI驱动插件深度解析
让Agent接管AIGC工作流
本次分享的重头戏,是UP主花两天时间开发的开源ComfyUI插件。其核心价值在于:让DeepSeek Harness的Agent能够识别、管理并驱动ComfyUI的完整工作流,实现AI创作的自动化编排。
ComfyUI是一款基于节点(Node)的开源图形化AI图像/视频生成工具,采用有向无环图(DAG)的工作流架构。用户通过拖拽和连接不同功能节点(如模型加载、提示词编码、采样器、VAE解码等)来构建完整的生成流水线。DAG(Directed Acyclic Graph,有向无环图)是一种只允许单向流动且不存在循环的图数据结构,它天然适合表达数据处理流水线——数据从源头节点出发,经过一系列处理节点的变换,最终到达输出节点。在ComfyUI中,一个典型的文生图工作流可能包含:CheckpointLoader(加载模型权重)→ CLIPTextEncode(将文本提示词编码为向量)→ KSampler(执行扩散采样)→ VAEDecode(将潜空间表示解码为像素图像)→ SaveImage(保存结果)。每个节点封装了一个独立的计算单元,节点之间的连线定义了数据的流向和类型约束。相比Stable Diffusion WebUI的表单式界面,ComfyUI的节点化设计提供了极高的灵活性,用户可以精确控制生成过程中的每一个环节。其底层支持Stable Diffusion、SDXL、Flux、HunyuanVideo等多种模型架构,已成为AIGC社区中最受欢迎的创作工具之一。
该插件通过Web版接入(需从桌面版切换),配置本机或服务器的ComfyUI地址(默认8188端口)、Key以及网络回环地址。8188是ComfyUI默认的HTTP服务端口,ComfyUI启动后会在本机开启一个轻量级Web服务器,通过RESTful API暴露工作流提交、状态查询、历史记录获取等接口。若使用桌面版ComfyUI,还需设置listen启动参数(即--listen 0.0.0.0)以确保内网可被监听到——默认情况下ComfyUI仅监听127.0.0.1(本机回环地址),添加--listen参数后会监听所有网络接口,使局域网内其他设备或服务能够访问其API。
从图工作流到API工作流的自动转换
插件面板包含三个核心流程。第一步是工作流的识别与提取:ComfyUI的图工作流(graph workflow)无法直接用于API请求,必须转换为API工作流。传统做法需要手动"导出API",而该插件能自动识别图工作流并提取转换。
从技术层面看,图工作流是面向人类用户的可视化表示,包含节点的位置坐标、分组信息、UI布局等元数据,以JSON格式存储。一个图工作流JSON文件通常包含nodes数组(每个元素含id、type、pos坐标、size尺寸、widgets_values等字段)和links数组(定义节点间的连接关系),文件体积可能是API工作流的数倍。而API工作流则是面向程序调用的精简格式,剥离了所有视觉层信息,只保留节点类型、输入参数和连接关系,可以直接通过HTTP POST请求发送给ComfyUI的/prompt端点执行。两者的数据结构差异显著:图工作流中节点以数组形式存储且包含坐标属性,API工作流则以节点ID为键的字典结构组织,每个节点仅包含class_type和inputs字段。例如,图工作流中的{"id": 3, "type": "KSampler", "pos": [400, 200], "widgets_values": [42, 20, 8, ...]} 在API工作流中会被转换为{"3": {"class_type": "KSampler", "inputs": {"seed": 42, "steps": 20, "cfg": 8, ...}}}。这种转换是实现程序化调用ComfyUI的必要步骤,也是该插件自动化能力的技术基础。

这里有个关键经验:最适合转换的是单一执行流程,即只有一个从加载模型到图像/视频保存的完整链路。对于多流程组合的复杂工作流(例如同时包含文生图和图生图两条独立流水线的工作流),插件支持"分量剔取",可选择整体剔取、分流剔取或提取节点数最多的主流程。这一设计背后的考量是:Agent在调用工作流时需要明确的输入输出映射关系,单一流程具有清晰的数据流向,而多流程混合可能导致参数注入的歧义。
参数化控制:Agent自主调参的精髓
转换为API工作流后,插件会自动提取采样步数、随机种子、时长、分辨率等基础参数,并要求用户为工作流填写描述和标签(如"文生视频""图生视频"),让大模型能够判断该调用哪个流程。这些参数在扩散模型中各有特定含义:采样步数(Steps)决定了去噪迭代次数,步数越多生成质量通常越高但耗时也越长;随机种子(Seed)控制了初始噪声的分布,相同种子在其他参数不变时可以复现完全一致的生成结果;CFG(Classifier-Free Guidance Scale)调节模型对文本提示词的遵循程度,值越高越严格遵循提示但可能牺牲多样性。

UP主对这一设计的理解颇具洞见:"这就是Coze、n8n唯一缺少的——对工作流参数的变通性。"Coze是字节跳动推出的AI Bot开发平台,n8n是一款开源的工作流自动化工具,二者都支持通过可视化方式编排AI工作流,但在参数的动态控制上相对固化——通常需要预先定义所有变量和取值范围。传统方案下让模型每次输出完整工作流会消耗大量Token(一个中等复杂度的ComfyUI工作流JSON可能包含数千个Token),而该插件只需复制模板并覆盖提取出的参数即可。你想让Agent控制哪些参数,就提取哪些参数,既灵活又节省成本。这种"模板+参数覆盖"的设计模式在软件工程中被称为模板方法模式(Template Method Pattern),它将不变的骨架结构与可变的细节参数分离,是平衡灵活性与效率的经典方案。
破解DeepSeek无视觉能力的巧思
DeepSeek目前不具备视觉模型(即不支持多模态输入),无法接收和理解图像。视觉语言模型(VLM,Vision-Language Model)如GPT-4o、Claude 3.5 Sonnet等,通过视觉编码器(如ViT)将图像转换为向量表示后与文本Token共同送入语言模型处理,从而具备"看图说话"的能力。DeepSeek目前仅提供纯文本模型,这意味着在图生图、图生视频等需要理解参考图像的AIGC场景中,Agent无法自主分析图片内容来生成合适的提示词。
针对这一痛点,插件设计了"加载区"方案:可读取仓库中的图像、视频、音频资产,Agent通过文件名将图片传给图生流程。这种方案将图像理解的责任转移给了用户——用户需要用有意义的文件名(如sunset_beach_reference.jpg)来帮助Agent理解图片的用途。UP主坦言这是"比较不智能"的临时方案,未来计划接入独立的视觉模型进行图像反推翻译(即Image-to-Text,利用视觉模型生成图片的文本描述),以获得更精准的效果。
同步与异步:智能调度的执行机制
插件的Skills中定义了两种执行方式:同步会阻塞对话直到生成完成,异步则不阻塞,任务提交后Agent可继续处理其他请求,生成完毕后主动通知用户。
从技术角度看,同步(Synchronous)执行采用阻塞式调用模式:Agent发出生成请求后会持续等待ComfyUI返回结果,期间无法处理其他任务,这类似于打电话时必须等对方说完才能继续。异步(Asynchronous)执行则采用非阻塞模式:Agent提交任务后立即释放控制权,通过WebSocket长连接或轮询机制监听任务状态,任务完成时触发回调通知。WebSocket是一种在单个TCP连接上进行全双工通信的网络协议,与传统HTTP请求-响应模式不同,它允许服务端主动向客户端推送消息。ComfyUI正是通过WebSocket实时推送生成进度(如当前采样步数、预计剩余时间等),客户端无需反复发起HTTP请求即可获取最新状态。在AIGC场景中,一个视频生成任务可能耗时数分钟甚至数十分钟,异步模式使Agent能够同时管理多个并行任务,极大提升了工作效率。这与操作系统中的进程调度和Web开发中的异步I/O是同一设计思想——通过事件驱动架构最大化系统吞吐量,避免宝贵的计算资源在等待I/O操作时被白白浪费。
这一机制为后续的智能编排奠定了基础——Agent可以并行调度多个视频生成任务,24小时不间断产出内容。例如,Agent可以同时向ComfyUI提交5个不同提示词的视频生成任务,在等待期间继续与用户对话或处理其他工作流编排,当任意任务完成时立即通知用户并展示结果。
生成结果会通过"回显"功能直接在对话窗口中展示,支持图像预览和视频播放。需注意回显发生在工具调用阶段,而非最终生成后。
Skills机制与使用费用分析
三层Skills兼容体系
Harness的Skills机制兼容Agent、Codex的规范,分为三个层级:项目级(项目根目录的.agent/.skill)、用户级(C盘用户根目录的全局Skills)以及插件内置的skills.js。
Skills机制本质上是一种分层的系统提示词(System Prompt)注入方案,灵感来源于Anthropic Claude的CLAUDE.md和OpenAI Codex的AGENTS.md规范。这两个文件规范了一种约定:开发者将项目特定的指令(如"使用TypeScript而非JavaScript""测试前先运行lint""不要修改migrations目录下的文件")写入项目根目录的Markdown文件,Agent在初始化时自动读取这些规则并将其注入系统提示词中。Skills机制在此基础上进一步发展,允许开发者将特定领域的指令、约束和操作规范以文件形式持久化存储,Agent在启动时自动加载这些规则到上下文窗口中。三层优先级设计(插件内置→用户级→项目级)遵循了软件工程中经典的配置覆盖模式(类似于CSS的层叠规则或Git的配置优先级):越靠近具体项目的配置优先级越高,项目级规则可以覆盖用户级的通用偏好,用户级规则可以覆盖插件的默认行为。这种机制使得Agent的行为可以被精确定制,而无需每次对话都重复说明规则。
插件的工作流程逻辑正是写成内置Skills与插件绑定,实现了功能的模块化封装。这意味着当用户安装ComfyUI插件后,Agent自动获得了"如何识别工作流类型""如何提取和设置参数""何时使用同步/异步模式"等领域知识,无需用户手动编写复杂的提示词。
费用成本:便宜但仍有优化空间
UP主坦诚地分享了费用数据:开发这个插件的对话跑了100多轮、2000多步,消耗了500-600M(百万)的Token,成本约300元左右,超过了Claude Code一个月170元(20美元)的订阅费用。以500M Token为例,按DeepSeek当前的输出价格(约每百万Token 4元人民币,缓存命中后降至0.4元),考虑91%的缓存命中率,实际平均成本约为每百万Token 0.76元。对于日常轻度使用的开发者来说,月费用可能远低于海外订阅方案。
最大的遗憾在于DeepSeek没有推出订阅套餐,只能按API用量计费。按量付费(Pay-as-you-go)模式虽然对轻度用户友好,但对重度使用者来说存在费用不可预测的焦虑——开发者无法提前知道一个复杂任务会消耗多少Token,这与Claude Code的固定月费形成了鲜明对比。工作时段使用费用较高,若在凌晨或深夜使用可以便宜约三分之一。这种动态定价机制反映了GPU算力的供需关系——白天工作时段并发请求量大,服务器负载高,通过价格杠杆引导用户错峰使用以平衡负载。UP主呼吁DeepSeek推出订阅制,让用户使用更加自如。
结语:国产AI工具链的成熟信号
经过一周的深度使用,UP主的核心判断是:国内模型与应用产品正在快速追赶海外水平。DeepSeek Harness凭借高速的token输出、丰富的插件生态和亲民的桌面版,配合可自研的ComfyUI驱动插件,已经能够胜任从代码开发到AIGC内容自动化生成的复杂场景。
虽然在视觉能力、订阅计费等方面仍有提升空间,但这套国产Agent工具链所展现出的开放性、可扩展性和实用性,无疑是一个值得期待的信号。值得关注的是,这种"基础模型+Agent框架+插件生态+领域工作流"的四层架构正在成为AI工具的标准范式——正如移动互联网时代的"操作系统+应用商店+App+垂直服务",谁能率先建立起健康的生态飞轮,谁就有可能在下一轮AI基础设施竞争中占据有利位置。对于希望搭建自主可控AI创作流水线的开发者而言,DeepSeek Harness值得一试。
核心要点
相关推荐

LangGraph入门指南:AI Agent的操作系统全解析
LangGraph 被称为 AI Agent 的操作系统,本文系统梳理其与 LangChain 的关系、状态节点边三大要素、持久化 checkpoint、human-in-the-loop 及子图等核心能力与学习路径。

吴恩达谈Agentic AI:拨开炒作看智能体构建的核心技能
吴恩达 Agentic AI 课程开讲,剖析智能体炒作背后的真实价值。从客户支持、法律文档到医疗诊断的落地场景,揭示评估与错误分析为何是构建智能体工作流的核心技能。

吴恩达谈Agentic AI:构建智能体应用的核心方法论
吴恩达 Agentic AI 课程深度解读:从术语被过度炒作说起,剖析智能体工作流在客户支持、深度研究、法律与医疗诊断中的真实应用,并揭示优秀开发者依靠评估(Evals)与错误分析的纪律化开发流程这一核心方法论。