Rocky开源编程智能体:极简架构原生集成DeepSeek的Coding Agent

从零打造一个透明的Coding Agent
在Claude Code、Codex几乎统治编程智能体赛道的今天,两位偏算法背景的开发者(B站UP主CC和嘟嘟学姐)花了大约两个月的业余时间,做出了一个名为 Rocky 的开源编程智能体。它的定位很有意思——不是要打败Claude Code,而是要做一个足够简单、足够透明、可量化的coding agent实验框架。
Rocky这个名字来源于科幻小说《挽救计划》里那只热情又没有边界感的外星大蜘蛛工程师。这个人物设定也被带进了产品:Rocky在工作时会显示会"唱歌"的小音符,偶尔还会过分热情地帮你把测试全跑一遍——尽管你只是让它"看一下"代码。

作者最直观的感受是:第一版仅仅一两千行代码的东西居然能work。打开代码仓库看到"这么简单一个loop居然能跑通",恰恰说明了当下模型本身已经足够强大。这也是Rocky最核心的价值主张之一。
极简架构:几百行的Loop能做什么
Rocky最吸引人的地方在于它的代码量极小。整个项目用Python编写,代码量大约是其他Coding Agent的"零头":核心Loop只有几百行,系统提示词只有30到50行(约300–500 token),总计不到1000 token。
作为对比,Kimi的系统提示词大约是它的五六倍,OpenCode、Claude Code这类工具动辄几十万行代码(Claude Code约50万行),阅读起来极易"被绕晕"。而Rocky保持了整个Loop的透明性——无论是想直接使用,还是想学习"如何做一个Coding Agent",门槛都极低。
说个细节,Rocky最终交付版本采用的是最朴素的while true循环,而非ReAct或Reflection等更复杂的机制。ReAct(Reasoning + Acting)是一种将语言模型的推理链与工具调用交织执行的框架,由Google Research于2022年提出,理论上能提升决策质量;Reflection机制则让Agent在每步行动后自我评估并动态调整策略。然而作者实测后发现,在SWE-verified基准上的小规模测试(20/50/100条)中,这些改动带来的差异"不在统计显著范围内",因此选择了"保持尽可能简单"的原则——这些机制在增加Token消耗和延迟的同时,并不总能带来可量化的工程收益。
这其实回到了一个本质问题:为什么这么小的一个loop居然就能工作? Rocky用可复现的代码和本地轨迹,给出了一个可供拆解学习的答案。
原生集成DeepSeek搜索与Deep Research模式
Rocky的一大特色是深度整合了DeepSeek的原生搜索能力。这解决了一个实际痛点:如果你用Codex或Claude Code接第三方模型,自带的搜索功能往往会失效;而使用OpenCode等开源工具,搜索通常需要额外注册会员或自行接入MCP、搜索API。
Rocky直接调用DeepSeek原生搜索,用户只需花DeepSeek的API费用即可自带搜索,且搜索请求做了并行化处理,速度快、成本极低(搜索环节使用Flash模型)。
基于此,嘟嘟学姐主导开发了研究模式(Research Mode),包含Deep Research和Learn学习两种子模式。据作者实测,让Rocky调研"RSI(递归自我改进)"这类前沿概念,一轮即可返回约80篇参考文献并生成分层文档,成本约1元人民币。
作者还做了一个有意思的交叉验证:把Rocky返回的70多个链接交给GPT进行逐一核对,结果63个完全正确、10个部分正确、6个错误、2个缺失,链接准确率相当高。嘟嘟学姐补充了一个关键视角——对于真正的深度调研,召回率(能返回足够多有价值文献)往往比单纯准确率更重要。这一判断来自信息检索领域的经典权衡:精确率衡量返回结果中有多少是相关的,而召回率衡量所有相关结果有多少被成功找到。在学术调研场景中,漏掉一篇关键论文的代价远大于多返回几篇噪声文献,因为研究者有能力人工过滤冗余,却无法发现从未见过的重要文献。第一轮80条覆盖经典文献已经相当出色,而Codex这类工具通常不会一次帮你查这么多。
严格沙箱与本地轨迹落盘
安全是Rocky设计中被反复强调的重点。作者亲历过Claude Code、Codex"在你没反应过来的情况下删本地分支"的噩梦,Rocky自己也干过类似的事。因此Rocky做了一层较重的沙箱机制:
- 基于Docker的sandbox,未安装Docker则该功能不可用;
- 支持通过SSH方式由其他AI调用Rocky,但同样将其限制在沙箱内;
- 所有可能"闯祸"的功能(如memory、dream、主动催办)默认关闭(off)。

另一个核心设计是轨迹(trajectory)本地落盘。在大语言模型的强化学习训练中,轨迹指Agent从接收任务到完成任务全过程中的状态-动作-奖励序列,是训练奖励模型和进行策略优化的核心数据来源。Rocky没有服务端,纯粹是一个TUI客户端,所有搜索和模型请求发往模型服务端,其余数据全部保存在本地的 .rocky-code 文件夹。这带来了极高的透明度:用户可以随时调出使用历史、让Rocky写个Python脚本分析自己的高频用法,甚至对照本地轨迹研究"某次运行为什么没有返回期望结果"的因果关系。
作者对比指出,Codex导出全量聊天记录时工具调用与对话是分开存储且极其复杂,而Rocky"像一只透明的蜘蛛",整个运行过程一目了然。需要注意的是:轨迹存储可能在不知不觉中占用大量磁盘空间。
内置Benchmark与协同进化设想

Rocky区别于普通编程工具的关键,在于它内置了可一键运行的benchmark harness。作者的初衷是想知道:纯模型 vs. 模型+harness,在基准上到底表现如何?
- SWE-verified:这一基准由普林斯顿大学于2023年提出,从GitHub真实软件工程Issue中构建测试集,要求AI系统自动修复bug并通过对应单元测试,经人工审核过滤歧义问题后形成精选集,被认为是当前最接近真实工程场景的Coding Agent评估基准之一。作者测了100道题,两轮平均约80分,接近DeepSeek-V4-Pro官方的80+分。作者谨慎表示,这只能说明"harness没有破坏模型能力",而非harness本身多厉害。
- Deep-SWE:更严格的新基准,DeepSeek-V4官方分约8%,目前所有模型都"没及格"。作者接入后测了20题,目前得分仍为0——部分因为自己写的bug、部分因为限制了步数(超步即终止)。
对于其他工具(如Codex),要参与这类需要Docker的评测,得额外写脚本、经过多层调用;而Rocky"稍微改改代码就能一键运行",因此它更像一个附赠的Agent实验环境与教学样本。
更长远的方向在于模型与harness的协同进化。作者认为harness无法单独成长,必须依靠中间的trajectory数据做长程强化学习训练。Rocky预留的轨迹落盘机制本质上是一个微型离线RL数据管道——与DeepMind、OpenAI等机构在Agent训练中采用的trajectory replay思路一脉相承,只是规模和复杂度大幅简化。Rocky本质上是一个小型RL训练环境的雏形,并已预留了自进化(自反思、routine沉淀、memory、"做梦机制"筛选记忆重要性)等实验性组件。不过作者用了一个贴切的比喻:这就像拿到一个引擎去自造飞船,目前飞船能超光速飞行,但飞的过程中可能会掉一两个零件——RL部分尚未搭建,个人用户也很难攒够训练所需数据。
谁适合用Rocky

从两位作者的真实使用体验来看,Rocky目前更适合以下场景:
- 偏研究与轻量任务:文献调研、写可视化脚本等代码量较少的工作,成本低(按DeepSeek API付费,无需订阅昂贵会员)、速度快;
- 学习与教学:想理解"一个最小化的Coding Agent如何运行"的最佳实验教材;
- 可复现的Agent基准实验:一键跑榜、可查轨迹、易于二次改装。
已知局限同样明确:Rocky对大型复杂代码库的支持较弱,LSP功能默认关闭(需手动开启),单纯依赖grep/glob搜索大型代码库容易出错。此外,中英文提示词切换、模式切换会刷新缓存,但由于整体成本已经很低,作者认为这点缓存miss成本可以接受,"任务完成是第一位"。
值得一提的是,团队还开发了VS Code插件和基于Lean4的形式化证明(Lean Prover)实验功能。Lean4是由微软研究院Leonardo de Moura主导开发的新一代定理证明助手,被数学界和计算机科学界用于构建机器可验证的数学证明;DeepSeek Prover系列模型正是在Lean4环境下训练,在IMO级别题目上展现出接近专业数学家的推导能力。将Lean Prover集成进Coding Agent框架,代表了一个前沿方向:让AI不仅能写代码,还能对代码正确性给出形式化保证,在安全关键系统(航空、金融、密码学)中具有重要价值。这些前沿而实验性的功能,让Rocky不仅是一个工具,更成了一个观察AI能力边界的开放试验场。
对个人开发者而言,Rocky最大的增量或许不是"能训模型",而是那份彻底的透明——你能看清一个Agent究竟是怎么工作、怎么打榜、怎么翻车的。而这,正是当下众多闭源或臃肿的商业工具无法提供的价值。
核心要点
相关推荐

开源权重模型之争:安全与开放如何平衡
深入分析开源权重模型的核心争论:模型权重公开发布带来透明度与创新,但也引发安全滥用风险。本文探讨分级发布、红队测试等折中方案,解读开源AI背后的行业博弈与治理挑战。

抱怨如何侵蚀你的心智:注意力自我强化效应解析
习惯性抱怨正在训练大脑发现更多负面信息,形成恶性循环。本文从注意力自我强化机制出发,解析抱怨的心理侵蚀过程,并提供主动管理注意力、跳出负面循环的实用方法。

Steam恶意软件溯源:比特币、Cookie和外卖订单如何锁定攻击者
一起Steam恶意软件案件中,调查人员通过比特币交易链、Google Cookie和Uber Eats外卖订单三条线索交叉验证,成功溯源攻击者真实身份。深入解析数字取证技术与匿名幻觉。