Cognition推出SWE-2编程模型:性能逼近顶尖,成本直降64%

Cognition发布SWE-2编程模型,基于Kimi K3后训练,以四分之一成本实现接近顶尖的编程能力。
Cognition推出新一代编程模型SWE-2,核心策略是在保持接近顶尖性能的同时大幅压低成本。该模型基于Kimi K3进行后训练,采用强化学习同时优化能力与经济性两个维度。在FrontierCode 1.1基准测试中,SWE-2得分50.0%,与Fable 5.1相差不足一个百分点,但成本低64%;相比GPT-6 Astra,成本仅为其四分之一。与前代SWE-1.7相比,完成相同任务所需交互轮次减少58%、成本降低81%,得分反而更高。SWE-2已集成至Devin Desktop和CLI,代表了AI编程赛道从追求跑分转向追求效率与性价比的新趋势。
AI编程模型的竞争已经从单纯的能力比拼,转向了性能与成本的双重博弈。Cognition最新发布的SWE-2编程模型,正是这一趋势的典型代表——它没有一味追求跑分登顶,而是在保持接近顶尖水平的同时,把成本压到了竞品的三分之一乃至更低。

SWE-2 是什么
SWE-2 是 Cognition 推出的新一代编程模型,其技术路线值得关注:它基于 Kimi K3 进行后训练(post-trained),并采用了强化学习(RL)方法,同时对成本与能力两个维度进行优化。
这种"双目标优化"的思路,与过去很多模型只盯着基准测试分数的做法不同。在实际的软件工程场景中,开发者不仅关心模型能不能解决问题,更在意每次调用消耗多少 token、需要多少轮交互才能完成任务。SWE-2 从训练阶段就把这些经济性指标纳入了优化目标,这是它区别于纯粹"性能怪兽"的核心设计理念。
目前 SWE-2 已经集成到 Devin Desktop 和 CLI 中,用户可以直接使用。作为以 AI 软件工程师 Devin 而闻名的公司,Cognition 将自研模型与自家产品深度绑定,形成了从底层模型到上层应用的完整闭环。
性能与成本:核心数据拆解
从官方公布的数据来看,SWE-2 的定位相当清晰——用可接受的性能折损,换取显著的成本优势。
在 FrontierCode 1.1 Main 基准测试上,SWE-2 取得了 50.0% 的成绩。这个分数与竞品 Fable 5.1 相差不到一个百分点,但成本却低了 64%。换句话说,你几乎能拿到同等的编程能力,却只需要支付三分之一多一点的费用。
与更强的 GPT-6 Astra 相比,SWE-2 的得分落后几个百分点,但成本仅为对方的四分之一。对于大多数日常编程任务而言,这几个百分点的差距往往不足以抵消四倍的成本差异——尤其是在需要大规模、高频率调用模型的工程实践中。
相比前代的进步
SWE-2 最能说明问题的对比,其实是它与自家前代 SWE-1.7 的差距。
根据官方数据,完成相同任务时,SWE-2 所需的交互轮次减少了 58%,成本降低了 81%,同时得分还更高。这组数字揭示了一个关键信息:模型的进步不再只体现在"能力上限",更体现在"效率"上。
更少的交互轮次意味着模型能更快理解需求、更精准地一次性给出可用结果,减少了反复澄清和试错的开销。对于依赖 Agent 工作流的编程场景,轮次的减少直接转化为响应速度的提升和成本的下降。这也解释了为什么 Cognition 要在训练中同时优化成本——在 Agent 时代,一个任务往往要经过多轮调用,任何单轮效率的提升都会被成倍放大。
为什么"性价比"路线值得关注
SWE-2 在 Product Hunt 上获得了 119 个投票,排名当日第三,位列人工智能分类。这样的关注度,某种程度上反映了市场对高性价比编程模型的真实需求。
过去一段时间,AI 编程工具的竞争往往陷入"跑分军备竞赛",各家都在争夺基准测试的第一名。但对于真正的商业落地来说,跑分领先几个点的意义有限,而成本能否控制在可持续范围内,才决定了这类工具能否被规模化采用。
SWE-2 选择的正是一条更务实的路线:不追求绝对性能第一,而是在"足够好"的性能区间内,把成本优势做到极致。当一个模型能以四分之一的成本达到接近顶尖的表现时,它对企业和个人开发者的吸引力可能远超那些榜首但昂贵的选项。
结语
SWE-2 的发布,是 AI 编程赛道从"比能力"走向"比效率"的一个信号。基于 Kimi K3 后训练、用强化学习同时优化成本与能力的技术路线,加上与 Devin 产品的深度整合,让它在拥挤的编程模型市场中找到了差异化定位。对于关心投入产出比的开发者和团队而言,这类高性价比模型或许比追逐榜首更有实际价值。当然,官方公布的基准数据仍需在真实开发场景中进一步验证,其实际表现有待更多用户反馈来检验。
相关推荐

对抗AI代码腐化:规格、结果笔记与文件清单的实战方法
一位开发者用八个月、650次提交、4.3万行代码的实战,总结出防止AI智能体代码库腐化的方法:前置规格与验收标准、任务结果笔记、文件清单约束,以及用触发式钩子取代规则文件。核心洞察是——指令只是建议,机制才能在长会话中存活。

"Tokens Exhausted":一段机器人视频背后的AI焦虑
一段名为「Tokens Exhausted」的机器人视频在 Reddit 引发热议,网友已分不清它是否为波士顿动力真实作品。本文解析这段AI讽刺内容为何戳中神经,以及它折射出的合成媒体与LLM时代焦虑。

4千美元淘到全新DGX Spark:本地部署大模型的性价比之选
一位Reddit用户以4000美元在Craigslist淘到全新DGX Spark,用于本地托管AI模型。本文解析这笔交易背后的性价比、二手交易安全,以及本地部署大模型的兴起趋势。