SWE-2
Cognition发布的新一代代码智能模型,专门针对软件工程任务优化,旨在实现理解需求、定位bug、修改代码库并通过测试等端到端软件工程能力
时间轴 (近 90 天)
SWE-2采取在足够好的性能区间内把成本优势做到极致的务实路线,而非追求绝对性能第一
SWE-2的基准得分与竞品Fable 5.1相差不到一个百分点,但成本低了64%
与GPT-6 Astra相比,SWE-2得分落后几个百分点,但成本仅为对方的四分之一
完成相同任务时,SWE-2所需的交互轮次比前代SWE-1.7减少了58%,成本降低了81%,同时得分更高
SWE-2在Product Hunt上获得119个投票,当日排名第三,位列人工智能分类
Cognition推出了新一代编程模型SWE-2
SWE-2基于Kimi K3进行后训练(post-trained),并采用强化学习(RL)方法,同时对成本与能力两个维度进行优化
SWE-2已集成到Devin Desktop和CLI中,用户可直接使用
SWE-2在FrontierCode 1.1 Main基准测试上取得了50.0%的成绩
Cognition团队发布了SWE-2
还有 3 条时间轴事件
全部知识事实 (13)
SWE-2采取在足够好的性能区间内把成本优势做到极致的务实路线,而非追求绝对性能第一
50%待验证SWE-2基于Kimi K3进行后训练(post-trained),并采用强化学习(RL)方法,同时对成本与能力两个维度进行优化
50%待验证SWE-2已集成到Devin Desktop和CLI中,用户可直接使用
50%待验证SWE-2在FrontierCode 1.1 Main基准测试上取得了50.0%的成绩
50%待验证SWE-2的基准得分与竞品Fable 5.1相差不到一个百分点,但成本低了64%
50%待验证与GPT-6 Astra相比,SWE-2得分落后几个百分点,但成本仅为对方的四分之一
50%待验证完成相同任务时,SWE-2所需的交互轮次比前代SWE-1.7减少了58%,成本降低了81%,同时得分更高
50%待验证SWE-2的命名指向软件工程(Software Engineering)方向的能力升级
50%待验证SWE-2 是 Cognition 全新推出的编码模型,是 Devin 引擎的迭代版本,专门针对软件工程场景进行训练和调优
50%待验证Devin Voice 的能力由 GPT-Live 和 SWE-2 两套核心技术支撑,分别负责语音理解和代码生成
50%待验证Cognition推出了新一代编程模型SWE-2
50%待验证SWE-2在Product Hunt上获得119个投票,当日排名第三,位列人工智能分类
50%待验证Cognition团队发布了SWE-2
50%