mini-SWE-agent轮盘模式:随机切换大模型为何反而更强

反直觉的发现:随机切换模型比固定单模型更强
如果你的AI Agent在每一步推理时随机选择不同的大语言模型,会发生什么?直觉上,这听起来像是一种混乱的策略。但SWE-agent团队的最新实验表明,让mini-SWE-agent在GPT-5和Claude Sonnet 4之间随机切换,其在SWE-bench上的得分竟然超过了任何单一模型单独运行的成绩。
SWE-bench是由普林斯顿大学研究团队于2023年发布的软件工程基准测试,它从GitHub上真实的开源项目(如Django、scikit-learn、sympy等)中收集了数千个已解决的Issue和对应的Pull Request。每个测试实例要求AI系统阅读问题描述,定位相关代码文件,并生成正确的补丁来修复bug或实现功能。SWE-bench verified是经过人工验证的500个高质量子集,被广泛认为是衡量AI编程Agent能力的黄金标准。该基准的难度在于它要求模型具备代码理解、问题定位、跨文件推理和代码生成等综合能力,远超简单的代码补全任务。
这个被称为"轮盘模式"(Roulette Mode)的实验,核心改动极其简单——只是把 model.query(history) 换成了 random.choice([model1, model2]).query(history),仅此而已。Prompt完全不变,架构完全不变,却获得了1+1>2的效果。
![rss source: [mini-SWE-agent] Roulette mode!](/media/screenshots/source/10610_0.png)
mini-SWE-agent是什么:不到100行代码的极简Agent
要理解这个实验的意义,首先需要了解mini-SWE-agent的设计哲学。与功能丰富的swe-agent不同,mini是一个极简主义的软件工程Agent,其核心Agent类不到100行代码,却能在SWE-bench排行榜上取得竞争力十足的成绩。
mini-SWE-agent的三个核心设计原则:
- 唯一工具就是bash:不使用任何LM的tool-calling接口,这意味着它可以与任何模型配合使用。现代大语言模型(如GPT-4、Claude)提供了结构化的tool-calling(函数调用)接口,允许模型以JSON格式输出工具调用请求。这种方式的优势是输出格式规范、易于解析,但缺点是不同模型的tool-calling协议不兼容,且某些模型(尤其是开源模型)对该功能的支持参差不齐。mini-SWE-agent选择完全不使用tool-calling,而是让模型直接输出bash命令文本,这使得它成为真正的模型无关(model-agnostic)框架——任何能生成文本的LLM都可以即插即用,这也是轮盘模式能够如此简单实现的技术前提。在沙箱环境中运行时甚至不需要安装任何额外包。
- 完全线性的历史记录:每一步只是简单地追加到消息列表中,轨迹与传递给LM的消息完全一致,非常适合调试和微调。
- 无状态执行:每个动作通过
subprocess.run独立执行,而非维持一个有状态的shell会话。在Agent系统设计中,有状态Shell意味着维持一个持续运行的终端会话,命令之间共享环境变量、工作目录和进程状态。这虽然更接近人类开发者的工作方式,但带来了状态管理的复杂性——崩溃恢复、并发控制和沙箱隔离都变得困难。mini-SWE-agent选择的无状态执行模式牺牲了一些便利性,但换来了极高的可靠性和可扩展性。每个命令都是独立的、可重放的,这使得沙箱执行和规模扩展变得极其简单——只需将subprocess.run替换为docker exec。
正是这种极简设计,使得轮盘模式的实现变得异常简洁。没有复杂的路由逻辑,没有模型选择策略,纯粹的随机切换。
轮盘模式实验结果:GPT-5与Sonnet 4的协同增益
全量SWE-bench测试:组合超越单一模型
在SWE-bench verified的完整500个实例测试中,GPT-5与Sonnet 4的随机组合取得了比两个模型各自单独运行更高的分数。团队还尝试了交替模式(而非随机切换),在500个实例中解决了333个(66.6%),同样超越了两个模型的单独表现。
小规模多模型组合对比
在50个随机抽取的实例上,团队测试了更多组合:
| 模型组合 | 得分(50实例) |
|---|---|
| GPT-5 + Sonnet 4 | 39 |
| GPT-5 + Sonnet 4 + Gemini 2.5 Pro | 33 |
| GPT-5 + Gemini 2.5 Pro | 31 |
| GPT-5 + GPT-5-mini | 31 |
| GPT-5 mini + GPT-5 nano | 20 |
对比单模型基线:
| 单一模型 | 得分(50实例) |
|---|---|
| Sonnet 4 | 33 |
| GPT-5 | 32 |
| GPT-5-mini | 32 |
| Gemini 2.5 Pro | 29 |
| GPT-5-nano | 16 |
一个关键发现是:只有GPT-5和Sonnet 4的组合实现了超越单一模型的效果。这两个模型恰好处于旗鼓相当的竞争状态。当组合的模型之间性能差距较大时(如GPT-5与Gemini 2.5 Pro),组合得分和成本都只是落在两个模型之间,没有产生协同增益。
需要注意的是,50个实例的样本量存在统计功效的局限性。团队坦诚指出,随机抽取的子集恰好偏容易,所有分数都略高于完整500实例的得分。
成本分析:轮盘模式的性价比如何
性能与推理步数的关系
实验显示,轮盘模式的性能增益在约50步限制时趋于边际递减。有趣的是,这条曲线更接近GPT-5的表现模式,而非Sonnet 4缓慢攀升的特征。团队推测,这是因为两个模型中的任何一个都可以决定提交结果来结束运行,因此整体行为更接近"更早提交"的那个模型。
每实例成本约30美分
在最大性能点,每个实例的平均成本约为30美分,基本处于两个模型各自成本的中间位置。成本呈S型曲线增长,与性能提升的边际递减相呼应。
你可能没注意到,Agent类系统的成本分析本身就比较棘手——大部分开销花在了无法解决的实例上,因此平均成本高度依赖于运行时限制(如步数限制)的设置。
为什么随机切换大模型会提升性能
虽然团队没有给出明确的理论解释,但可以从几个角度来理解这个现象:
多样性假说:不同模型在不同类型的编程任务上有各自的优势和盲区。随机切换相当于引入了"认知多样性",降低了单一模型在特定类型问题上持续犯错的概率。这类似于机器学习中集成方法(Ensemble Methods)的核心思想——多个弱相关的预测器组合往往优于单一预测器。
集成方法的理论基础可追溯到Condorcet陪审团定理:如果每个独立决策者的正确率超过50%,那么多数投票的正确率会随参与者数量增加而趋近100%。在实践中,Random Forest通过对数据和特征进行随机采样来构建多棵决策树,Bagging通过bootstrap采样创建训练集的多个变体,Boosting则通过迭代地关注前一轮错误样本来构建互补的弱学习器。这些方法成功的关键前提是组合的模型之间需要具有足够的"多样性"——即它们的错误模式不能高度相关。如果所有模型犯相同的错误,组合不会带来任何增益。轮盘模式的成功恰好印证了GPT-5和Sonnet 4在错误模式上具有显著的互补性——它们由不同公司使用不同数据和训练方法构建,天然具备了集成学习所需的多样性条件。
打破思维定式:当一个模型在某个方向上陷入困境时,切换到另一个模型可能带来完全不同的解题思路,相当于一种隐式的"重启"机制。在多步推理的Agent场景中,模型容易陷入重复循环(如反复尝试同一种修复策略),随机切换模型可以有效打破这种循环,因为不同模型对相同上下文的"下一步行动"有不同的概率分布。
性能对等是前提条件:这种效果只在性能相当的模型之间出现,说明两个模型需要都"足够好"才能互相补充,而不是互相拖累。当一个模型明显弱于另一个时,弱模型的介入更多是在引入噪声而非多样性。
如何使用轮盘模式与未来展望
团队已经提供了便捷的使用方式,只需在运行mini-extra时切换到 swebench_roulette 配置即可:
mini-extra swebench \\\\
--subset verified \\\\
--split test \\\\
--shuffle \\\\
-o roulette-sonnet4-gpt5 \\\\
--workers 20 \\\\
-c swebench_roulette
更深层的启示在于:在Agent系统设计中,我们或许不应该执着于寻找"最好的单一模型",而是思考如何通过模型组合来获得超越个体的系统性能。当前GPT-5和Sonnet 4恰好处于性能接近的"甜蜜点",使得这种简单的随机策略就能产生正向效果。
未来值得探索的方向包括:更智能的模型路由策略(而非纯随机)、针对不同任务阶段选择不同模型、以及在更多Agent场景中验证这一发现的普适性。模型路由(Model Routing)是近年来LLM应用中的热门研究方向,其核心思想是根据输入的特征(如任务难度、领域、长度等)动态选择最合适的模型来处理请求。代表性工作包括Martian的模型路由器、RouteLLM等,它们通常训练一个轻量级分类器来预测哪个模型最适合当前查询,从而在成本和性能之间取得最优平衡。然而轮盘模式的发现提出了一个有趣的反例:在Agent的多步推理场景中,即使是完全随机的路由策略也能产生正向效果,这暗示在序列决策场景中,多样性本身可能比精确匹配更重要——这与单次查询场景下的最优路由逻辑形成了鲜明对比。
但至少目前,这个实验告诉我们——有时候,最简单的方法就是最好的方法。
核心要点
相关推荐

WorkBuddy安装MCP连接器与Skill技能同步完整教程
详解WorkBuddy安装本地MCP连接器,通过AI对话实现Skill技能在Cursor等多个AI工作台间一键迁移与自动同步的完整操作流程。

激光雷达揭秘古城:LiDAR如何重写失落文明史
探索LiDAR激光雷达技术如何穿透沙漠与丛林,揭示约旦塞拉古城的地下水窖系统和太平洋南马都尔水上巨城的隐藏建筑,重新书写失落文明的历史。

阿波罗计划的灾难与荣耀:重返月球前必须回望的历史
从阿波罗1号的致命火灾到阿波罗8号的绕月冒险,再到阿波罗11号的成功登月,回顾阿波罗计划中那些鲜为人知的灾难、恐惧与妥协,以及对当下重返月球的深刻启示。