OSWorld 2.0测评:最强AI Agent完成率仅20%,长流程是致命短板

短任务高分的泡沫被戳破
当前的AI Agent已经能帮我们浏览网页、管理文件甚至写代码,但它们在真实复杂工作里究竟能做到什么程度,一直缺乏权威的衡量标准。XLANG实验室最新发布的OSWorld 2.0基准测试,正是为了填补这个评估缺口而生。
基准测试的设计质量决定了我们对AI能力的认知是否准确。 历史上,ImageNet、GLUE、SuperGLUE等基准测试的相继"饱和"推动了深度学习的一轮轮突破,但也暴露出一个共同问题:模型往往针对基准过拟合,在测试集上表现出色,在真实场景中却表现平平。以ImageNet为例,顶尖模型在2017年前后已将错误率压至人类水平以下,但研究者随后发现,这些模型在稍作分布偏移的数据集(如ObjectNet)上准确率骤降20-30个百分点——它们学到的是数据集统计规律,而非真正的视觉理解。GLUE和SuperGLUE同样在短短数年内被"攻克",迫使研究者不断设计更贴近真实理解的任务。
GLUE(General Language Understanding Evaluation)和SuperGLUE是自然语言处理领域最具代表性的综合评测套件。GLUE于2018年发布,包含情感分析、文本蕴含、问答等9项任务;由于顶尖模型仅用一年便超越人类基线,2019年推出了难度更高的SuperGLUE。然而SuperGLUE同样在2021年前后被模型"攻克"。这一反复循环揭示了语言理解基准测试的深层困境:任何固定的测试集,一旦被研究社区大规模针对性优化,都会逐渐丧失区分"真实理解"与"模式记忆"的能力。正因如此,学界开始转向动态基准(如Dynabench,允许研究者持续添加模型容易出错的新样本)和以任务完成度为核心的能力评测框架,OSWorld系列正是这一趋势在计算机操作领域的具体体现。
值得注意的是,当模型在某一基准上的得分接近或超越人类水平时,研究社区往往误将其解读为"该能力已被解决",而非"该评估工具已失效"。这种认知偏差会系统性地误导资源分配和研究方向——OSWorld 2.0的设计者们显然从这段历史中汲取了教训,选择从任务时长、应用广度、评分粒度三个维度同时提升难度门槛,而非仅仅增加任务数量。这种历史轮回在AI Agent领域正在重演。这种现象在AI Agent领域尤为突出——桌面操作基准若只包含短平快任务,模型只需记住有限的操作模式即可获得高分,完全不需要具备真正的"工作流规划"能力。
此前的OSWorld 1.0正是这种评估局限的产物,营造了一种"桌面操作已被解决"的错觉——Claude Opus在1.0上能达到83.5%的准确率。但仔细分析就会发现,那些任务大多是短平快的操作,最多涉及一两个应用,只奖励独立完成的小步骤,根本不要求连贯的长流程工作。这种高准确率严重高估了AI端到端完成真实工作的能力。
OSWorld 2.0则完全换了一个量级:它包含108个长流程真实计算机任务,熟练人类完成这些任务的中位数时间是1.6小时,约为1.0版本(2分钟)的48倍。主流AI代理完成每个任务平均需要超过300步,而1.0版本只需30步左右。仅从这个量级差距,就能看出两个基准之间难度的鸿沟。
三大设计原则与真实环境搭建
OSWorld 2.0的设计遵循三个核心原则:
- 真实工作流:所有任务来自真实专业场景,通过专家访谈和专业标注员调研得来,输入材料也是真实材料改编,而非人工合成;
- 长流程结构:任务难度来自多个应用之间相互依赖的步骤,而不是简单重复或无关子任务的拼接;
- 多样化挑战点:每个任务标注了10种能力测试维度,涵盖跨源推理、隐式状态推断、冲突消解、动态环境应对等。
为了实现这些目标,团队搭建了极为完善的测试环境。在可复现性危机日益受到重视的AI研究领域,自托管31个任务相关网络服务的工程选择具有重要的方法论意义。AI研究领域的可复现性危机在近年来受到广泛关注——大量实验结果因原始代码缺失、依赖特定硬件或外部服务变更而无法复现。真实互联网环境存在三大评估障碍:网站界面频繁更新导致截图识别失效、反爬机制干扰自动化测试、以及历史状态不可重置导致实验无法重复。通过自建邮箱服务、银行门户、团队聊天工具等,研究团队实现了对测试环境的完全掌控,任何研究者都能在相同初始状态下复现实验——这种将"评估基础设施"视为与"评估任务本身"同等重要研究产物的理念,是构建可信赖知识积累体系的基础。桌面应用也从1.0的LibreOffice、GIMP、VS Code等,扩展到了Slack、LinkedIn、Reaper、WPS、GitLab、Overleaf、Zotero等专业软件。

每个任务都预设了一个连贯的用户档案作为初始状态,工作区可能包括本地文件、打开的文档、浏览器标签、账户记录、历史消息等。这些材料围绕统一档案设计,不同来源的标识符、日期、金额均保持一致。
模拟用户与动态环境
测试中有两个巧妙设计值得关注。其一是模拟用户:部分任务存在缺失证据或模糊约束,AI必须主动通过用户渠道询问澄清,模拟器只返回配置好的有限信息——这测试的是AI"知道自己何时该问"的能力。其二是动态环境:自托管服务会在任务执行过程中注入新的邮件或聊天消息,考察AI能否持续监控渠道、识别新约束并修正此前决策,而不是把初始状态当成最终状态一路执行到底。
值得注意的是,这两项设计触及的正是AI Agent(人工智能代理)架构的核心挑战。当前主流的计算机操作Agent依赖视觉-语言模型(VLM)来理解屏幕状态,再通过工具调用执行具体操作,其结构由感知、规划、执行三层构成。感知层负责将屏幕截图转化为结构化的环境描述;规划层基于当前状态和任务目标生成行动序列,通常借助思维链(Chain-of-Thought)推理实现;执行层则将规划输出映射为具体的鼠标点击、键盘输入或API调用。这一架构在短任务中表现尚可,但其根本局限在于规划层的"一次性"特性——大多数Agent在任务开始时生成计划,之后机械执行,缺乏对中途状态变化的感知和响应机制。动态环境注入新信息的设计,直接考验的是Agent规划层面对"初始假设失效"的响应能力——这在真实职场工作中极为常见,却在以往的基准测试中几乎从未被系统性评估过。
更细腻的评分机制与三层质量审计
评分机制也进行了大幅升级。1.0采用二元通过/失败评分,对长流程任务而言过于粗糙——"毫无进展"和"只差最后一步"得分完全相同。2.0改用细粒度检查点部分奖励,平均每个任务有27.25个检查点,且不要求固定顺序,支持多种有效解法。
这一设计在理念上与强化学习中的"稠密奖励"(Dense Reward)高度契合。传统二元评分相当于"稀疏奖励"——只有在任务完全成功时才给予正向信号,模型难以从失败中学习到有价值的中间信息。稀疏奖励是强化学习领域几十年来的核心挑战之一:著名的Montezuma's Revenge游戏长期是其标志性难题,早期算法因为只有到达终点才有奖励,几乎无法有效学习;机器人操作领域同样深受其苦,机械臂完成抓取任务的成功率在稀疏奖励下几乎为零,直到课程学习(Curriculum Learning)和奖励塑形(Reward Shaping)技术出现才有所突破。
奖励塑形(Reward Shaping)是解决稀疏奖励的经典技术路线之一,其核心思想是在原始奖励之外引入额外的中间信号,引导智能体朝着正确方向探索。然而奖励塑形存在一个内在风险:设计不当的中间奖励可能导致智能体走捷径——即找到获得奖励的方法,却不真正完成预期目标,这被称为"奖励作弊"(Reward Hacking)或"规范博弈"(Goodhart's Law的体现)。OSWorld 2.0检查点机制的"不固定顺序"设计,避免了传统课程学习中路径依赖的问题,同时通过严格的奖励作弊审计来堵住规范博弈的漏洞——团队专门检查了每一个检查点是否可以在不真实完成对应子目标的情况下被触发,这种方法论上的严谨性是该基准可信度的重要保障。检查点机制将一个长任务分解为平均27.25个可独立验证的里程碑,为模型提供有意义的进度信号,同时也为未来的Agent训练提供了更精细的奖励函数构建基础。
OSWorld 2.0的检查点机制本质上是一种人工设计的奖励塑形策略,但其"不固定顺序"的设计避免了传统课程学习中路径依赖的问题,为Agent提供了更灵活的探索空间。这种设计对未来的Agent训练同样具有重要价值:研究者可以基于这些检查点构建更精细的奖励函数,训练出真正理解"任务进展"而非仅关注"最终结果"的Agent。
评估优先采用功能性验证(直接检查环境状态和输出产物),仅在需要开放性判断时才以模型评估作为有限补充。整体上,模型评估仅占总得分的11.53%,且没有任何任务的模型评估占比超过50%,最大程度保证了客观性。

质量保证采用三层流程:先由AI生成初始单元测试,再由两个独立标注员从头到尾完成任务并交叉检查,最后用多个前沿AI代理试跑来暴露评分漏洞。团队还专门审计了两类相反风险——奖励作弊(AI未满足真实需求却拿到分数,如任务要求步行路线但评估只查途经点,提交驾驶路线也能得分),以及假阴性(正确解法因格式差异被误判为错误)。
实测结果:最强模型完成率也只有20.6%
研究团队对7个主流计算机操作模型系列进行了测试,包括Claude Opus 4.8/4.7、GPT-5.5及主流开源模型,分别设置150、300、500步预算。
在500步预算、批量动作模式下,主要结果令人警醒:
- Claude Opus 4.8(开启最大思考深度+批量工具调用):完成率仅20.6%,部分得分54.8%,每个任务平均成本约72.4美元;
- Claude Opus 4.7:完成率18.2%,成本约33.6美元;
- GPT-5.5:完成率13.0%,成本仅25.5美元(不到Opus的五分之一),Token效率最高;
- 开源模型中表现最好的MiniMax M3和Kimi完成率仅4.6%。
数据表明,追求更高完成率意味着Token成本的陡增。更关键的是,完成率对任务长度极其敏感:在最长的工作流中,AI完成率几乎降至0,哪怕部分得分仍能维持相对较高。许多人类觉得简单的任务,AI反而难以完成——单纯依靠增加步骤预算的"暴力扩展"在这里效果非常有限。
失败根源:不是不会,而是"记不住"
这些失败并非源于AI缺乏基础GUI操作或代码编写能力。研究发现,AI执行局部动作时表现尚可,核心瓶颈在于长流程中的任务状态维护。
这一问题的技术根源值得深入理解。当前主流大模型虽然支持数十万甚至百万级的上下文窗口(Context Window),但研究表明模型对上下文头部和尾部的信息注意力显著高于中部——这被称为"迷失在中间"(Lost in the Middle)现象,由斯坦福大学Nelson Liu等人于2023年系统记录。从机制层面看,这与Transformer的注意力分布和位置编码方式密切相关——在预训练阶段,模型接触的长文本样本数量远少于短文本,导致其处理长序列中部信息的能力欠缺充分训练。这一发现对OSWorld 2.0的评估结果具有直接解释力:在超过300步的任务执行中,第50步记录的用户约束条件极有可能在第200步被"遗忘",不是因为上下文窗口不够大,而是注意力机制无法有效检索远距离的关键信息。
认知科学中的工作记忆(Working Memory)理论为理解这一问题提供了有益视角——认知科学家Alan Baddeley提出的工作记忆模型将人类的短期信息处理系统分为语音环路、视空间模板和中央执行器三个组件,其核心特征是容量有限但可通过外部工具扩展。人类在复杂任务中通过便签、清单、日历等外部工具来克服工作记忆容量限制,这直接启示了AI Agent架构的未来方向:需要类似的"外部工作记忆"模块,将任务状态结构化存储于模型上下文之外,并按需检索更新。在超过300步的任务执行中,早期用户提出的约束条件、任务中途出现的新邮件内容、以及之前已完成步骤的状态,都需要模型在整个执行过程中持续跟踪和引用。这超出了简单的"记忆容量"问题,而是需要结构化的工作记忆机制。
模型的典型失误包括:遗漏用户明确提出的约束;忽略任务中途出现的新信息;遇到不确定时直接猜测而非主动询问;跳过必要的验证步骤。更值得关注的是,整个任务执行过程中仅有不到7%的步骤用于检测和修复自身错误。

这些弱点主要集中在需要恢复和维护隐藏状态的场景,例如隐式状态推断、多项目状态跟踪、冲突消解和动态环境应对。从任务标签分布看,最常见的挑战是跨源推理(42.6%)、视觉空间精度(41.7%),隐式状态推断和多项目状态跟踪各占39.8%——而这恰恰是当前AI最薄弱的环节。目前学术界正在探索的解决方案包括结构化状态数据库(将任务约束、已完成步骤、待验证项目分类存储)、主动摘要机制(定期将上下文中的关键信息压缩提取)、以及记忆增强架构(如MemGPT等将操作系统的虚拟内存管理思想引入LLM上下文管理的框架),但尚未有成熟方案能在真实长流程场景中稳定发挥作用。OSWorld 2.0中仅7%步骤用于自我纠错的数据,为这一研究方向提供了清晰的量化基准。

方向比参数更重要
OSWorld 2.0最核心的价值,在于将AI计算机操作的评估从短任务带入了真实的长流程工作场景,戳破了短任务高准确率的泡沫,让业界得以看清当前AI Agent的真实能力边界。
它也清晰指出了未来的研发方向:不是单纯堆砌模型参数或增加步骤预算,而是要提升AI的长流程状态保持、错误自检修复、动态环境适应和主动交互能力。任务经济价值映射显示,这些工作流覆盖了文档准备(23.8%)、软件数据库(17.8%)、财务运营分析(16.3%)等真实高价值领域,一旦被攻克,AI才可能真正承接半天量级的复杂工作。
目前OSWorld 2.0已全面开源,包括环境、108个任务、自托管网站及AI执行轨迹,为后续研究提供了坚实基础。距离真正能"接管半天工作"的AI代理,我们还有很长的路要走。
核心要点
相关推荐

LLM推理到底赚不赚钱?拆解大模型推理成本与盈利逻辑
深入拆解LLM大模型推理的成本构成与盈利模型,从GPU吞吐量、MoE架构、KV Cache到规模效应,算清推理服务每一笔账,揭示API价格战背后的商业逻辑与行业趋势。

Starling项目解析:AI能否独立编写完整桌面系统
Starling宣称是首个由AI编写的桌面系统,本文从技术复杂度、AI编程能力边界、工程可行性等维度深入分析,探讨AI从代码生成到系统级构建的真实差距与未来可能。

月付200美元AI订阅值不值?成本焦虑与理性消费指南
越来越多用户质疑每月200美元的AI订阅是否物有所值。本文分析开源模型追赶、价格体验错位等原因,并提供AI订阅价值评估框架,帮助用户理性决策。