[控场AI]
基准

BrowseComp

BrowseComp是一个用于评估AI智能体网络浏览与信息检索能力的基准测试集。它通过设计需要多步骤网络搜索才能解答的复杂问题,衡量模型在真实网络环境中定位、筛选和整合信息的能力。该基准注重问题的客观可验证性,旨在区分具备深度搜索推理能力与仅依赖表层检索的AI系统。

时间轴 (近 90 天)

9月12日

在启用上下文管理下,Iris-mini在BrowseComp、BrowseComp-ZH、DeepSearchQA和HLE分别达到82.2%、84.8%、86.9%和52.3%

待验证50%
9月9日

Opus 5在BrowseComp搜索测试上得90.8%,与GPT 5.6持平

待验证50%
8月23日

在BrowseComp智能体搜索基准上模型得分30.8%,与GPT系列基本持平

待验证50%
8月23日

Claude Opus 5在智能体搜索BrowseComp上得分30.8%,与GPT系列基本持平;工具增强多学科推理64.7%;生物学人类可解问题上高达90.1%

待验证50%

全部知识事实 (4)

来源文章