基准
BrowseComp
BrowseComp是一个用于评估AI智能体网络浏览与信息检索能力的基准测试集。它通过设计需要多步骤网络搜索才能解答的复杂问题,衡量模型在真实网络环境中定位、筛选和整合信息的能力。该基准注重问题的客观可验证性,旨在区分具备深度搜索推理能力与仅依赖表层检索的AI系统。
时间轴 (近 90 天)
9月12日
在启用上下文管理下,Iris-mini在BrowseComp、BrowseComp-ZH、DeepSearchQA和HLE分别达到82.2%、84.8%、86.9%和52.3%
待验证50%
9月9日
Opus 5在BrowseComp搜索测试上得90.8%,与GPT 5.6持平
待验证50%
8月23日
在BrowseComp智能体搜索基准上模型得分30.8%,与GPT系列基本持平
待验证50%
8月23日
Claude Opus 5在智能体搜索BrowseComp上得分30.8%,与GPT系列基本持平;工具增强多学科推理64.7%;生物学人类可解问题上高达90.1%
待验证50%
全部知识事实 (4)
来源文章
OpenAI发布GPT-5.6与ChatGPT Work:AI自主工作时代来临7月24日OpenAI GPT-Live:全双工语音AI的交互革命7月20日OpenAI GPT-Live语音模型:全双工交互如何重塑人机对话7月12日OpenAI GPT Live:全双工语音AI,边听边说边执行任务7月12日GPT-5.6发布:Sol/Terra/Luna三模型重塑AI编程与办公自动化7月11日GPT-5.6深度实测:ChatGPT与Codex合体,Sol模型能力全解析7月11日GPT-5.6全面开放:Sol/Terra/Luna三档模型与四智能体并行深度解析7月11日Gemini 3.1 Pro深度横评:ARC-AGI-2得分77.1%,真的最强吗?5月23日