[控场AI]
基准

Artificial Analysis

Artificial Analysis是一个独立的AI模型评测与比较平台,专注于对大型语言模型及其他AI模型进行多维度基准测试,涵盖模型能力(Intelligence Index智能指数)、推理速度、价格及可用性等指标。平台以独立、客观为原则,汇聚多项标准化测试结果,为研究人员、开发者和企业提供跨模型的横向比较参考。

核心事实

时间轴 (近 90 天)

8月23日

Artificial Analysis推出新的智能体基准AA-Analyst Agent,专注于真实世界的电子表格与文档定量分析,榜单中Opus 5以54%领先,其次为GPT-5.5和Fable 5

待验证50%
8月23日

根据Artificial Analysis数据,Fable完成单个任务约用33k token,Opus 5约用37k token

待验证50%
8月22日

据Artificial Analysis数据,Qwen 3.8的270亿参数模型在Agentic指数上拿到51分,超过GPT-5.6 Terra、DeepSeek v4 Pro、GPT-5.6 Luna以及Gemini 3.7 Flash

待验证50%
8月22日

Artificial Analysis将Qwen3 27B纳入评测榜单并完成了一系列基准测试

待验证50%
8月22日

Artificial Analysis推出智能体基准AA-Analyst Agent,专注于真实世界的电子表格与文档定量分析,Opus 5以54%领先

待验证50%
6月3日

Artificial Analysis是一个独立的AI模型基准测试平台,综合编程能力、数学推理、语言理解、知识问答等多个维度评估模型表现

已验证70%

全部知识事实 (6)

来源文章