Artificial Analysis
Artificial Analysis是一个独立的AI模型评测与比较平台,专注于对大型语言模型及其他AI模型进行多维度基准测试,涵盖模型能力(Intelligence Index智能指数)、推理速度、价格及可用性等指标。平台以独立、客观为原则,汇聚多项标准化测试结果,为研究人员、开发者和企业提供跨模型的横向比较参考。
核心事实
时间轴 (近 90 天)
Artificial Analysis推出新的智能体基准AA-Analyst Agent,专注于真实世界的电子表格与文档定量分析,榜单中Opus 5以54%领先,其次为GPT-5.5和Fable 5
根据Artificial Analysis数据,Fable完成单个任务约用33k token,Opus 5约用37k token
据Artificial Analysis数据,Qwen 3.8的270亿参数模型在Agentic指数上拿到51分,超过GPT-5.6 Terra、DeepSeek v4 Pro、GPT-5.6 Luna以及Gemini 3.7 Flash
Artificial Analysis将Qwen3 27B纳入评测榜单并完成了一系列基准测试
Artificial Analysis推出智能体基准AA-Analyst Agent,专注于真实世界的电子表格与文档定量分析,Opus 5以54%领先
Artificial Analysis是一个独立的AI模型基准测试平台,综合编程能力、数学推理、语言理解、知识问答等多个维度评估模型表现
全部知识事实 (6)
Artificial Analysis是一个独立的AI模型基准测试平台,综合编程能力、数学推理、语言理解、知识问答等多个维度评估模型表现
70%待验证Artificial Analysis推出新的智能体基准AA-Analyst Agent,专注于真实世界的电子表格与文档定量分析,榜单中Opus 5以54%领先,其次为GPT-5.5和Fable 5
50%待验证根据Artificial Analysis数据,Fable完成单个任务约用33k token,Opus 5约用37k token
50%待验证据Artificial Analysis数据,Qwen 3.8的270亿参数模型在Agentic指数上拿到51分,超过GPT-5.6 Terra、DeepSeek v4 Pro、GPT-5.6 Luna以及Gemini 3.7 Flash
50%待验证Artificial Analysis将Qwen3 27B纳入评测榜单并完成了一系列基准测试
50%待验证Artificial Analysis推出智能体基准AA-Analyst Agent,专注于真实世界的电子表格与文档定量分析,Opus 5以54%领先
50%