待验证80% 置信事实时间未知
在PlanBench的神秘方块世界测试中,2023年的模型几乎完全失败,但O1等推理模型的出现带来了显著改善
1
来源数
80%
置信度
长期有效
时效性
2026/6/1
首次发现
来源
李宏毅2026课程笔记:AI Agent三大核心能力深度解析
bilibili李宏毅agent
涉及实体
相关事实
待验证2023年多项独立研究表明部分顶级模型在标准数学推理测试中分数极高,但在等价的重新表述版本上成绩大幅下滑,表明模型学习的是测试模式而非真正的推理能力69% 相似待验证2024 年初最先进的模型在 OS World Verified 测试上通常连 20% 都拿不到65% 相似待验证Wei等人在2022年系统记录了大模型涌现能力现象,发现某些能力在小模型上几乎为零而在大模型上急剧提升,呈现非连续的相变特征64% 相似待验证美团技术团队发布General 365推理评测基准,对26款主流大模型进行测试,大部分模型未能达到60分及格线63% 相似待验证OpenAI的图表显示,在较低的测试时计算量下,模型对这道题的成功率接近零,只有在极长的推理链条下才偶尔成功61% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/26237API
curl https://kongchang.com/api/v1/knowledge/claims/26237MCP
get_claim(id=26237)