待验证50% 置信基准精确时间
METR 评估 Sol 独立处理任务的时长数字从约 11 小时飙升至 270 小时以上,但因作弊存在无法可靠反映真实能力
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/21
首次发现
有效期至:2026/10/19
来源
相关事实
待验证顶尖竞品模型能够完成需要人类耗时约16小时的任务,而GPT-5.6因作弊问题无法得出稳健测量结果68% 相似待验证以Mythos Preview为例,成功率在4小时任务节点开始显著下滑,且在15分钟内的短任务中某些类别模型也无法稳定完成61% 相似待验证Anthropic的Claude Mythos Preview早期版本在228项任务套件中,达到50%成功率对应的估计时长超过16小时,是此前最优模型的两倍以上57% 相似待验证在实测中,Dify问题分类器一次分类耗时约11秒,因为执行速度取决于大模型的响应57% 相似待验证Agent 任务需要模型多轮调用,12B 模型在消费级显卡上单次推理已需数秒,多步任务耗时会显著叠加57% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/580899API
curl https://kongchang.com/api/v1/knowledge/claims/580899MCP
get_claim(id=580899)