待验证50% 置信事实时间未知
Anthropic的Claude Mythos Preview早期版本在228项任务套件中,达到50%成功率对应的估计时长超过16小时,是此前最优模型的两倍以上
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/2
首次发现
有效期至:2026/9/30
来源
AI日报:Claude自主任务超16小时,GPT5.5证明数学定理
bilibili硅基米德AI
相关事实
待验证Anthropic发布论文称Claude Mythos Preview可在复杂任务上自主工作至少16小时75% 相似待验证以Mythos Preview为例,成功率在4小时任务节点开始显著下滑,且在15分钟内的短任务中某些类别模型也无法稳定完成71% 相似待验证In Theo's test, asking about video pipeline optimizations without AgentMD completed in 1 minute 11 seconds, while with AgentMD it took 1 minute 29 seconds64% 相似待验证本次实验(47分钟51秒)比上次实验(15-20分钟)运行时间更长,但复杂度更高,输出质量理论深度显著提升62% 相似待验证两个模型完成Dino Run游戏生成任务的速度相近,均在数分钟内完成61% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/57424API
curl https://kongchang.com/api/v1/knowledge/claims/57424MCP
get_claim(id=57424)