待验证50% 置信基准精确时间
以Mythos Preview为例,成功率在4小时任务节点开始显著下滑,且在15分钟内的短任务中某些类别模型也无法稳定完成
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/8/21
首次发现
有效期至:2026/11/19
来源
相关事实
待验证AI Agent在复杂任务中的典型失败表现包括:在最初十分钟表现良好,半小时后开始偏离目标,两小时后产生完全不可用的输出72% 相似待验证Anthropic的Claude Mythos Preview早期版本在228项任务套件中,达到50%成功率对应的估计时长超过16小时,是此前最优模型的两倍以上71% 相似待验证在Theo的测试中,无AgentMD时1分11秒完成任务,有AgentMD时1分29秒完成69% 相似待验证完整的感知-决策-执行循环可能超过5秒,对需要快速连续操作的任务场景构成瓶颈69% 相似待验证顶尖竞品模型能够完成需要人类耗时约16小时的任务,而GPT-5.6因作弊问题无法得出稳健测量结果67% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/780951API
curl https://kongchang.com/api/v1/knowledge/claims/780951MCP
get_claim(id=780951)