待验证50% 置信基准精确时间
当Agent任务步骤超过10步时,主流大模型的任务完成率会出现非线性下降
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/21
首次发现
有效期至:2026/10/19
来源
相关事实
待验证AI Agent在复杂任务中的典型失败表现包括:在最初十分钟表现良好,半小时后开始偏离目标,两小时后产生完全不可用的输出70% 相似待验证在企业应用中,当构建包含十几个步骤的自动化工作流时,任何被跳过的步骤都可能导致整个流程崩溃,因此模型的指令遵循能力尤为关键69% 相似待验证安装超过100个Agent会导致系统运行缓慢和token消耗爆炸,3-5个职责清晰的Agent优于100个Agent67% 相似待验证以Mythos Preview为例,成功率在4小时任务节点开始显著下滑,且在15分钟内的短任务中某些类别模型也无法稳定完成67% 相似待验证Agent 任务需要模型多轮调用,12B 模型在消费级显卡上单次推理已需数秒,多步任务耗时会显著叠加66% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/575925API
curl https://kongchang.com/api/v1/knowledge/claims/575925MCP
get_claim(id=575925)