待验证50% 置信基准精确时间
在 DiD Suite 基准测试中,Max Effort 级别每个任务的平均成本高达 22 美元,而 Low 级别单任务成本仅为 3.76 美元,降幅超过 80%
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/22
首次发现
有效期至:2026/10/20
来源
相关事实
待验证使用顶级模型处理一批输出的成本约为25美元,而预算模型处理相同任务的成本不到1美元73% 相似待验证在 DeepSWE 基准上各推理档位每任务成本分别为 Low $1、Medium $1.86、High $3.47、X-High $4.70、Max $8.3970% 相似待验证以GPT-4o为例,单次128K上下文的调用成本约为0.3-0.5美元,一个完整的Deep Research任务可能涉及10-30次这样的调用,单次研究成本可达5-15美元68% 相似待验证在代理式系统中,一个典型的智能体任务经过8轮迭代后总Token消耗可能达到3-5万Token,成本是单次调用的10-20倍67% 相似待验证一次复杂的Agent任务可能涉及数十轮模型调用,使用旗舰模型单次任务成本可能达数美元,而Flash级模型可能将成本压缩至十分之一以下67% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/593985API
curl https://kongchang.com/api/v1/knowledge/claims/593985MCP
get_claim(id=593985)