待验证50% 置信基准精确时间
在 Terminal Bench 2.1 测试中,AutoPrompt Scale 使 OpenCode 在 89 个任务中的失败数从 29 降到 16,多解决 13 题,分数提升 14.61 个百分点
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/8/27
首次发现
有效期至:2026/11/25
来源
涉及实体
相关事实
待验证在SWE-Bench编程基准测试中,Claude Code得分80.8%,GitHub Copilot仅为72.5%62% 相似待验证MiniMax M3 received an average score of 58.3 across 7 high-difficulty coding tasks in a systematic evaluation61% 相似待验证实测中使用AnySearch Skill完成搜索任务消耗18个额度点,不使用时消耗23个额度点,节省约27%60% 相似待验证SWE-Bench Pro的提示词长度中位数为30,098个字符,而Frontier Code任务描述部分的中位数仅为9,082个字符59% 相似待验证Terminal Bench 2.1测试中GPT-5.6 Ultra得分接近92%,Fable 5为88%,考虑误差范围基本持平58% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/807691API
curl https://kongchang.com/api/v1/knowledge/claims/807691MCP
get_claim(id=807691)