待验证60% 置信观点时间未知
Kimi K2.6 在前端开发测试中部分场景超越了Claude Opus 4
2
来源数
60%
置信度
中期 (~90 天)
时效性
2026/5/31
首次发现
有效期至:2026/8/29
来源
Kimi K2.6 深度实测:编程、多智能体、前端开发全面评测
bilibiliAI-seeker
涉及实体
相关事实
待验证Kimi K2.6在SWE-Bench Pro测试中获得58.6%的分数,位居开源模型第一72% 相似待验证Kimi K2.6在SWE Bench Pro、深度搜索问答和Humanity's Last Exam等顶级基准测试上与GPT 5.4、Claude Opus 4.6和Gemini 3.1 Pro等闭源模型竞争72% 相似待验证以Kimi K3实验,给它预填充1%的Claude Opus解码推理片段,其输出风格就会明显向Opus靠拢,某些区段Claude推理链从Kimi K3提取的容易程度比其他模型高出约6个数量级69% 相似已验证在Terminal Bench 2.0测试中,K2.6打出66.7分,比GPT-5.4和Claude Opus 4.6都略高68% 相似待验证Claude Opus 4.6在SWE-bench基准测试中在现实世界的专家级任务中表现领先65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/3980API
curl https://kongchang.com/api/v1/knowledge/claims/3980MCP
get_claim(id=3980)