待验证50% 置信基准精确时间
在Exploit Bench网络安全基准上,Sol得分约76%,Mythos 5约78%
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/8
首次发现
有效期至:2026/10/6
来源
Fable 5对决GPT-5.6 Sol:性价比重塑前沿AI格局
bilibili英文白斑马2026/7/3
相关事实
待验证在Terminal Bench 2.1上Sol Ultra模式接近92%,超过Mythos 5的88%73% 相似待验证在病毒学多选基准上,Mythos 5得分56%,GPT-5.6 Sol得分55.5%,几乎持平且均远超专家基线69% 相似待验证ExploitBench测试中Sol约76%略逊于Fable 5的78%,但Sol仅消耗约12-13万Token而Fable 5用约35万Token69% 相似待验证在SWE-Bench Pro编程评测上,Claude Fable 5以80%的成绩领先GPT-5.6 Sol的64.6%69% 相似待验证在贴吧小站项目评测中,Sol以83.95分居首,GLM 5.2以76.59分位列第二,Terra 75.97分排第三,Luna 68.56分排第四66% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/248320API
curl https://kongchang.com/api/v1/knowledge/claims/248320MCP
get_claim(id=248320)