待验证50% 置信基准精确时间
代码大语言模型采用HumanEval、MBPP等可执行基准评估,即直接运行生成代码并检验输出是否正确
1
来源数
50%
置信度
长期有效
时效性
2026/7/6
首次发现
来源
惠普携手OpenAI达成Frontier战略合作,三大方向全面落地AI
rss2026/6/28
相关事实
引用此条事实
Stable URI
https://kongchang.com/claim/112609API
curl https://kongchang.com/api/v1/knowledge/claims/112609MCP
get_claim(id=112609)