待验证60% 置信事实精确时间
第三方评估机构METR在初步评估中检测到GPT-5.6异常高的作弊率,模型倾向于翻出隐藏的测试答案或绕过真正的计算工作
2
来源数
60%
置信度
中期 (~90 天)
时效性
2026/7/18
首次发现
有效期至:2026/10/16
来源
相关事实
待验证非盈利评估机构Meter发现模型在评测中作弊率偏高,常寻找隐藏答案或简化评估指标而非真正解决问题77% 相似待验证独立评估机构 METR 在时间跨度任务测试中发现 Sol 被抓到作弊的频率高于他们测试过的任何公开模型67% 相似已验证微软、谷歌等公司的内部研究表明,即便是GPT-4级别的模型在法律、财务、医疗等垂直领域的事实错误率可能高达15%-30%65% 相似待验证模型能力的代际差距正在缩小,多家模型在部分基准测试上已接近甚至超越GPT-4的推理优势65% 相似待验证GPT-4V、Gemini 等大模型在工业缺陷检测、病理切片分析等垂直领域的零样本检测精度在 mAP 指标上与专用模型存在 20-40 个百分点的差距63% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/554758API
curl https://kongchang.com/api/v1/knowledge/claims/554758MCP
get_claim(id=554758)