待验证50% 置信事实精确时间
用单一测试案例评估模型性能是一个统计陷阱,即小样本偏差(Small Sample Bias)
1
来源数
50%
置信度
长期有效
时效性
2026/7/21
首次发现
来源
相关事实
待验证对同一测试用例执行多次调用统计成功比例得到通过率,比二元的通过/失败判断更能反映模型真实表现71% 相似待验证多重比较问题指同时测试多个模型变体时,即使每个单独检验显著性水平设为0.05,整体假阳性率也会急剧膨胀69% 相似待验证OpenAI的图表显示,在较低的测试时计算量下,模型对这道题的成功率接近零,只有在极长的推理链条下才偶尔成功68% 相似待验证基准测试面临饱和(Saturation)和数据污染(Data Contamination)两个系统性挑战,当多个主流模型得分超过95%时测试集失去区分能力67% 相似待验证研究表明模型在自我批评任务中的准确率显著低于由另一模型执行批评的场景67% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/577032API
curl https://kongchang.com/api/v1/knowledge/claims/577032MCP
get_claim(id=577032)