待验证50% 置信事实精确时间
数据污染(data contamination)指模型在训练过程中已经见过测试集中的数据,导致评测成绩虚高
1
来源数
50%
置信度
长期有效
时效性
2026/8/30
首次发现
来源
涉及实体
相关事实
已验证数据投毒攻击是将恶意样本混入训练数据集,使模型在部署后对特定输入产生错误行为77% 相似待验证数据泄漏是指测试集信息在训练阶段被模型间接看到,导致评估指标虚高,是机器学习研究中最常见也最隐蔽的方法论缺陷之一,在医疗预测领域尤为危险75% 相似已验证在划分数据集之前对全量数据做标准化会导致数据泄漏,将测试集信息泄露给训练集74% 相似待验证数据泄漏是因意外引入测试集信息而导致模型评估虚高的陷阱,常见形式包括在划分数据集之前就对全量数据做标准化或使用时间上因果倒置的特征70% 相似待验证NLP基准数据集被广泛使用后会出现数据污染(Data Contamination)现象,导致基准分数虚高69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/823883API
curl https://kongchang.com/api/v1/knowledge/claims/823883MCP
get_claim(id=823883)