待验证50% 置信事实精确时间
数据污染问题源于大模型在包含 GitHub、Stack Overflow、LeetCode 等平台公开代码题解的语料上进行预训练
1
来源数
50%
置信度
长期有效
时效性
2026/7/10
首次发现
来源
Grok vs GPT vs Claude:三大顶级AI编程实测,谁才是真正的代码高手?
hackernewshackernews2026/7/8
相关事实
待验证数据污染指模型训练数据可能已包含GitHub公开的bug修复方案,导致测试时的推理实为记忆复现75% 相似待验证大模型在预训练阶段接触了海量GitHub上的diff格式数据,对该格式有极高的理解与生成能力71% 相似待验证当前主流大模型的预训练语料高度依赖公开互联网数据,包括CommonCrawl、Wikipedia、GitHub代码库等71% 相似待验证代码训练模型在构建训练集时会特别关注去重处理,因为GitHub上大量fork和复制代码会导致模型过度记忆特定代码片段而非学习通用模式70% 相似待验证Mainstream benchmarks like SWE-Bench Pro heavily rely on issues and commits from public repositories, creating data contamination risk for models trained on public GitHub code.70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/457375API
curl https://kongchang.com/api/v1/knowledge/claims/457375MCP
get_claim(id=457375)