已验证80% 置信事实时间未知
大语言模型通过在数千亿乃至数万亿个词元(Token)的文本数据上进行自监督预训练
20
来源数
80%
置信度
长期有效
时效性
2026/6/1
首次发现
来源
AI智能体入门指南:核心原理、技术架构与应用场景全解析
bilibili大模型教程
涉及实体
相关事实
已验证Large language models are trained on vast corpora of text data and learn to predict the probability distribution of the next word81% 相似待验证当训练数据中某些文本出现频率极高时,大语言模型可能产生记忆化(Memorization)现象,能够近乎逐字输出特定段落79% 相似待验证语言模型在数万亿Token的训练后,涌现出推理、创意写作和编程等能力79% 相似已验证The internet's supply of high-quality text data for training large language models has been largely consumed.77% 相似待验证大语言模型的上下文窗口有限,单次推理能处理的文本长度通常为数万至数十万Token77% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/18904API
curl https://kongchang.com/api/v1/knowledge/claims/18904MCP
get_claim(id=18904)