LLM
大语言模型(Large Language Model,LLM),是基于深度学习技术、经过海量文本数据训练的自然语言处理模型。其核心能力包括文本理解、生成、推理与对话,能够处理翻译、摘要、代码生成、问答等多种语言任务。LLM通常采用Transformer架构,参数规模从数十亿到数千亿不等,是当前人工智能应用的重要基础组件。
核心事实
时间轴 (近 90 天)
在Q2D-Web中,LLM判断被设计为三套集合之一而非唯一依据,以警惕LLM判断本身可能引入的偏差
Q2D-Web 的三套相关性集合分别是智能体引用、生产环境的网页排名以及经由大语言模型判断扩展的组合集合
面对模糊、自然语言、需要意图消歧的输入,模型是更合适的选择
语义路径适合处理歧义、理解自然语言、模糊推理以及在状态空间未明确时进行规划
研究观察到不同任务之间存在固有的难度差距,LLM 在某些类型的推理任务上表现明显更弱
RFCLLM 论文的研究目标是考察 LLM 对自然语言描述定义的有限状态转移系统所形成的隐式表示与人工构建的真值模型之间的对齐程度
研究分析了协议自身特征(复杂度、状态数量、转换逻辑清晰度)与 LLM 推理表现之间存在关联
许多研究和工程实践尝试用大语言模型将 RFC 等协议文档中的自然语言描述转化为形式化模型
论文考察了 4 种上下文类型对 LLM 推理结果的影响,发现提供的上下文形式和范围会显著改变推理表现
Continual Search通过多轮迭代不断推动作为裁判的LLM持续搜索尚未被解决的诊断证据
还有 40 条时间轴事件
全部知识事实 (20)
大语言模型的训练目标是预测下一个最可能出现的token,而非判断信息的真实性
80%已验证大语言模型本质上是无状态函数,权重在推理时已经固定,不会随时间推移而学习
80%已验证大语言模型的涌现能力是指在参数规模突破某个阈值后突然展现出的复杂推理能力
80%已验证RAG(检索增强生成)的核心思想是在大模型生成回答之前,先从外部知识库中检索相关文档片段作为上下文注入Prompt
80%已验证与GitHub Copilot类似的AI编码工具包括Amazon CodeWhisperer、Cursor、Codeium等
80%已验证LLM幻觉的根本原因在于自回归生成机制——模型基于概率分布预测下一个Token,而非真正的逻辑推理
80%已验证AI Agent底层通常由大语言模型(LLM)驱动,配合工具调用、记忆模块和规划框架(如ReAct范式)实现复杂任务自动化
80%已验证多模态大模型通过视觉编码器(Vision Encoder)将图像转化为高维向量表示,再与语言模型的文本理解能力融合
80%已验证GitHub Copilot、Cursor、Claude等AI编程辅助工具本质上是基于大语言模型对海量代码库训练后形成的代码补全与生成系统
80%已验证Agent的核心公式为:Agent = 大模型 + 工具调用 + 自主决策能力
80%已验证LLM幻觉(Hallucination)是大语言模型的已知问题,会导致AI生成不准确的内容
80%已验证业界估算GPT-4的训练成本超过1亿美元,涉及数万块A100 GPU、数月的持续运算和PB级别的训练数据
80%已验证大模型幻觉的技术本质在于模型在训练时学习的是语言模式的概率分布而非事实本身
80%已验证大语言模型在生成每个token时从概率分布中采样,temperature参数控制随机性的强弱,temperature越高输出越多样,越低则越确定
80%已验证Function Calling机制允许LLM以结构化JSON格式声明需要调用的外部工具及参数,工具返回值会被原样注入下一轮模型输入
75%已验证LLM的生成机制是基于概率的文本预测,而非真正'理解'代码语义
75%已验证ReAct框架使LLM在回答问题时能够交替进行'推理'和'行动'步骤
75%已验证Context Engineering focuses on systematically building, managing, and optimizing all information fed to a large language model, including system prompts, conversation history, external knowledge bases, and user preference profiles.
75%已验证在当前主流AI应用框架(如LangChain、AutoGen等)中,一个Agent通常由系统prompt、可调用的Tool列表、以及记忆/上下文管理机制三部分组成
75%已验证微调一个7B参数的模型可能需要数十GB显存进行全参数微调
75%