大模型本质是什么?用函数视角一文讲透核心原理

换个角度理解大模型
很多人接触大模型科普内容时,往往被各种复杂术语淹没,听完依然一头雾水。本文来自一位B站UP主的大模型微调系列教程,作者用一个极简视角——数学函数——解释大模型的本质。整个讲解不涉及超过初中数学的知识,却能帮助初学者从根源上搞清楚大模型究竟是什么。
本系列教程共分八章,从「什么是大模型」「大模型如何被训练」「损失函数」「Transformer架构」,一直讲到「微调原理」「数据准备」和「微调实战」,目标是带领零基础学员完成对Qwen等小模型的微调入门与工程落地。本文聚焦第一章:大模型的本质究竟是什么。
大模型的本质:一个极其复杂的函数
作者给出了一个直截了当的定义:抛开所有花里胡哨的术语,大模型本质上就是一个函数。
什么是函数?回忆初中知识,函数就是输入与输出之间的对应关系。比如最简单的 y = x,x 是输入,y 是输出。再复杂一点,f(x) = x² 是一元二次函数,在坐标系中画出来是一条抛物线。我们用 f(x) 这样的符号,是为了简化表达——函数本身可能写得很长很复杂,用一个符号 f 代替,调用时就无需重复书写。

函数的运行逻辑很简单:给定一个 x 值,代入函数,求出对应的 y 值。这个过程与我们使用豆包、DeepSeek 等大模型产品的体验高度相似——在输入框输入内容,经过短暂等待后得到回答,这不正是「给 x 一个值,得到 y」的过程吗?
因此,大模型完全可以被抽象成一个函数:输入内容作为 x,经过函数 f 的处理,输出结果 y。这样一想,大模型也没那么神秘了。
深入理解:函数抽象与神经网络的数学基础
将大模型类比为函数不只是一种比喻,它在数学上有严格的对应关系。现代大模型的底层是深度神经网络,而神经网络本质上是一种「万能函数逼近器」——1989年由George Cybenko证明的通用近似定理(Universal Approximation Theorem)指出,只要层数和神经元足够多,神经网络可以以任意精度逼近任何连续函数。大模型中的「参数」对应函数中的系数,训练过程就是通过反向传播算法不断调整这些系数,使函数的输出尽量接近期望结果。
值得一提的是,反向传播算法(Backpropagation)本身也是一种数学上精确的链式求导过程:它沿着计算图从输出层反向逐层计算每个参数对误差的贡献(即梯度),再据此调整参数。这一过程保证了即使面对数十亿个参数,计算机也能高效地完成每一轮更新。因此,当作者说「大模型是一个函数」时,这个表述在数学上是严谨且可验证的——大模型并不是某种神秘的「智能涌现」,而是有坚实数学理论背书的可计算结构。

大模型的两大核心:训练与推理
作者强调了一个关键观点:大模型从原理角度并不难,真正的难度在于工程落地。 工程落地可以拆分成两个核心环节——训练与推理。
训练:求解这个函数
训练的本质,就是「把这个函数求出来」。函数的形式事先并不确定,需要通过海量数据把函数中的参数一一确定下来。这个求解过程虽然复杂,但只需进行一次。

需要注意的是,大模型里的这个函数极其复杂,绝不是 y = x + 1 这样简单的形式。它是一个包含海量参数的复合函数,输入不止一个 x,而是 x1、x2、x3……成千上万甚至数十亿个变量。这也正是「大模型」中「大」字的由来——主流大模型参数量普遍达到亿级乃至更高。此外,每家厂商训练出的函数各不相同,因此不存在一个统一的公式来描述所有大模型。
深入理解:参数量的量级究竟有多大?
「大」模型的「大」究竟有多大?GPT-3 拥有 1750亿个参数,Meta 的 Llama 3 拥有最高 4050亿个参数,而文中提到的 Qwen 系列也有从 15亿到 720亿不等的多个规格。参数量越大,模型存储和运行所需的显存与算力也越高——一个 70B 参数的模型,仅加载模型权重就需要约 140GB 的显存(以 FP16 精度计算,相当于近20张高端消费级显卡的总显存)。
这些参数并非随机堆砌,而是分布在模型的不同层次中承担不同职责:浅层参数通常负责捕捉词汇、语法等基础语言特征,深层参数则负责处理逻辑推理、语义理解等高阶能力。这也是为什么微调时往往只需更新少量参数(如 LoRA 等高效微调方法仅更新不足1%的参数),就能让模型适配新的任务——大部分通用语言能力已经被「冻结」在预训练参数中。对于普通开发者而言,选择 7B、14B 等「小」规格模型进行微调实践,在单张消费级显卡上就可以跑通完整的训练流程,大幅降低了入门门槛。
推理:代入求值
推理是把 x 代入已经求解好的函数 f、计算出 y 的过程。从技术难度看,推理比训练简单;但从总成本看,推理反而更高。
原因在于调用频次:训练只做一次,而推理会被反复触发。每次用户的提问都是一次推理。像豆包这样的产品,每天可能发生数千万次调用,意味着每天有数千万次推理在运行。规模化的推理成本累积下来,远超一次性的训练投入。
深入理解:推理成本为何成为AI企业的核心挑战?
推理成本高于训练成本这一结论,在业界已有充分的数据支撑。OpenAI 曾披露,ChatGPT 每次对话的推理成本约为传统搜索引擎单次搜索成本的 10倍。推理成本的核心驱动因素是 GPU 的使用时长与显存占用——训练虽然单次成本极高(GPT-4 据估计花费超过 1亿美元),但只发生一次;而推理随着用户规模线性增长,是持续性的运营支出。
从商业模式角度来看,这也解释了为什么各大AI厂商在推理定价上竞争如此激烈:推理成本的高低直接决定了产品的盈利空间。这一压力催生了量化(Quantization,将参数从32位浮点数压缩为4位或8位整数,可将模型体积压缩至原来的1/4到1/8)、推测解码(Speculative Decoding,用小模型预测草稿再由大模型校验,可显著减少大模型的实际计算次数)等专门用于降低推理成本的技术方向,是当前 AI 工程领域最活跃的研究热点之一。
推理的真相:大模型在预测概率
那么,大模型推理时究竟在「算」什么?作者揭示了一个容易被忽视的事实:大模型输出的本质是概率,而不是直接的答案。
以「帮我写一首诗」为例。用户输入「你好,请写一首诗」,这段文本就是 x。把它代入函数 f 后,看似直接得到了一首诗,但这背后其实是一个逐步迭代的过程。

真正发生的是这样的:训练阶段,模型通过海量语料建立了一个词汇库,库中每个词都是候选项。当输入一段内容后,函数会计算词汇库里每个词成为「下一个词」的概率——例如某个词概率85%,另一个词10%,还有一个词5%……这张概率表覆盖所有候选词。接下来,模型从中选出概率最高的词作为输出,然后把这个词追加到输入中,再次计算下一个词的概率,如此循环,逐字逐词地生成完整回答。
这就是大模型推理的核心机制:不断预测下一个词的概率。 所谓「智能」,正是建立在这套概率计算的基础之上。
深入理解:Token、词汇库与概率分布的技术细节
大模型处理文本时,并非以「词」为最小单位,而是以 Token(词元) 为单位。Token 可以是一个完整的单词、一个汉字、一个标点,甚至是半个英文单词——例如"unbelievable"可能被切分为"un"、"believ"、"able"三个 Token。现代大模型通常使用 BPE(Byte Pair Encoding,字节对编码)或 SentencePiece 等分词算法构建词汇库,主流模型的词汇库规模在 3万到 15万 Token 之间。每次推理,模型都要在整个词汇库上运行 Softmax 函数,将原始得分转化为总和为1的概率分布——即使词汇库有 10万个 Token,模型也要为每一个候选 Token 计算一个概率值。
这也是为什么「温度」(Temperature)参数能控制输出随机性的原理所在:温度越高,Softmax 输出的概率分布越平坦(各候选词的概率趋于均匀),模型越容易选到非最高概率的词,输出也越富有创意和多样性;温度越低,概率分布越尖锐,模型的输出越确定、越保守。这一机制让用户可以在「精确性」与「创造性」之间灵活调节。除温度之外,Top-p 采样(又称 Nucleus Sampling,只从累积概率超过阈值 p 的候选词中采样)和 Top-k 采样(只从概率最高的 k 个词中采样)也是常见的输出多样性控制手段,共同构成了大模型输出行为调节的工具箱。
深入理解:自回归生成机制与KV Cache工程优化
文中描述的「逐词生成」在技术上称为自回归(Autoregressive)生成。每一步生成的 Token 会被拼接回输入序列,作为下一步预测的条件,形成一个循环迭代的过程——这正是「auto(自)+ regressive(回归)」名称的由来。
这种机制带来了一个重要的工程挑战:生成长度越长,累积的计算量越大,延迟也越高——生成1000个 Token 的耗时大约是生成100个 Token 的10倍。为了在速度与质量之间取得平衡,工程上常常引入 KV Cache(键值缓存)技术。在 Transformer 架构的注意力机制中,每个 Token 的处理都会产生 Key(键)和 Value(值)两组中间向量。KV Cache 的核心思想是:将已处理 Token 的这些中间结果缓存下来,当生成下一个 Token 时直接读取缓存,避免对相同上下文的重复计算。这是大模型推理优化中最基础也最重要的工程手段之一,能将推理速度提升数倍,是每一个大模型推理框架(如 vLLM、TensorRT-LLM)的标配能力。需要注意的是,KV Cache 本身也会占用大量显存——上下文越长,缓存越大,这正是长上下文推理成本高企的根本原因之一。
小结:一个框架,看懂大模型
用「函数」这个概念,可以把大模型拆解得非常清晰:
- 大模型本质 = 一个极其复杂的函数(由深度神经网络实现,通用近似定理保证其可以逼近任意函数)
- 训练 = 求解函数的参数(一次性,成本相对可控,但顶级模型单次训练耗资亿级;参数分布在不同层次,浅层捕捉基础语言特征,深层处理高阶推理能力)
- 推理 = 代入求值(高频次,总成本更高,是 AI 应用的主要运营支出,催生了量化、推测解码等工程优化技术)
- 推理的核心 = 不断在词汇库(Token 粒度,由 BPE 等算法构建)上运行 Softmax 计算概率分布,自回归地逐步生成完整输出;温度、Top-p、Top-k 等参数控制输出的随机性与多样性;KV Cache 是提升推理效率的关键工程手段,同时也是长上下文推理显存压力的主要来源
理解了这个框架,后续学习训练机制、Transformer架构、损失函数乃至微调实战,都会有坚实的直觉基础。对于希望转型大模型方向、或想系统入门大模型微调的学习者来说,「先建立直觉、再深入细节」的路径,往往是回报率最高的学习方式。下一章,作者将进一步讲解这个复杂函数究竟是如何被「求」出来的。
相关推荐

美墨边境缉毒实录:CBP多层次拦截体系与技术解析
深度解析美国海关与边境保护局(CBP)在圣地亚哥地区的缉毒行动,涵盖行为识别、缉毒犬协作、便携式光谱检测、空运货物查验及高速公路追踪等多层次拦截技术与实战案例。

AMD CDNA5架构深度解析:技术演进与AI算力竞争格局
深度解析AMD CDNA5架构的技术方向,包括Chiplet封装升级、HBM内存演进、低精度计算优化等核心看点,分析AMD如何通过下一代Instinct加速器挑战NVIDIA在AI芯片市场的主导地位。

Netflix信任练习变解雇陷阱:企业信任的边界在哪
Netflix员工在团建信任练习中分享隐私后遭解雇,引发科技圈热议。本文深入分析企业信任练习的风险、Netflix文化的双刃剑效应,以及员工如何在职场坦诚与自我保护之间找到平衡。