Scaling Law五层演进体系解析:Physical AI如何开启下一增长曲线

引言
过去一年多,AI行业围绕Scaling Law的讨论从未停歇。从最初黄仁勋在GTC上提出的三条技术路线,到如今已经演化出五层Scaling体系,再到Physical AI的快速崛起,整个行业正在经历一场从虚拟世界向物理世界的范式迁移。
Scaling Law(缩放定律)最早由OpenAI在2020年的论文《Scaling Laws for Neural Language Models》中系统性提出,研究者Jared Kaplan等人发现,语言模型的性能与模型参数量、数据集大小、训练计算量之间存在幂律关系——只要按照特定比例同时扩大这三个维度,模型性能就能持续且可预测地提升。后来DeepMind的Chinchilla论文进一步修正了最优的数据-参数配比。黄仁勋在GTC 2024上将Scaling Law提升到战略高度,将其与摩尔定律类比,认为它是推动AI持续进步的核心引擎。
本文基于一位从华为离职后加入大疆的AI从业者在杭州云栖小镇的分享,梳理Scaling Law的完整演进脉络,并探讨Physical AI时代的技术走向。


Scaling Law的五层演进体系
第一层:Pre-Training Scaling(预训练扩展)
预训练扩展是最经典、也是最广为人知的一条路线。核心逻辑非常直接:通过增加模型参数规模、训练数据量和计算量,让基础模型的能力持续提升。
从GPT-1到GPT-4,从LLaMA 1到LLaMA 4,从DeepSeek V1到V4,所有主流基础模型的迭代都在验证同一个规律——数据越多、模型越大、计算量越大,效果就越好。这条路线虽然简单粗暴,但至今仍是AI能力提升的基石。
值得注意的是,预训练扩展并非无限制的线性增长。随着高质量文本数据逐渐被消耗殆尽(据估计,互联网上的高质量英文文本总量约为数万亿token),行业开始探索合成数据(Synthetic Data)、多模态数据以及更高效的数据配比策略来延续这条曲线。
第二层:Post-Training Scaling(后训练扩展)
后训练扩展在预训练基础之上,通过指令微调、RLHF、DPO、GRPO等强化学习手段,让模型进行自学习,提升特定任务的表现。代表性工作包括GPT-4的对齐训练、Claude的安全训练以及DeepSeek V3的强化学习阶段。
具体而言,RLHF(基于人类反馈的强化学习)是OpenAI在InstructGPT和ChatGPT中使用的核心对齐技术,其流程包括收集人类偏好数据、训练奖励模型、再用PPO算法优化语言模型。DPO(直接偏好优化)由斯坦福团队提出,绕过了显式奖励模型,直接从偏好数据中优化策略,大幅降低了训练复杂度。GRPO(组相对策略优化)则是DeepSeek的创新方法,通过组内相对排序估计基线值,无需额外价值网络,在数学推理等任务上效果显著。
后训练的核心价值在于:它让模型从"能力强"变为"能力强且可控",这对产品化落地至关重要。
第三层:Test-Time Scaling(推理时扩展)
推理时扩展是近两年最具突破性的方向。传统认知中,模型推理只是简单地给出答案,但实践证明,在推理阶段投入更多计算量和时间,让模型进行更深层的思考和验证,能获得显著更好的结果。
思维链(Chain of Thought, CoT)最早由Google Brain的Jason Wei等人在2022年提出,核心发现是:当提示模型展示中间推理步骤时,复杂推理任务的表现会大幅提升。OpenAI的O1/O3系列将这一思想推向极致——模型在生成最终答案前,会进行大量内部"思考",包括问题分解、假设验证、回溯修正等。这种方法的理论基础在于:传统自回归生成是"System 1"式的快速直觉反应,而Test-Time Scaling让模型具备了"System 2"式的慢思考能力。计算量的增加不再只发生在训练阶段,推理阶段的算力投入也能换来质量提升,这打破了"训练一次、推理免费"的固有认知。
OpenAI的O系列模型引入思维链,DeepSeek的推理模型以及多人推理等技术不断涌现,证明了"让模型想得更久"本身就是一种有效的扩展方式。
第四层:Agent Scaling(智能体扩展)
以大模型为核心,扩展周边工具调用、记忆(Memory)、规划(Planning)等能力,放大单智能体执行复杂任务的上限。代表性技术包括:
- ReAct框架:由普林斯顿大学和Google Brain联合提出,将推理(Reasoning)和行动(Acting)交织进行——模型先思考当前应该做什么,然后执行动作(如调用API、搜索网页),观察结果后再进行下一轮思考。这种"思考-行动-观察"的循环让LLM能够与外部环境持续交互。
- Planning/Soft方法:让模型具备多步规划能力,将复杂任务分解为可执行的子任务序列。
- 长期记忆机制:突破上下文窗口限制,让Agent能够跨会话保持状态和知识积累。
- MCP协议:Anthropic在2024年底开源的Model Context Protocol,旨在为AI模型与外部数据源、工具之间建立统一的连接标准,类似于AI世界的"USB接口",解决了此前各家工具调用接口碎片化的问题。
- Function Call:OpenAI率先推出的能力,让模型能够结构化地调用预定义函数,是Agent能力的基础设施。
Agent Scaling标志着AI从被动应答走向主动执行,开启了全新的应用范式。
第五层:Multi-Agent Scaling(多智能体扩展)
当单个Agent的能力边界被突破后,多智能体协作成为新的扩展方向。通过智能体数量增加、角色分工和通信协议,完成远超单智能体能力的复杂工作。
有意思的是,Multi-Agent的爆发速度远超预期。代表性产品如Manus、OpenCore以及Agent-to-Agent协议的出现,让现在的程序员已经不是在写代码,而是在监控几十个Agent协同运作。这种模式类似于人类社会的组织分工——有的Agent负责信息检索,有的负责代码编写,有的负责质量审核,它们通过结构化的消息传递协议进行协调,涌现出超越任何单一Agent的系统级智能。
从Agentic AI到Physical AI的范式迁移
虚拟世界的天花板
五层Scaling体系在虚拟世界中已经构建了相当完整的技术栈。但一个核心问题浮现:五层之后,Scaling会停止发展吗?
答案是否定的。AI正在从虚拟世界的Agentic AI,快速迈向物理世界的Physical AI。虽然目前Physical AI还没有非常明确的杀手级应用,但趋势已经越来越清晰。黄仁勋在多个场合将Physical AI称为"AI的下一个前沿",认为让AI理解并作用于物理世界,是比纯数字智能更大的市场机会。
Physical AI时代的Scaling Law重构
Pre-Training层面:模型形态的根本转变
模型形态从LLM(大语言模型)到VLM(视觉语言模型)到VLA(视觉-语言-动作模型),正在走向WM(World Model,世界模型)。
VLA模型是Physical AI领域的核心架构创新。Google DeepMind的RT-2(Robotic Transformer 2)是早期代表,它将视觉理解、语言指令和机器人动作统一在一个Transformer架构中,实现了"看到什么、理解什么、就能做什么"的端到端控制。世界模型的概念源自Yann LeCun提出的JEPA(Joint Embedding Predictive Architecture)框架,核心思想是让AI像人类一样建立对物理世界的内部模型——理解重力、碰撞、流体动力学等物理规律,从而能够预测行动后果并进行规划。Meta的V-JEPA、Google的Genie 2、以及各自动驾驶公司的占用网络(Occupancy Network)都是世界模型的不同实现路径。
世界模型能够理解和模拟物理世界的运行规律,为无人机、自动驾驶、机器人等物理智能体提供决策基础。
Post-Training层面:模型压缩与专业化
Physical AI对后训练提出了全新要求。在垂直行业落地时,需要将大模型压缩、蒸馏、强化为更小更精的Small LLM/VLM/WM,以适应嵌入式设备的算力约束。围绕Physical AI Scaling Law进行模型的精简化和专业化,正在成为头部企业的核心攻坚方向。
这里涉及的关键技术包括:模型量化(将FP16精度压缩到INT4甚至INT2)、知识蒸馏(用大模型的输出指导训练小模型)、结构化剪枝(移除冗余的网络层或注意力头)等。目标是在保持核心能力的前提下,将模型体积缩小10-100倍,使其能够在功耗仅为几瓦的嵌入式芯片上实时运行。
Test-Time Scaling层面:从云端到端侧
在物理世界中,推理时扩展的形态发生了本质变化。可穿戴设备、AI眼镜等硬件需要实时理解周围环境,这意味着推理不再发生在云端,而是在随身的小型芯片上即时完成。
端侧推理面临的核心挑战是在极其有限的功耗和芯片面积下完成复杂AI计算。以AI眼镜为例,其芯片功耗通常需要控制在1-3瓦以内,而运行一个70亿参数的模型在云端GPU上需要数十瓦功耗。为解决这一矛盾,业界发展出专用NPU芯片设计(如高通的Hexagon、苹果的Neural Engine)、混合精度计算、以及端云协同推理等方案。Meta的Orion AR眼镜、以及众多AI眼镜创业公司,都在探索如何在极小的硬件形态中实现有意义的AI能力。
AI Glasses正是这个方向最被看好的品类。
情感与记忆:Physical AI的核心差异化
当AI硬件具备了Agent能力后,长期记忆(Memory)和情感理解(Emotion)将成为关键差异化因素。AI硬件不仅要能执行任务,还要能理解用户、陪伴用户——这意味着从"工具"到"伙伴"的质变。
长期记忆机制让Physical AI能够记住用户的偏好、习惯、生活节奏,随着时间推移提供越来越个性化的服务。情感理解则涉及多模态情感识别(通过语音语调、面部表情、生理信号等判断用户情绪状态)和情感生成(以适当的方式回应用户的情感需求)。这两项能力的结合,使得Physical AI有可能成为真正意义上的"数字伙伴",而非冰冷的工具。
目前已有大量创业公司在这个方向上布局,试图打造具有情感交互能力的物理智能体。
下一条增长曲线在哪?
从目前的技术演进规律来看,每一层Scaling都是对前一层"边界"的突破:
| 层级 | 突破的边界 |
|---|---|
| Pre-Training | 模型能力的边界 |
| Post-Training | 模型可控性的边界 |
| Test-Time Scaling | 推理质量的边界 |
| Agent Scaling | 单次交互的边界 |
| Multi-Agent Scaling | 单体能力的边界 |
Physical AI正在突破数字世界的边界,让AI真正进入物理空间。而当物理世界中的AI足够密集时,物理世界的Multi-Agent协作——即大量智能硬件的自组织协同——可能就是下一个爆发点。想象一下:城市中数百万台自动驾驶车辆、无人机、配送机器人通过去中心化的协议实时协调行动,这种物理世界的群体智能将远超任何单一设备的能力上限。
总结
Scaling Law远未到达尽头。它不是一条直线,而是一棵不断分叉生长的技术树。从虚拟到物理,从单体到群体,从工具到伙伴,AI的扩展之路仍然充满想象空间。
对于从业者而言,理解这五层(乃至更多层)Scaling的内在逻辑,才能准确判断下一个技术浪潮将在何处涌起。无论是选择深耕Multi-Agent协作,还是投身Physical AI的世界模型研发,关键在于看清Scaling Law演进的方向——每一次突破,都是对现有边界的跨越。
核心要点
相关推荐

抗投毒概念锚定:防御AI数据污染的新思路
深入解析Poison-Resistant Concept Anchoring方案,通过签名锚点与有界更新机制防御数据投毒攻击。实验显示该方法可隔离62%投毒数据,同时保持0%正常数据误拦率,为联邦学习和开源模型协作提供可行的安全防御框架。

匈牙利算法详解:原理、复杂度与工程实现指南
深入解析匈牙利算法(Hungarian Algorithm)的核心原理、O(N³)时间复杂度优势及工程实现方法。涵盖分配问题定义、算法步骤详解、Python/C++实用工具库推荐,以及在多目标跟踪、资源调度等场景中的应用实践。

Hermes Control Deck:用手机远程操控Codex的开源硬件控制台
Hermes Control Deck是一个开源微型控制台项目,支持通过实体按钮和手机远程界面控制Codex编程助手,提供会话恢复、实时状态监控、远程审批等功能,为AI编程交互带来全新体验。