对抗强化学习:Critic攻击为何在多智能体环境中更强?

引言:一个来自实践的困惑
强化学习(RL)的安全性研究中,对抗攻击是一个日益关键的课题。当训练好的智能体策略被部署到现实世界,如何评估其面对恶意扰动时的鲁棒性,直接关系到系统的可靠性与安全性。
近日,一位研究者在 Reddit 上分享了一个耐人寻味的实验现象:在多智能体 PPO 策略上执行对抗攻击时,所得结果与该领域经典论文 Zhang et al. (2020) 的结论恰好相反。这一看似矛盾的发现,实则揭示了对抗强化学习中理论假设与实际场景之间的微妙张力。

SA-MDP 框架与两类攻击路径
什么是 SA-MDP
Zhang et al. 提出的 SA-MDP(State Adversarial Markov Decision Process,状态对抗马尔可夫决策过程) 框架,是研究观测扰动攻击的重要理论基础。其核心思想是:攻击者不改变环境的真实状态,而是对智能体接收到的**观测(observation)**施加扰动,诱导智能体做出次优决策。
SA-MDP 框架建立在经典马尔可夫决策过程(MDP)的基础上,通过引入对抗性观测扰动来刻画现实部署场景中的安全威胁。在标准 MDP 中,智能体观测到的状态与环境真实状态一致;而在 SA-MDP 中,攻击者被建模为一个受约束的扰动函数,其输出受到 L-p 范数球约束(通常为 L∞ 范数),确保扰动在感知上不易被察觉。这一框架与计算机视觉中的对抗样本研究有深刻联系——Goodfellow 等人 2015 年提出的 FGSM 方法和 Madry 等人 2018 年提出的 PGD 方法,均被直接迁移至 RL 观测攻击场景中,使得该领域得以站在图像对抗攻击已有的丰富工具链上快速推进。
这一设定贴近现实——很多场景中,攻击者无法直接篡改物理世界,却可以干扰传感器读数或通信信道,从而影响智能体对环境的感知。
Critic 攻击 vs Actor 攻击
基于策略梯度的算法(如 PPO)通常包含两个核心网络。近端策略优化(Proximal Policy Optimization,PPO)由 OpenAI 于 2017 年提出,是目前最广泛使用的深度强化学习算法之一,其 Actor-Critic 双网络架构为攻击者提供了两个截然不同的梯度来源:
- Actor 网络 π(s):直接决定智能体在给定状态下采取的动作。对于连续控制任务,Actor 通常输出高斯分布的均值与方差。
- Critic 网络 V(s):评估当前状态价值,用于指导策略更新。PPO 的核心创新在于引入裁剪目标函数,限制每次策略更新的幅度,而 Critic 则为这一过程提供优势估计基线。
围绕这两个网络,可以设计两类对抗攻击:
- 基于 Critic 的攻击:利用价值函数 V(s) 的梯度生成扰动,目标是让智能体进入被评估为"低价值"的状态。
- 基于 Actor 的攻击:直接利用策略网络 π(s) 的梯度生成扰动,目标是最大程度改变动作输出。
Zhang et al. 的核心论断是:基于 Critic 网络生成的攻击,预期效果应弱于直接使用 Actor 网络生成的攻击。这一结论在其采用的多个单智能体仿真环境中得到了实证支持。
实践中的反常现象
多智能体环境下的相反结果
上述研究者的实验观察到了截然相反的结论。其实验设置具体如下:
- 环境:基于 VMAS(Vectorized Multi-Agent Simulator)库中的多个多智能体场景。VMAS 是由 Bettini 等人开发的高性能多智能体仿真平台,专为大规模并行训练设计,支持 GPU 加速向量化环境,提供导航、追逐、物体搬运等多种连续控制基准任务,原生支持合作、竞争和混合博弈场景。
- 策略类型:IPPO(Independent PPO)与 GPPO(Graph Independent PPO,参见 Bettini et al. 2023),并包含异构(heterogeneous)版本。
- 攻击方法:将 PGD(Projected Gradient Descent,投影梯度下降)攻击适配至连续动作策略,使用 KL 散度的闭式解构造扰动目标。PGD 由 Madry 等人于 2018 年系统化提出,被视为一阶对抗攻击方法中的"最强基线",其本质是在 L-p 范数约束下对攻击目标函数进行多步梯度上升,并在每步后将扰动投影回合法约束集。对于连续高斯策略,KL 散度存在解析闭式解,可直接用于反向传播而无需采样近似,计算效率显著高于离散动作场景。
在上述设置下,基于 Critic 的攻击反而比基于 Actor 的攻击更强——与 Zhang et al. 的预期恰好背道而驰。
是实验误差,还是场景差异?
这位研究者提出了一个关键问题:这究竟是实验设计有误,还是由于场景差异,该结果本就不与 Zhang et al. 的发现相矛盾?
这触及了实证结论的适用边界问题,值得深入探讨。
深度分析:为何两类场景结果不同
单智能体与多智能体的本质区别
Zhang et al. 的实证基础是单智能体环境,而多智能体系统引入了根本性的复杂度变化。多智能体强化学习(MARL)的核心挑战在于非平稳性问题:从单个智能体视角看,其他智能体的策略随训练过程持续变化,使得环境等效为非平稳动态系统,这根本性地改变了价值函数的语义与梯度信号的性质:
- 非平稳性:每个智能体的最优策略依赖于其他智能体的行为,环境从单个智能体视角看是非平稳的。在单智能体 MDP 中,V(s) 仅需编码单一智能体与环境的交互动态;而在多智能体系统中,V(s) 隐式压缩了整个联合系统的复杂交互信息。
- 价值函数的耦合:多智能体场景中,V(s) 所编码的信息可能与其他智能体的联合状态紧密耦合,其梯度携带的"敏感度"信息远比单智能体情况丰富。
这意味着,Critic 网络在多智能体设置下可能捕捉到了策略更敏感的扰动方向,从而显著放大基于 Critic 的攻击效果。
连续动作空间与 KL 散度攻击的行为差异
另一关键差异在于动作空间的连续性。原论文部分实验涉及离散动作,而 VMAS 场景通常是连续控制任务。使用 KL 散度闭式解构造 PGD 攻击时,两类攻击的"目标信号"来源存在本质不同:
- 基于 Actor 的 KL 攻击:直接扰乱动作分布,目标是最大化 KL(π(·|s) ∥ π(·|s+δ))。但在连续高斯策略中,观测空间的微小扰动经过深层网络非线性映射后,对动作均值的影响可能被网络结构所稀释,未必能大幅改变动作输出。
- 基于 Critic 的攻击:沿价值梯度方向寻找更"致命"的观测扰动,可能将智能体推向真正糟糕的状态区域,其破坏力直接作用于累积回报的预期,而非仅仅当步动作的分布偏移。
图结构策略(GPPO)的额外影响
GPPO 引入图神经网络对智能体间关系进行建模。GNN 的消息传递机制使每个智能体的表示能够自适应地整合邻居智能体的信息,从而使每个智能体的策略能够感知全局上下文。图结构引入后,梯度不再仅在单个智能体的局部网络中传播,而是通过边连接在整个智能体图上扩散。这种全局耦合的梯度流动特性,可能使 Critic 网络在计算状态价值时隐式编码了多智能体系统的联合动态,为基于 Critic 的攻击提供了更具破坏力的扰动方向——这是传统 MLP 架构的单智能体策略所不具备的特性,进一步加剧了实验结果与原论文结论的分化。
结论与启示
综合分析,这位研究者观察到的"反常"现象很可能并不真正与 Zhang et al. 的结论相矛盾,而是揭示了原结论的适用边界:
- 理论结论具有情境依赖性:Zhang et al. 的论断建立在单智能体、特定环境和特定攻击构造之上,直接外推至多智能体连续控制场景需要谨慎。SA-MDP 框架本身的理论推导并未明确将多智能体非平稳性纳入考量,这是其核心局限。
- 多智能体的价值函数更"信息密集":Critic 网络在耦合系统中隐式压缩了联合系统的全局交互动态,可能编码了更强的攻击信号,使 Critic 攻击在此类场景中占据优势。
- 攻击构造方式至关重要:基于 KL 散度闭式解的连续策略攻击,与离散动作攻击的行为存在本质区别——前者直接作用于连续分布的解析形式,后者依赖离散概率向量,梯度信号的传播特性截然不同,不可混为一谈。
对于从事对抗 RL 研究的实践者而言,这个案例提供了一个宝贵提醒:不要盲目照搬既有结论,任何鲁棒性评估都应在目标部署场景中重新验证。系统性对比单智能体与多智能体设置下两类攻击强弱关系,本身就是对该领域有价值的贡献,值得进一步整理为论文或技术报告。
核心要点
相关推荐

Agent智能体开发入门:从概念到实战的完整指南
深入解析AI Agent智能体的核心架构与开发实战,涵盖自动化营销、智能客服、投资分析三大落地场景,以及单智能体与多智能体协作机制,帮助初学者快速掌握Agent开发思维与实践路径。

Codex五分钟建站真相揭秘:不是AI做网站,是AI帮你抄网站
揭秘短视频平台上火爆的Codex五分钟建站内容真相:博主们并非用AI原创网站,而是复制共享提示词或直接扒别人网站。了解AI编程工具的真实能力边界,别被焦虑营销带节奏。

提示词工程入门指南:从单次指令到系统化方法论
提示词工程零基础入门教程,详解提示词的四大作用、提示词与提示词工程的核心区别、六步系统化流程,以及必须了解的技术与落地局限性,帮你真正发挥AI的全部潜力。