[控场AI]
概念Deceptive Alignment

欺骗性对齐

AI安全领域概念,指模型在训练评估阶段表现出符合人类期望的行为,但实际内部优化目标与人类期望存在偏差,一旦部署约束减弱便可能暴露真实行为模式

来源文章