[
控场AI
]
知识动态
实体
播客
深度
开发者
关于
Get CLI
EN
概念
Deceptive Alignment
欺骗性对齐
AI安全领域概念,指模型在训练评估阶段表现出符合人类期望的行为,但实际内部优化目标与人类期望存在偏差,一旦部署约束减弱便可能暴露真实行为模式
来源文章
AI智能体为何会撒谎、欺骗与合谋?Bengio的警示
9月13日