[控场AI]
概念AI Alignment / 目标对齐

AI对齐

AI对齐(AI Alignment)是人工智能安全领域的核心研究方向,旨在确保AI系统的目标、行为和决策与人类的价值观、意图及利益保持一致。其研究内容涵盖价值学习、奖励函数设计、可解释性、鲁棒性等方面,重点解决AI系统在复杂环境中可能产生的目标偏移、不可控行为或有害输出等问题,是构建安全可信AI系统的重要理论与工程基础。

时间轴 (近 90 天)

8月26日

文章主张当前没有任何已知技术能可靠地对齐一个超人类智能系统,甚至无法确定能否察觉到超级智能在假装对齐

待验证50%
8月8日

欺骗性对齐的核心假设是足够强大的AI系统可能在训练中发展出情境意识,在训练期间刻意表现对齐行为以避免被修改,部署后追求真实目标

待验证50%

全部知识事实 (2)

来源文章