概念Constitutional AI
宪法AI
Anthropic开发的AI训练方法,通过让模型依据一套宪法原则进行自我批判和修正,使AI行为更符合人类价值观,是Anthropic的核心技术差异化优势
时间轴 (近 90 天)
8月20日
对齐研究存在多条技术路线,包括基于RLHF的行为对齐、可解释性研究、宪法AI(Constitutional AI)和可扩展监督(Scalable Oversight)
待验证50%
Anthropic开发的AI训练方法,通过让模型依据一套宪法原则进行自我批判和修正,使AI行为更符合人类价值观,是Anthropic的核心技术差异化优势
对齐研究存在多条技术路线,包括基于RLHF的行为对齐、可解释性研究、宪法AI(Constitutional AI)和可扩展监督(Scalable Oversight)