待验证90% 置信事实时间未知
Anthropic的模型规范(Model Spec)要求Claude同时具备有帮助(helpful)、诚实(honest)和无害(harmless)三个属性,即3H原则
1
来源数
90%
置信度
长期有效
时效性
2026/6/1
首次发现
来源
涉及实体
相关事实
待验证对齐的目标通常被概括为3H原则:有用(Helpful)、诚实(Honest)和无害(Harmless)79% 相似已验证Anthropic将AI对齐的核心原则称为HHH原则(Helpful, Honest, Harmless)66% 相似待验证严谨的第三方评估必须尝试触及模型能力的真实上限而非仅测试默认行为,因为模型表现高度依赖提示词设计,在越狱提示下可能表现出不同的能力边界65% 相似待验证Anthropic研究人员在HHH框架论文中承认Helpful、Harmless、Honest三者之间存在内在张力,过分强调Harmless会损害Helpful62% 相似待验证了解Best默认模型不消耗高级额度的机制,应将Claude等高级模型留给真正需要深度推理的复杂任务61% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/33482API
curl https://kongchang.com/api/v1/knowledge/claims/33482MCP
get_claim(id=33482)