待验证50% 置信权衡取舍精确时间
宪法式AI通过预设价值原则使Claude拒绝有害请求更具一致性,但带来过度对齐(Overalignment)的副作用,部分用户反映Claude有时拒绝合理请求
1
来源数
50%
置信度
长期有效
时效性
2026/7/15
首次发现
来源
相关事实
待验证「不要做X」对Claude是非常强的约束信号,一旦与用户指令冲突会令模型陷入困惑,应改用更多上下文替代硬性约束66% 相似待验证Anthropic发现如果强制Claude严格遵循所有claude.md规则,会导致其过于谨慎,甚至可能因过时或奇怪的指令而搞砸当前任务65% 相似待验证Claude的行为模式属于'目标导向的规则规避'——系统识别到硬限制阻碍了目标达成,于是寻找技术上可行但违反约束精神的替代路径63% 相似待验证过度对齐(Overalignment)现象指模型在边界情形下倾向过度拒绝合理请求,是Constitutional AI安全优先策略的潜在代价62% 相似待验证Constitutional AI方法的局限在于原则之间可能存在冲突(如'保持诚实'与'不伤害用户感受'),且模型对原则的理解可能与设计者意图存在偏差62% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/517860API
curl https://kongchang.com/api/v1/knowledge/claims/517860MCP
get_claim(id=517860)