待验证50% 置信事实精确时间
Anthropic在2023-2024年间在Claude模型中识别出数百万个可解释特征,包括金门大桥特征实验
1
来源数
50%
置信度
长期有效
时效性
2026/9/3
首次发现
来源
涉及实体
相关事实
已验证Anthropic在2024年发表了关于Claude内部特征解读的机械可解释性研究,发现了数百万个可解释的特征单元79% 相似待验证Anthropic在2024年使用稀疏自编码器(SAE)成功分解Claude模型中数百万个可解释特征77% 相似待验证Anthropic在2023年发表的研究表明,通过SAE可以从Claude模型中提取出对应'金门大桥'、'代码错误'等具体概念的单元特征74% 相似待验证Anthropic在2024年为Claude模型引入了tool_use能力71% 相似待验证Anthropic于2023年发表论文《Towards Monosemanticity》,首次在百万参数级别模型中识别出数万个单语义特征69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/850080API
curl https://kongchang.com/api/v1/knowledge/claims/850080MCP
get_claim(id=850080)