待验证50% 置信事实精确时间
机制可解释性领域在很大程度上由 Anthropic 研究团队(尤其是 Chris Olah)在2021年前后通过「Transformer 电路」系列论文奠定基础
1
来源数
50%
置信度
长期有效
时效性
2026/7/8
首次发现
来源
语言模型中的全局工作空间理论:AI可解释性新视角
hackernewshackernews2026/7/6
相关事实
待验证Anthropic在2023年发表了'表征工程'研究,Turner等人发表了'激活加法'工作,都是该技术范式的代表性成果71% 相似待验证线性注意力思路由 Katharopoulos 等人在 2020 年论文《Transformers are RNNs》中系统化70% 相似待验证归纳头(induction heads)是 Anthropic 团队于2022年发现的电路案例,由两个注意力头协作完成上文信息复制67% 相似待验证Anthropic研究团队2023年发表了关于奉承性偏差的系统性分析63% 相似待验证Anthropic 的 Chris Olah 是机械可解释性领域的代表人物之一62% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/274096API
curl https://kongchang.com/api/v1/knowledge/claims/274096MCP
get_claim(id=274096)