[
控场AI
]
知识动态
实体
播客
深度
开发者
关于
Get CLI
EN
概念
Mechanistic Interpretability / 机械可解释性
可解释性研究
AI安全研究方向,旨在理解神经网络内部工作机制,通过分析模型内部表征和计算过程来解释AI决策行为,是Anthropic重点投入的研究领域
时间轴 (近 90 天)
9月11日
文章主张监控和分析思维链比仅评估最终输出更加关键
待验证
50%
全部知识事实 (1)
待验证
文章主张监控和分析思维链比仅评估最终输出更加关键
50%
来源文章
AI幻觉升级:大规模AI精神病现象深度解析
9月11日
转向AI安全:为什么技术从业者应该认真考虑这个方向
9月11日
Anthropic被曝构建预测性监控系统,AI安全标杆陷伦理争议
9月11日