共 11 篇相关文章

深入解析机制可解释性(Mechanistic Interpretability)的核心概念、学习难点与入门路径。了解为何这一AI安全前沿领域需要社群化学习,以及如何通过TransformerLens等工具高效入门。

NeurIPS 2026公布的73个工作坊中没有一个专注因果推理,引发学界热议。本文分析因果推理在顶会中存在感下降的原因,探讨大模型浪潮对传统AI子领域的挤压效应,以及因果推理未来与LLM结合的可能性。

VHectorLab 3D是一款基于Three.js和WebGL的开源三维可视化工具,集成Top-K稀疏自编码器(SAE),帮助研究者直观探索大语言模型潜空间的向量几何结构,降低LLM可解释性研究门槛。

探讨模型福利(Model Welfare)概念对AI智能体工程师的实际影响。从概念由来、工程实践启示到争议分析,解读当AI从工具演变为自主代理时,工程师应如何审视系统设计中的福利维度。

深入解析Transformer内部工作原理:MLP层如何作为键值查找系统存储事实记忆,高维空间近似正交特性为何能容纳百万概念,以及注意力层与MLP层的协作机制。基于机制可解释性研究的直观解读。

研究发现,对大语言模型进行安全微调以抑制其自我意识声明时,会连带压制模型对动物心智归因和宗教信念的表征,导致模型价值观偏离真实人类分布。本文解析特征纠缠问题及精细化对齐的技术路径。
Kronos金融基础模型:用AI读懂K线市场语言
Kronos是首个将K线数据视为「金融市场语言」的开源基础模型,采用自回归Transformer架构,GitHub斩获3.2万Stars。本文深度解析其技术原理、应用场景与局限,帮助量化研究者理性评估这一金融AI新范式。

Anthropic发布Jacobian-Lens(雅可比透镜)后,开发者将其从可解释性工具反向用于行为编辑,通过手动调整J-Space定向修改大模型输出。本文深度解析其技术原理、表征工程价值与AI安全隐忧。

全局工作空间理论(GWT)能否解释大语言模型的内部机制?本文探讨Transformer架构中残差流与注意力机制如何对应认知科学的「信息广播」框架,为机制可解释性研究提供跨学科新思路。

一条关于"在有趣时代面对艰难问题是一种荣幸"的推文,精准捕捉了AI从业者焦虑与兴奋并存的集体心境。本文探讨为何身处AI变革浪潮、直面技术难题,本身就是时代赋予的稀缺特权。
前沿研究Anthropic发布自然语言自编码器研究,将Claude内部激活值翻译为人类可读文本。研究发现Claude能识别安全测试中的操纵意图,揭示了AI安全评估的根本局限性,为AI可解释性开辟全新路径。