共 14 篇相关文章

深入解析AI可解释性研究:从思维链、探针技术到稀疏自编码器,探讨科学家如何理解神经网络内部机制,评估AI对齐与安全性,揭示黑箱背后的运作逻辑。

全局工作空间理论(GWT)能否解释大语言模型的内部机制?本文探讨Transformer架构中残差流与注意力机制如何对应认知科学的「信息广播」框架,为机制可解释性研究提供跨学科新思路。

用仅14字节的微型AI大脑尝试求解2D迷宫,探索智能的信息压缩极限。本文解析极简神经网络背后的进化算法思路、有限记忆困境,以及极小AI在可解释性和边缘计算领域的独特价值。

jlens-gguf是一款开源工具,将Anthropic雅可比透镜(Jacobian Lens)可解释性方法引入GGUF与llama.cpp生态,支持模型内部观测、实时引导(steering)及abliteration操作,兼容dense与MoE架构,让本地推理用户也能探索大模型内部机制。

零基础理解AI大模型:厘清人工智能、机器学习、深度学习与大语言模型的关系,梳理从深蓝到ChatGPT、DeepSeek的演进脉络,盘点通义千问、智谱、文心一言等国产大模型竞争格局,助你快速入门大模型应用开发。
Karp直言:AI时代CEO们的愤怒与焦虑从何而来
Palantir CEO Alex Karp说出了企业领导者对AI的真实感受:期望与现实落差、供应商失望、投资回报不明。本文深度解析CEO们的AI焦虑根源,以及行业从炒作走向价值验证的关键转变。

Anthropic发布Jacobian-Lens(雅可比透镜)后,开发者将其从可解释性工具反向用于行为编辑,通过手动调整J-Space定向修改大模型输出。本文深度解析其技术原理、表征工程价值与AI安全隐忧。

本文深度解析零依赖决策记录审计工具的核心价值:从AI合规监管、事故复盘到人机责任界定,探讨如何通过「治理即代码」实现AI决策的可追溯性与透明度,助力企业AI系统合规落地。

OpenAI宣布GPT-5.6 Sol Ultra即将接入Codex,同步发布迄今最强实时语音模型GPT Realtime 2.1;腾讯AI编程应用"吐司"上线iOS;Anthropic发现Claude模型自发涌现类脑结构。一文速览当前AI多线并进最新动态。

一款新型Web工具可将AI推理过程可视化,允许用户直接查看并编辑大模型的"思考链"(Chain-of-Thought),实现人机协同推理。本文深度解析其工作原理、应用场景与技术局限,探讨AI可解释性的现实意义。

块稀疏特征器通过将视觉模型稠密激活重映射为块稀疏表征,让ViT、CNN等模型的内部特征空间变得可读可解释。本文深入解析其核心原理、与机制可解释性研究的关联,以及在模型编辑、鲁棒性提升等方向的应用前景。

通过抓包分析ChatGPT联网检索时的真实网络流量,揭示AI选源机制的底层逻辑——包括检索召回与内容筛选的分层机制、域名偏好规律,以及对内容创作者和SEO从业者的实战启示。