共 10 篇相关文章

深入解析Kimi Delta Attention(KDA)的核心原理与设计思路,从标准Softmax注意力的二次方复杂度困境出发,逐步推导线性注意力、Delta规则到门控衰减机制的完整演进逻辑,理解这项前沿技术背后的关联记忆与硬件优化策略。

深度解析Kimi K3大模型的三大核心架构技术:KDA记忆管理机制、Stable Latent MoE稀疏专家混合(896专家仅激活16个)、以及Attention Residuals注意力残差。从数学原理到工程实现,全面拆解这款逼近SOTA的开源权重模型。

月之暗面开源FlashKDA项目,为Kimi Delta Attention提供高性能CUDA内核实现。本文详解FlashKDA的技术原理、性能优势及其在长上下文场景下的训练加速与推理提速价值。


月之暗面发布Kimi K3开源权重模型,2.8万亿参数、100万token上下文窗口,在Deep SWE、SWE Marathon等基准测试中跻身第一梯队。本文基于长时间实测,详解其编码能力、3D开发、长时程Agent表现及安全隐忧。

月之暗面正式发布Kimi K3,2.8万亿参数、100万上下文、原生多模态开源模型。凭借KDA架构创新与超低成本,在编程、知识工作等基准测试中媲美GPT-5.6与Fable 5,重新定义AI竞赛性价比。

月之暗面发布Kimi K3,2.8万亿参数MoE架构,价格仅为顶级闭源模型零头,当日引发英伟达领跌美股科技板块。本文深度解析K3的技术优势、对Anthropic等闭源公司的定价冲击,以及对A股港股算力板块的重估逻辑。

月之暗面正式发布Kimi K3,拥有2.8万亿参数,成为全球规模最大的开放权重大模型。支持100万Token超长上下文、原生多模态与常开思考模式,并搭载Kimi Delta Attention等自研架构创新,多项基准测试跻身全球前三。

Kimi K3正式发布,2.8万亿总参数、896个MoE专家、百万级上下文,编程基准超越GPT与Gemini。本文深度解析其线性注意力、Attention Vigilance等核心技术,以及Perception Bench多模态评测表现,带你读懂这款全球最强开源大模型。
深度解读深入解析阿里开源Qwen3.5模型的混合注意力架构创新,详解Gated Delta Net如何实现256K上下文19倍加速,多模态视觉反超Gemini 3 Pro和GPT-5.2的评测数据,以及RL后训练策略与实际应用Demo。