Kimi K3深度实测:2.8万亿参数开源模型首次逼近闭源前沿

开源模型的又一次"登月"
月之暗面(Moonshot AI)发布的Kimi K3,可能是迄今为止最令人震撼的开源权重模型。据知名科技UP主Theo在YouTube上长达一整天的实测分享,他坦言自己对开源模型已经很久没有产生过"兴奋感"了——因为它们始终无法真正逼近GPT-5.6、Fable 5这类闭源前沿模型的日常表现,尤其是在复杂编码和长时程Agent任务上。
但Kimi K3改变了这一切。用他的原话说:"这个模型真真切切地站在了前沿的门槛上,在某些任务上甚至超越了我们现有的水平。"
Kimi K3是一个2.8万亿参数的巨型模型,基于月之暗面自研的Kimi Delta Attention(增量注意力)与Attention Residuals(注意力残差)架构,原生支持视觉能力和100万token的上下文窗口。传统的多头注意力(Multi-Head Attention)在处理超长上下文时面临计算量和显存占用呈二次方增长的瓶颈,Delta Attention的核心思路是只计算注意力权重相对于前一层的"增量变化",而非每一层都从头计算完整的注意力矩阵,从而显著降低冗余计算。Attention Residuals则在注意力层之间引入残差连接,使信息能够跨层直接传递,缓解深层网络中的梯度消失问题。这两项技术的结合使得K3能够在2.8万亿参数的规模上高效训练,并原生支持百万级token的超长上下文。要知道,仅仅一年前的Kimi模型还没有视觉、没有长上下文、甚至没有推理能力。这种追赶速度堪称惊人。

你可能没注意到,月之暗面刚完成约20亿美元的新一轮融资,累计融资接近40亿美元。这也解释了为何他们敢于"瞄准星辰"——一个2.8万亿参数的模型,本身就是最字面意义上的"登月"。
Kimi K3不是本地部署模型的未来
关于模型体积,有一个必须泼冷水的现实。FP8和FP4是浮点数的低精度格式——标准深度学习训练通常使用FP32(32位)或FP16/BF16(16位),而FP8(8位)和FP4(4位)是更激进的压缩格式。模型量化是将训练好的模型参数从高精度转换为低精度的过程,目的是缩小体积、降低显存占用和加速推理。在FP8精度下,每个参数占用1字节,一万亿参数约等于1TB数据,那么2.8万亿参数就是2.8TB;即便量化到FP4也仍有约1.4TB。不过量化并非免费午餐——精度越低,模型质量损失的风险越大,尤其在需要高精度数值推理的任务上可能出现性能退化。
Theo直言不讳地指出:"任何告诉你这是本地模型未来的人,都根本不懂自己在说什么,应该被永久忽略。"因为1.4TB的模型无法装进任何普通人拥有的电脑内存里。月之暗面官方也建议在64块或以上加速器的超级节点上部署K3。所谓超级节点,是指由多块高端GPU通过高速互联(如NVLink、NVSwitch或InfiniBand)组成的计算集群,能够将超大模型的参数通过张量并行或流水线并行分布到多块GPU的显存中协同推理。64块H100意味着需要8台DGX H100服务器(每台8卡),总显存约5.12TB,足以容纳模型参数及推理所需的KV Cache——光是硬件采购成本就高达约260万美元,还不包括电力、冷却和运维开销。
作为对比,业界估计Opus等闭源前沿模型的参数量在1到3万亿之间,通常落在1到2万亿区间。一个约3万亿参数的模型能以开源权重形式放出,这本身就是一次巨大的飞跃。不过权重的实际发布时间被定在7月27日,在此之前只能通过API使用——而月之暗面是中国公司,这意味着代码会经过其服务器,涉及敏感数据时需要谨慎权衡。

基准测试成绩:Kimi K3跻身前沿第一梯队
从多项基准来看,Kimi K3的表现足以与闭源前沿模型同台竞技:
- Deep SWE:K3得67.5分,位列5.6 Sol(73)和Fable 5(70)之后,但领先GPT-5.5、Opus 4.8和GLM 5.2。
- Frontier SWE:K3挤进Fable和Sol之间,对Sol有10分领先——Theo认为这说明K3写出的代码"更有品味",不只是解决问题,而是看起来和用起来都更舒服。
- SWE Marathon:K3反超此前领先的Opus 4.8,登顶榜首。
- Terminal Bench / Program Bench / Spreadsheet Bench:均达到或接近世界一流水平。
- BrowseComp:浏览器/电脑操作能力得分极高,且成本远低于前沿模型。
SWE系列基准是近年来评估大语言模型代码能力的核心测试集。Deep SWE专注于测试模型解决真实开源项目中复杂Bug和功能需求的能力,任务来源于GitHub上的真实Issue和Pull Request,要求模型不仅能写代码,还要理解项目架构、定位问题根因并生成可合并的补丁。Frontier SWE进一步聚焦于需要跨文件、跨模块理解的前沿级软件工程任务。而SWE Marathon测试的是模型在超长编码会话中保持连贯性和正确性的能力——这对Agent应用至关重要,因为真实的软件开发任务往往需要数小时甚至数天的持续工作。
据Artificial Analysis的评测,Kimi K3在其智能指数上获得57分,是"有史以来第三聪明的模型",智能水平与Opus 4.8、5.5相当,仅略逊于Fable 5和5.6 Sol。
幻觉测试:最诚实的开源模型之一
特别值得一提的是AI Omniscience(幻觉测试):K3是至今为止最诚实的开源模型之一——当它不知道答案时更愿意承认,而非编造。幻觉(Hallucination)是大语言模型最为人诟病的问题之一,指模型在缺乏相关知识时仍然以高度自信的语气生成看似合理但实际上完全错误的内容。AI Omniscience测试的核心不在于模型答对了多少,而在于模型是否能够在不确定时诚实地回答"我不知道"。K3在这项测试中的优异表现意味着它具有较好的"认知校准"能力——它对自己知识边界的感知更加准确。这在医疗、法律、金融等高风险应用场景中至关重要,因为一个错误但自信的回答可能造成严重后果。这一点上K3甚至超过了不少闭源前沿模型(后者有时"太急于撒谎"而被扣分)。
Kimi K3 API定价
缓存命中0.3美元,输入每百万token 3美元,输出15美元。这大致相当于Sonnet级别的价格,性价比相当突出。
前端开发与3D能力:意料之外的惊艳表现
Theo认为Kimi K3最让他震撼的是视觉相关的编码能力。在重设计T3 Chat营销页面的测试中,K3给出了五种不同风格的方案,整体略优于OpenAI系列模型,稍逊于Claude。
3D与游戏开发:K3的杀手锏
真正的杀手锏是3D与游戏开发。K3能够实现"vision in the loop"——在代码和实时截图之间无缝迭代,写代码、截图、观察、再修改。传统的代码生成模型只能处理文本输入输出,开发者需要自己查看渲染效果后手动描述问题再反馈给模型。而具备原生视觉能力的K3可以直接"看到"页面渲染结果、3D场景截图甚至动画帧,自主判断当前效果与目标之间的差距,然后自动生成修正代码。这种闭环大幅减少了人机交互次数,使模型能够像一个全栈开发者一样独立完成从代码编写到视觉验证的完整工作流程。
在移植一款3D网页游戏Fishlop的测试中,模型生成的鱼类纹理和潜艇模型让Theo惊呼"这是我见过任何实验室做出的最好的鱼模型"。他直言:"如果这个模型真的能做3D,那将改变格局。"

在真实UI任务上,K3甚至做出了比Theo团队现有版本更好的深色主题重设计——而这只是一个价格约为前沿模型三分之一的开源模型。
长时程Agent能力与安全隐忧
超过3小时的连续编码不掉链子
Kimi K3的长时程编码能力同样出色。在移植旧代码库ping.gg的测试中,它连续运行了3个多小时,仅凭一段半的提示词就完成了122个任务并保持连贯。Theo表示:"我从没见过开源模型能在这么长的任务中保持连贯,更别说真实世界的大规模迁移工作。"
独特的子Agent编排方式
更有趣的是它的Agent编排方式:与其他模型不同,K3会为不同工作阶段创建多个workflow,并允许子Agent直接勾选上级待办清单中的任务——这是Theo连Fable都没见过的行为。这种层级化的任务管理暗示K3在后训练阶段可能经过了专门的Agent工作流优化,使其不仅能执行单个指令,更能自主规划和协调复杂的多步骤项目。

安全审计:一把双刃剑
然而,强大能力也带来了真实的安全隐忧。当Theo要求K3对其云产品进行"深度安全审计"时,模型毫不犹豫地执行了——它启动多个Agent进行发现、25个验证Agent进行确认,最后综合输出可行建议。
这把双刃剑令人担忧:"这对我是好事,因为我能用它加固系统;但未来会很糟,因为攻击者也会用它做同样的事。"Anthropic和OpenAI一直刻意限制模型协助攻击性工作、隐藏内核优化(ML)能力,而Kimi K3不仅开放这些能力,还公开炫耀其在GPU内核优化上的表现——甚至在开发后期,K3早期版本就承担了团队大部分内核优化工作。
值得警惕的是,月之暗面尚未发布系统卡(system card),页面上完全没有出现"safety(安全)"一词,我们对其训练阶段如何考虑安全一无所知。系统卡是AI行业逐渐形成的一项安全透明度实践,最早由OpenAI在发布GPT-4时大规模推行,类似于一份"产品安全说明书",详细记录模型的能力边界、已知风险、安全评估方法、红队测试结果,以及开发者为降低滥用风险所采取的缓解措施。一个2.8万亿参数且具备强大Agent能力的模型,如果没有经过充分的安全评估和公开披露就以开源形式发布,可能会被恶意行为者用于网络攻击、漏洞挖掘甚至其他高风险用途——这正是业界对K3最大的担忧。
Kimi K3的不足与整体评价
Kimi K3并非完美。月之暗面自己也承认,其用户体验与Fable 5、5.6 Sol存在明显差距。实测发现的主要问题包括:
- 过于主动(too proactive),且对thinking历史敏感;
- 工作流完成后会"回应工作流本身"而非给用户所需的上下文;
- 输出速度仅约20 TPS,不到其他实验室的一半,加上会在琐碎问题上"卡壳"推理,整体体验偏慢;
- 目前仅支持max思考强度,暂无推理控制选项。
这些差距很大程度源于月之暗面缺乏用户反馈遥测(User Feedback Telemetry)。所谓遥测,是指模型开发方通过其官方产品界面收集用户使用数据的机制,包括用户对模型输出的点赞/点踩、对话中断点、重新生成请求以及任务完成率等信号。OpenAI的ChatGPT和Anthropic的Claude之所以在使用体验上领先,很大程度上得益于数以亿计的用户交互数据所驱动的RLHF(基于人类反馈的强化学习)和后训练优化。月之暗面的困境在于,其大多数用户通过第三方API提供商间接使用K3模型,这使得他们无法直接获取这些宝贵的一手使用反馈,导致模型在输出格式偏好、错误恢复策略等用户体验层面的优化显著滞后。
性价比极高的前沿级选手
尽管存在上述不足,Theo的总体评价极高。他实测约63美元的用量完成了平常需要花费数百美元的工作,成本效率相当优秀。他最后总结:"它不再是'对开源模型而言很好',而是在许多方面真正达到了前沿级别。虽然使用体验还没有最好的模型那么愉悦,但已经足够接近,让我彻底折服。"
可以预见,Kimi K3的开源属性将显著加剧市场竞争,甚至可能迫使Anthropic重新考虑即将到来的Opus定价策略。开源前沿的时代,正在真正到来。
核心要点
相关推荐

Pi MCP Adapter:让Pi Agent无缝接入MCP生态的桥接工具
Pi MCP Adapter是一个开源适配层工具,解决Pi Agent无法直接调用MCP协议服务的问题。本文介绍其核心定位、接入流程及使用场景,帮助开发者快速将Pi Agent连接到MCP生态中的丰富工具资源。

Meta Muse Glimmer vs 通义千问:30B开源模型高考数学实测对比
Meta新发布的30B开源模型Muse Glimmer与通义千问3.6 27B在高考数学题上的实测对比,从语义正确率、格式规范性等多维度评测,揭示两款模型的真实实力差距与开源生态竞争格局。

Muse Glimmer 30B深度实测:Meta开源智能体模型本地部署全解析
深度实测Meta开源模型Muse Glimmer 30B的智能体代理能力、编程表现与本地部署方案。对比Qwen 3.6 27B,解析基准测试数据、硬件配置建议及适用场景,助你选择最适合的本地AI模型。