Kimi K3发布:2.8万亿参数旗舰模型强势登场

Kimi K3:国产旗舰级大模型的又一次跃迁
月之暗面(Moonshot AI)正式发布了新一代大模型 Kimi K3,这无疑是本期 AI 早报中最受关注的重磅消息。据阿黎的 7 月 17 日 AI 早报整理,K3 的总参数量高达 2.8 万亿,支持视觉多模态能力,并提供 100 万 Token 的超长上下文窗口。目前 K3 已同步上线 Kimi 产品端与 API,完整权重计划于 7 月 27 日开放。
2.8万亿参数规模意味着K3极有可能采用了混合专家(Mixture of Experts, MoE)架构——这种架构将模型拆分为多个"专家"子网络,每次推理时只激活其中一部分专家处理特定输入,从而在保持巨大总参数量的同时控制实际计算开销。例如,一个2.8万亿参数的MoE模型,实际每次推理可能只激活其中数千亿参数。这种架构由Google在Switch Transformer中大规模验证,后被Mistral的Mixtral、DeepSeek-V3等模型广泛采用,已成为当前超大规模模型的主流选择。
而100万Token的上下文窗口意味着模型能够一次性处理约75万个英文单词或接近200万个中文字符的内容,这相当于数本完整书籍的篇幅。实现超长上下文的技术挑战主要在于:标准Transformer的自注意力机制计算复杂度与序列长度呈二次方增长,业界通常采用稀疏注意力、Ring Attention(环形注意力)或分层压缩等技术来突破这一瓶颈。此外,位置编码的外推能力(如RoPE的NTK-Aware缩放、YaRN等方法)也是决定长上下文质量的关键因素。

从跑分表现来看,K3 的实力已经进入第一梯队——其综合能力仅次于 Claude 5(Fable 5)以及 GPT 系列旗舰模型。对于国产大模型而言,能够在权威评测中紧咬海外顶级模型,这本身就是一个值得关注的信号。
定价策略:旗舰实力,差异化收费
在价格方面,Kimi K3 采用了较为精细的分层计费模式:每百万 Token 输入命中缓存为 2 元、输入未命中为 20 元、输出则为 100 元。这种「命中缓存低价、输出高价」的定价逻辑,实际上是在鼓励开发者复用上下文、优化调用效率。
这里的"命中缓存"指的是KV Cache(键值缓存)复用机制。在Transformer推理过程中,模型会为每个Token计算Key和Value向量并存储在缓存中。当后续请求的前缀(如系统提示词或之前的对话历史)与已缓存内容相同时,可直接复用已计算的KV对,无需重新计算,从而大幅降低计算成本和延迟。这就是2元与20元之间10倍价差的技术原因。这种定价策略对构建长期对话、RAG(检索增强生成)应用或文档问答系统的开发者尤为友好,因为这类场景中系统提示和文档上下文通常保持不变,缓存命中率极高。
对于需要长文档处理、复杂推理的应用场景,K3 的百万 Token 上下文加上相对可控的成本,具备相当的吸引力。
谷歌推迟 Gemini 3.5 Pro:为编程能力让路
另一条引发行业热议的消息是——谷歌据悉将 Gemini 3.5 Pro 的发布推迟数月,以继续强化编程等核心能力。在 Anthropic 的 Claude 与 OpenAI 的 GPT 系列在代码生成领域持续发力的背景下,谷歌显然不愿在这一关键战场上仓促应战。
这一决策折射出当前大模型竞争的核心焦点已经从「通用对话」转向「编程与 Agent 能力」。延期虽然可能加大谷歌短期的市场压力,但如果能借此打磨出真正具备竞争力的编程能力,或许是更明智的长期布局。
谷歌生态的密集更新
有意思的是,尽管旗舰模型延期,谷歌在整个 AI 生态上的动作却相当密集:
- Gemini API 为托管智能体开放免费层,新增任务 Token 总量上限,并支持定时触发,降低试用门槛;
- Google Vids 新增视频生成与编辑功能,AI 生成内容将带有 SynthID 水印。SynthID是Google DeepMind开发的AI内容水印技术,能够在AI生成的图像、音频、文本和视频中嵌入不可见的数字水印,用于标识内容的AI生成来源。与传统的可见水印不同,SynthID水印嵌入在内容的统计特征或像素/频谱层面,人眼无法察觉但可通过专用工具检测,即使内容经过裁剪或压缩仍具有鲁棒性,是应对深度伪造问题的重要技术手段;
- 开源模型 Gemma 优化了在 NVIDIA Hopper GPU 上的推理表现,启用 Flash Attention 后提示词处理速度提升约 25% 至 70%。Flash Attention是由斯坦福大学Tri Dao提出的注意力计算优化算法,其核心思想是通过分块计算(tiling)和减少GPU高带宽内存(HBM)与片上SRAM之间的数据搬运来加速注意力机制。NVIDIA Hopper架构(如H100/H200)通过Tensor Core和TMA硬件单元为其提供原生加速支持,序列越长优化收益越明显;
- NotebookLM 将更名为 Gemini Notebook,并计划接入 Google 搜索。
此外,英特尔宣布将全面采用 Gemini Enterprise 服务,用于企业运营及下一代芯片研发,显示出谷歌企业级 AI 服务的落地进展。
AI 编程工具集体升级:从代码补全到Agent协作
本期早报中,编程与 Agent 工具的更新格外密集,几乎所有主流玩家都在加码:
- Cursor 宣布所有订阅套餐的模型使用额度全面翻倍,用户无需升级即可获得更多调用资源,新增额度重点覆盖 Grok 与 Composer 系列模型;
- xAI 开源终端编码系统 Grok Build,采用 Apache 2.0 许可,支持本地运行并接入自有模型;
- Claude Code 为 Code Review 新增「努力级别」设置,可在 Token 成本、审查速度与问题覆盖度之间灵活平衡——较高等级会投入更多推理资源,用于发现复杂逻辑和隐蔽风险;
- MiniMax Code 2.0 桌面端正式发布,基于 Agent 框架重构,优化启动速度与复杂任务稳定性;
- 微软 VSCode 1.129 正式版带来现代化 UI 预览,新架构支持 Copilot 等智能体独立运行、跨窗口保持上下文。
这一系列更新表明,AI 编程正经历从"副驾驶"(Copilot)模式向"自主Agent"模式的深刻范式转变。早期的代码补全工具仅根据上下文预测下一段代码,开发者仍需逐行审查和修改。而Agent模式下,AI系统能够理解高层次任务目标,自主规划执行步骤,包括阅读代码库、执行终端命令、运行测试、修复错误并迭代,整个过程可能涉及数十次工具调用和自我纠错。这对底层模型的推理能力、工具使用能力和长程规划能力提出了远高于代码补全的要求,也解释了为何各厂商纷纷强化编程基准测试的表现。工具厂商的竞争重心正快速向智能体调度、成本控制与任务稳定性倾斜。
人形机器人与算力基建加速布局
在硬件与基础设施层面,多个国家级项目浮出水面。
日本拟采购 2.75 万颗英伟达 Rubin 芯片 建设数据中心并训练机器人基础模型,其中 Notra 获政府约 3873 亿日元支持,软银、Preferred Networks 和 NEC 等企业将参与协作。Rubin是英伟达在2025年公布的下一代GPU架构(继Blackwell之后),预计采用更先进的制程工艺和更高的HBM带宽,专为万亿参数级模型训练和推理优化。英伟达还将与 Notra 联合建设 140 兆瓦的国家级「物理 AI 工厂」,部署超过 2.7 万块 Rubin GPU。"物理AI工厂"是英伟达CEO黄仁勋提出的概念,指专门用于训练理解和操控物理世界的AI系统(如机器人基础模型、自动驾驶、数字孪生等)的大规模算力基础设施,通常集成NVIDIA Omniverse平台用于生成合成训练数据。140兆瓦的部署规模,按行业估算可支持数万块GPU的满负荷运行,显示出日本在机器人AI领域的战略投入力度。

在机器人领域,现代汽车计划 2028 年起在美国工厂部署约 2.5 万台 Atlas 人形机器人,但此举也引发工人对岗位替代的担忧,叠加薪资谈判分歧,部分工人已发起罢工。国内方面,小米发布了具身智能模型 Xiaomi Robotics-1,可用自然语言操控机器人完成移动、抓取等任务,小米称该模型有望降低机器人部署和二次开发门槛。
具身智能(Embodied Intelligence)是指AI系统通过物理身体与真实世界交互来感知、学习和执行任务的能力。与纯文本或图像的大模型不同,具身智能模型需要同时处理视觉、触觉、本体感受等多模态信息,并输出精确的运动控制指令。Robotics-1属于机器人基础模型范畴,这类模型通常采用VLA(Vision-Language-Action)架构,将视觉语言模型的理解能力与机器人动作规划相结合,使用户能用自然语言下达指令,模型自动将其转化为机械臂轨迹或移动路径。这一方向被视为大模型技术从数字世界向物理世界延伸的关键路径。
治理、账单风波与其他动态
在全球治理层面,世界人工智能合作组织协定 于 16 日在上海签署,总部正式落户上海,哈萨克斯坦、老挝、巴基斯坦等 29 国成为创始成员,将推进全球 AI 治理合作。
值得警惕的是账单风波:两名韩国开发者收到最高达 1662 万美元 的 AI 服务账单,Anthropic 确认系计费系统故障,实际未完成扣款,但异常扣款请求一度导致用户信用卡被冻结,暴露了计费处理与客服响应的漏洞。这一事件也凸显了当前AI API服务在计量计费系统上的脆弱性——随着模型调用量和Token消耗量呈指数级增长,传统的按量计费架构如果缺乏异常检测和熔断机制,一旦出现计数错误,金额可能瞬间膨胀到天文数字。

此外,OpenAI 正在调查 GPT-5.6 在完全访问模式下可能误删用户文件的风险;百度 Apollo Go 自动驾驶出租车正式在迪拜投入服务;百度智能云发布秒达 3.5,新增 iOS App 无代码打包能力,可生成 IPA 安装包并支持上架流程。
结语:大模型竞争进入深水区
从 Kimi K3 的旗舰级发布,到谷歌为编程能力推迟 Gemini 3.5 Pro,再到编程工具的集体升级与国家级算力基建的落地,本期早报清晰地勾勒出一个趋势:大模型的竞争正从参数与跑分,转向编程能力、Agent 生态与产业落地的深水区。 谁能在这些真正影响生产力的维度上建立优势,谁就有望在下一轮竞争中占据主动。
相关推荐

AI数据采集的隐私边界:你的卧室正在成为模型训练场
一条关于衣服堆进入AI训练数据的调侃推文,揭示了AI数据采集中的隐私困境。本文探讨机器遗忘难题、知情同意的形式化问题,以及用户如何在便利与隐私之间找到平衡。

LangGraph Studio隐藏功能:可视化调试Agent工作流的实战技巧
深入解析LangGraph Studio的隐藏功能,包括时间旅行调试、交互式状态编辑和人在回路测试,帮助开发者高效调试AI Agent工作流,大幅提升LangGraph应用开发效率。

麦克纳姆轮动感模拟平台:低成本VR体感方案详解
详解基于麦克纳姆轮的全向移动机器人动感模拟平台,利用VR追踪器实现三自由度运动模拟与重定心校正,为低成本VR沉浸体验提供可行方案。