DeepSeek三连发、小米MiMo V2.6登顶开源、Grok 4.7逼近Opus

DeepSeek、小米、xAI单日密集发布,国产AI模型在开源榜与性价比上全面突破。
本文梳理了AI行业在同一天内爆发的多条重要进展。DeepSeek同步披露了DSEC沙箱平台技术报告、转向华为芯片的战略意图和CFO补位三条信息,展示完整的战略布局;小米开源的MiMo V2.6 Pro以46分登顶Artificial Analysis开源模型智能指数,并以0.13美元/任务的成本站上性价比帕累托前沿,成为当日最重量级的开源事件;与此同时,Command Code、OpenCode、月之暗面Kimi Code等主流AI编程工具加速接入国产模型。海外方面,xAI发布Grok 4.7,在CursorBench基准上以46.3%逼近Anthropic Opus 5 Max的46.6%,成本更低。此外,欧盟提议AI数据使用免用户同意引发隐私争议,阿里巴巴发布性能三倍于前代的平头哥PPU芯片,与DeepSeek转向国产算力的趋势形成呼应。
AI行业的密集更新还在继续。DeepSeek一天内接连披露沙箱平台、芯片战略与人事补位,小米开源的MiMo V2.6拿下开源模型智能指数榜首,xAI的Grok 4.7在编程基准上逼近Anthropic的Opus。这份日报梳理了当天最值得关注的几条主线。
DeepSeek的三个动作:技术、芯片与团队
DeepSeek广告在同一时间点释放了三条信息,构成一套完整的战略姿态。
技术层面,DeepSeek发布了DSEC沙箱平台技术报告。该平台通过统一SDK提供函数调用、容器、MicroVM和完整虚拟机四种沙箱后端,兼顾轻量与隔离度不同的执行需求。规模数据颇为可观:单个生产单元约160个节点,每天服务约300万个沙箱,峰值并发超过38万,沙箱创建速度超过每秒5000个。这类基础设施是智能体大规模执行代码、运行命令的底层支撑,数据规模反映出DeepSeek在Agent执行环境上的工程积累。
芯片层面,The Information报道称DeepSeek计划优先使用华为芯片训练模型。CEO梁文峰向投资者表示,希望采用更多国产制造的训练芯片,并将在2026年四季度到2027年一季度间接收新一批华为芯片。这一表态与近期国产算力自主化的大趋势一致。
人事层面,资深创投合伙人闫文涛已于9月21日正式入职DeepSeek,终结了公司成立三年多来CFO空缺的局面。补齐财务负责人,通常意味着公司在融资、资本运作层面进入更成熟的阶段。
DSEC沙箱平台所采用的四层隔离架构值得展开说明。函数调用(Function Call)是最轻量的方式,直接在进程内执行,适合无副作用的简单计算;容器(Container)基于Linux cgroups/namespace隔离,资源开销低但共享宿主内核;MicroVM(如Firecracker)在轻量虚拟机内运行,启动时间毫秒级,兼顾速度与内核级隔离,是目前主流Serverless平台的主流选择;完整虚拟机则提供最强的隔离性,适合需要完整操作系统环境或高安全等级的任务。对于AI Agent来说,执行用户提交的任意代码(Code Interpreter)天然需要隔离沙箱,否则恶意代码可能逃逸到宿主系统。每天300万沙箱、峰值38万并发的规模,意味着DeepSeek的Agent服务已进入工业化运营阶段,这也是理解其基础设施投入逻辑的关键背景。
小米MiMo V2.6:开源模型登顶智能指数
小米正式发布并开源了MiMo V2.6系列的Pro与Flash两个全模态模型,这是当天分量最重的开源事件。
Pro版在Artificial Analysis智能指数拿到46分,领先所有开源模型。更关键的是性价比:在智能成本前沿图上,MiMo V2.6 Pro每个任务成本约0.13美元,以远低于海外旗舰的价格站在帕累托前沿。在智能体基准对比中,其成绩比肩Claude Opus 5和GPT-5.6级别的表现。
Flash版则全面超越上一代Pro。在不到6天的Live RL训练里,Flash与Pro的Deep SWE成绩分别从48.8和58.4提升到65.7与72.6,训练成本约85万与262万美元——用相对可控的成本换来了显著的能力跃升。同步开源的Distill量化9B模型经过RL训练后,在11项智能体评测中全面超越SFT基线,SWE-Bench Verified达到66.2。

定价上,小米MiMo开放平台公布V2.6系列API价格:Pro版每百万Tokens输入3元、输出6元,Flash版输入1元、输出2元。折算美元后,Flash版每百万Token输入0.14美元、输出0.28美元,Pro版为0.435美元和0.87美元,价格进一步压低了开源模型的调用门槛。
文中多次出现的帕累托前沿(Pareto Frontier)是评估模型性价比的核心坐标系。在以"模型智能得分"为横轴、"每任务成本"为纵轴的散点图中,帕累托前沿由那些"无法在不牺牲某一维度的情况下同时做到更聪明且更便宜"的模型连线构成——即"最优解集合"。位于帕累托前沿上的模型意味着:没有其他模型能在相同成本下提供更高智能,或在相同智能水平下花费更少。MiMo V2.6 Pro以0.13美元/任务的成本站上这条线,意味着它在价格与能力的组合上达到当前开源领域的最优点,而非单纯"便宜"或单纯"强"。Deep SWE是Artificial Analysis推出的软件工程智能体基准,要求模型自主完成真实GitHub仓库中的代码修复任务,比SWE-Bench更侧重端到端的Agent执行能力,是目前衡量编程智能体实战水平的重要参照。
编程工具集体接入国产模型
国产模型的能力提升,正在被主流AI编程工具快速吸收。
Command Code上线了MiMo V2.6系列。在其GOAT编程套餐里,DeepSeek V4.1 Flash每5小时可发起30800次模型请求,每周额度约76900次;而MiMo V2.6 Flash的额度达到每5小时43500次请求,明显高于前者,对高频编码用户更友好。

OpenCode宣布MiMo V2.6 Flash开放一周免费使用,Flash与Pro两个版本同时登录其GOAT订阅方案。智谱GLM Coding Plan则宣布夜间畅用活动延续到10月7日,每晚23点至次日9点可在Z.code免费无限使用GLM-5.3 Flash;双节期间(9月25日至10月7日)套餐全天按非高峰倍率消耗。
月之暗面发布了Kimi Code Desktop,把智能体编程能力带进图形化的官方桌面客户端,支持macOS与Windows。用户在桌面端通过对话就能让Agent读写代码、运行命令、执行自动化任务,并制定可评审、可反馈的执行计划。客户端提供Plan、Go、Swarm与实验性的Tower模式,把大任务拆给多个子智能体分工推进并汇总结果——这是Agent编程从命令行走向图形化交互的一个信号。
Grok 4.7逼近Opus,海外前沿持续竞速
xAI正式发布Grok 4.7,支持图文输入与50万Token上下文,定价与上一代持平,每百万Token输入2美元、输出6美元。
性能上,在CursorBench 4.0基准中,Grok 4.7 Extra High得分46.3%,逼近Opus 5 Max的46.6%,而成本仅6.01美元。官方对比表显示,Grok 4.7在Deep SWE软件工程评测拿到71.0%,TerminalBench 38.0%,全面超过Grok 4.6。在面向专业工作的GDPVal评测中,Grok 4.7以1695的Elo仅次于Fable 5.1的1735,领先Grok 4.6和GPT-6。

消费端也有动静:Meta的个人智能体应用Muse上线约10天登顶美国App Store免费应用榜,把ChatGPT压在第二位,显示出大厂在C端Agent入口上的争夺。Cloudflare则宣布Python Workers正式版全面可用,Python成为其开发者平台上一等、完全支持的语言。
CursorBench是AI代码编辑器Cursor推出的实际编程能力基准,以真实软件工程任务(如bug修复、功能实现、代码重构)为测试集,得分反映模型在有上下文代码库情况下的完成率。该基准被业界视为更贴近生产环境的编程评测,因为它模拟了开发者日常在IDE中的实际操作场景,而非仅考察孤立的算法题。GDPVal(General Developer Productivity Valuation)则是针对专业开发工作流的综合评测,使用Elo竞技积分制衡量模型在多种专业场景下的相对能力,Elo分越高代表在模型对比中胜率越高。两者结合使用,能够从"特定代码任务"与"通用开发工作流"两个维度立体衡量编程模型的实力,这也是当前AI编程工具选型中最常引用的两组指标。
数据隐私争议与国产算力布局
两条与AI相关的政策与硬件消息同样值得关注。
泄露的理事会文件显示,爱尔兰作为欧盟轮值主席国提议:AI情境下的个人数据使用可自动获得合法授权,无需再征得用户同意。条款将覆盖过去数十年收集的个人数据,即使用户从未使用过AI产品也被纳入其中。隐私组织Noyb批评这是对欧洲人的"数字剥夺"。若该提议落地,将对AI训练数据的合规逻辑产生深远影响。

算力层面,阿里巴巴发布平头哥PPU(真5V900)AI芯片,性能达到上一代的3倍,最多可组成50万颗芯片的巨型集群,直接对标英伟达。阿里承诺3年投入超530亿美元,到2032年把阿里云广告全球数据中心容量做到20多瓦级别,为前沿模型训练储备算力。国产算力的自研与扩建,与DeepSeek转向华为芯片的选择形成呼应。
爱尔兰的提议触碰的是GDPR中合法处理个人数据的六大法律依据之一——"同意"(Consent)。GDPR规定,处理个人数据须满足合法、公平、透明原则,且需有明确的法律依据,其中"数据主体同意"是最常见的选项。AI训练数据的争议在于:许多模型使用了互联网上数十年积累的公开文本,涉及数亿用户的内容,但这些数据采集时并未告知用于AI训练。若欧盟通过"AI情境下数据使用自动获得合法授权"的条款,实质是用一种新的法律依据绕过逐一获取同意的要求,大幅降低AI公司的合规成本。隐私组织Noyb(None of Your Business,由马克斯·施雷姆斯创立)长期通过诉讼推动GDPR执法,将此称为"数字剥夺",认为这相当于在用户不知情的情况下将其历史数据追溯性地授权给AI公司使用。该条款若通过,将为全球AI训练数据合规监管树立重要先例。
小结
当天的主线清晰:国产模型在开源榜单与性价比上持续攻城略地,小米MiMo V2.6是最有代表性的一步;AI编程工具正加速把这些模型纳入订阅体系;海外前沿模型之间的差距被压缩到基准分的小数点后;同时,数据隐私与国产算力自主化成为绕不开的底层议题。
相关推荐

临床AI治理难题:Concurrence如何用Unity Gateway管控万亿Token规模
临床AI几乎没有容错空间。本文解析 Concurrence 如何借助 Unity Gateway 在万亿Token规模下治理医疗AI,实现访问控制、合规审计与可观测性的统一,探讨医疗AI规模化落地的治理路径。

让轮询 Agent 真正 7×24 运行:从会话内定时到外部调度
轮询 Agent 只在笔记本会话开着时才运行?本文解析如何用 cron、systemd timer、Task Scheduler 等外部调度器让 Agent 真正 7×24 运行,并通过硬性超时、错误退避与心跳告警避免静默失败。

幂等键难题:如何处理API重试中的“僵尸进程”
发送邮件不是幂等操作,API 重试时如何避免重复发送?本文剖析基于幂等键的抢占声明机制,以及进程崩溃导致“死亡持有者”这一分布式系统经典难题的权衡与解决思路。