DeepSeek V4灰度测试开启,Grok 5.0蓄势待发|AI大模型最新动态

大模型混战:DeepSeek V4、Grok 5.0、Intern-S2齐发力
本期AI日报汇集模型迭代、基础设施、芯片、机器人及科技公司五大板块的重磅动态。从国内外顶级实验室的新版本发布,到万亿参数训练集群的落成,AI竞赛正以前所未有的密度持续推进。
DeepSeek V4正式版疑似开启灰度测试
据用户对比反馈,DeepSeek V4正式版疑似已开始灰度测试。与此前版本相比,新版本思维链更加结构化、清晰,深度思考能力显著提升,推理质量有明显改善。作为国产大模型的标杆之一,DeepSeek每一次迭代都备受业界关注,本次V4正式发布预计已近在眼前。
思维链(Chain-of-Thought, CoT)是由谷歌研究人员于2022年正式提出的推理范式,核心思想是让模型在给出最终答案之前,显式地输出中间推理步骤。这一机制模拟了人类解题时的"草稿纸"逻辑,能够显著提升模型在数学、逻辑推理和多步骤问题上的准确率。CoT的质量直接决定模型能否在复杂任务中"不走弯路"——结构化、清晰的思维链意味着模型能够将大问题分解为可验证的子步骤,从而降低累积误差。近年来,思维链进一步演化出"自我一致性"(Self-Consistency)、"思维树"(Tree of Thoughts)等变体,推理能力的竞争已成为大模型迭代的核心战场之一。思维链质量的提升,往往意味着模型在复杂推理任务上的可靠性增强,对代码生成、数学推理等高价值场景意义重大。
马斯克预告Grok 4.6与5.0下周开测
马斯克透露,下一代Grok模型4.6和5.0将于下周进入全面测试阶段。在Grok 4.5版本取得显著成绩后,更大规模的2万亿参数模型被寄予厚望,目标是在性能上超越Kimi K3,同时兼顾更快的推理速度与更低的运行成本。
值得注意的是,2万亿参数规模并不意味着每次推理都激活全部参数。现代超大规模模型普遍采用混合专家(Mixture of Experts, MoE)架构——模型被拆分为大量"专家"子网络,每次推理仅激活其中少数几个(通常为总参数量的10%-20%)。这一设计使得模型在保持超大规模知识容量的同时,推理时的实际计算量(FLOPs)可控。GPT-4、DeepSeek V3等主流旗舰模型均采用此架构。因此,理解"参数规模"需区分总参数与激活参数两个维度:前者代表模型知识上限,决定其能够编码的世界知识广度;后者决定每次推理的实际算力消耗,直接影响运行成本与响应延迟。参数规模的持续扩张折射出xAI的激进技术路线——以极致算力堆叠换取能力上限的突破。这一策略能否在成本与效率之间取得平衡,将是Grok 5.0面世后的最大看点。
上海AI实验室Intern-S2开源模型击败Claude Opus 4.8
上海人工智能实验室发布Intern-S2 Preview 397B开源模型,采用Apache 2.0协议开放全部权重。在多项基准测试中,该模型超越了Qwen 3.6和Claude Opus 4.8,在科学推理和编程能力上表现尤为突出。
Apache 2.0协议是开源软件领域最为宽松的许可证之一,允许任何个人或商业机构免费使用、修改、分发,甚至将其集成进商业产品,无需开放衍生代码。这与Meta的LLaMA系列早期版本所采用的"研究用途限制"许可证形成鲜明对比。Apache 2.0授权意味着企业可以直接基于Intern-S2进行商业化部署,无需支付授权费用,极大降低了国内外中小企业使用顶级开源模型的门槛。在开源大模型生态中,许可证策略本身即是竞争工具——更宽松的协议往往能吸引更多开发者贡献社区生态,形成正向飞轮效应:社区贡献反哺模型能力提升,进而吸引更多使用者与贡献者入场。国产开源模型能在关键基准上正面挑战顶级闭源旗舰,标志着开源阵营与商业闭源模型之间的差距正在快速收窄,专业领域推理能力已具备直接竞争力。
智能体元年:从豆包到阶跃,AI原生交互重构
豆包转向AI原生交互
据晚点报道,新一代豆包手机已备货数十万台,并调整了与阿里、腾讯等超级应用的合作方式。新策略不再依赖读取屏幕、模拟点击,而是转向AI原生交互,减少对第三方应用的直接操控。
这一转变具有深刻的技术内涵。传统方式本质上是RPA(机器人流程自动化)范式——通过截图识别UI元素、模拟鼠标键盘操作来控制应用,极易因界面变动而失效,且存在明显的权限安全隐患。RPA的本质局限在于它是"形式模仿"而非"语义理解",每一次应用界面的细微调整都可能导致自动化流程崩溃。而AI原生交互则要求应用层开放标准化的Agent接口(如App Actions、Intent协议等),允许AI智能体通过语义指令直接调用应用功能,类似于人与人之间通过语言协作,而非机器人模仿人的手部动作。这一转变对操作系统和应用生态的改造程度更深,但也能带来更稳定、更安全、延迟更低的协作效果。这意味着智能体正从"模拟人操作"走向更深层的原生协同模式,也对应用开发者提出了开放接口标准化的新要求。
阶跃与阿里云布局智能体生态
阶跃星辰在世界人工智能大会上发布了智能体手机Step Neo、Step iOS操作系统及个人智能体M。该系统重构了记忆、执行与安全能力,记忆召回最快仅需15毫秒,并与支付宝达成AI Agent战略合作。15毫秒的记忆召回速度意味着智能体可以在用户几乎无感知的延迟内,从海量历史交互中检索相关上下文,这对于实现"真正了解用户"的个性化智能体体验至关重要。
阿里云则在WAIC 2026发布Agent Native Cloud(智能体原生云),同步推出Agent Teams和Agentic Computer等企业级工具,覆盖基础设施、开发平台和云桌面多个维度,为企业构建端到端Agent应用提供完整解决方案。
搜索智能体与安全新标杆
美团LongCat推出Lohosearch搜索智能体基准,基于762万实体维基百科知识图谱自动生成问题。知识图谱(Knowledge Graph)以结构化三元组(实体-关系-实体)的形式存储世界知识,能够精确定义"正确答案"的边界,避免开放式问答评估中答案模糊的问题。将知识图谱与自动问题生成结合,可以构造出需要跨实体、跨关系进行多跳推理的复杂问题——例如"某位科学家的导师所在机构位于哪个国家"这类需要连续两步以上检索推理的查询,这类问题恰恰是当前RAG(检索增强生成)系统的软肋,因为RAG往往在单次检索层面表现良好,但在需要将多个检索结果进行逻辑串联时容易产生幻觉或推理断层。在11个前沿模型测试中,最佳得分仅34.74%,远低于人类约90%的表现水平,直接暴露了当前智能体在复杂检索任务上的短板。该基准包含544道问题,覆盖11个领域并已完全开源。
此外,GPT-5.6 SO在网络靶场中树立了安全新标杆,通过Codex Security集成可直接在编程流程中调用安全检测,帮助团队在真实代码中发现、验证并修复漏洞。

监管与商业化并行推进
特朗普旗下TMPG宣布计划推出Truth Social付费API,以毫秒级速度投递特朗普推文,瞄准华尔街金融交易需求,将总统社交媒体动态转化为商业化数据产品。话说回来,旧金山市检察官办公室向苹果和谷歌发出法律通知,要求下架13款用于制作深度伪造裸体图像的AI应用,谷歌已删除其中5款,标志着地方政府对AI生成内容的监管力度持续升级。
算力军备竞赛:万亿参数集群与太空算力
xAI建成Colossus 2000MW级训练集群
xAI已建成Colossus 2000MW级训练集群,正在训练Block5的多个变体,涵盖6万亿和12万亿参数版本,规模远超业内竞争对手。xAI表示,当其他实验室仍在争抢GPU、等待电力协议落地时,自己已在训练下一代超大规模模型。
2000MW的功率规模相当于一座中型核电站的全部输出功率,折射出AI基础设施建设正面临的结构性能源瓶颈。训练一个千亿参数级模型一次性耗电已达数十万至数百万度,而推理服务的持续功耗同样惊人。根据国际能源署(IEA)预测,全球数据中心电力消耗将在2026年前后突破1000太瓦时,其中AI负载是增速最快的部分。正因如此,AI公司正在将"电力采购能力"纳入核心竞争力——签订长期电力购买协议(PPA)、自建发电设施乃至布局核能小堆(SMR)已成为行业新趋势。微软与Constellation Energy合作重启三里岛核电站、谷歌投资小型核反应堆企业Kairos Power,均是这一趋势的直接体现。电力资源,正成为AI竞赛中比芯片更为稀缺的核心要素。

太空算力星座工程
上海在WAIC 2026发布太空算力星座工程,首发星座正式对外公布,商业运营阶段将完成千星部署,构建天基AI算力基础设施。将算力延伸至太空,为破解地面能耗与散热瓶颈提供了一条全新技术路径——太空环境的天然散热条件(接近绝对零度的宇宙背景温度)与充沛的太阳能资源,从根本上规避了地面数据中心在能耗和冷却方面的核心制约。太空算力的核心挑战在于星间通信延迟与计算任务调度的协同优化,以及如何在严苛的宇宙辐射环境下保证芯片的长期可靠运行。
芯片领域新动态
英伟达已向至少一家AIB合作伙伴交付GeForce RTX 50 Super系列样品,但因GDDR7显存成本过高,要求暂缓发售。GDDR7是三星、SK海力士等厂商于2023-2024年间量产的新一代图形显存标准,相比GDDR6X带宽提升约60%、能效比大幅改善,是支撑消费级AI推理本地化的关键硬件。然而,GDDR7的产能爬坡与HBM(高带宽内存)产能竞争直接冲突——HBM优先供应给数据中心级A100/H100/B200等企业级GPU,消费级显存的产能分配处于次要地位。这一现象揭示了AI算力产业链的深层矛盾:企业级AI基础设施建设的爆发式需求,正在通过供应链挤压效应,推迟消费级AI硬件的普及进程,使个人本地化AI应用的门槛居高不下。东方算芯在WAIC 2026首次展出全球首颗软件定义存内计算3D AI芯片DF1000,算力达520T,采用全新架构突破传统"存储墙"瓶颈——存内计算(Processing-In-Memory, PIM)将计算单元直接集成于存储器内部,大幅减少数据在存储与计算单元之间的反复搬运,从根本上降低内存带宽瓶颈对AI推理性能的制约。
机器人赛道:长时程操作与商用落地提速
英伟达RoboTTT突破长时程操作瓶颈
英伟达推出RoboTTT技术,将机器人视觉运动上下文从单步扩展至8000步、持续约30分钟的连续操作。现有模型普遍只能处理单步或极少步骤的长时程任务,容易出错。长时程操作的核心难点在于误差的累积效应——机器人每一步动作的微小偏差都可能在后续步骤中被放大,最终导致任务失败。RoboTTT通过扩展视觉运动上下文窗口,使模型能够"回顾"更长时间跨度的历史操作状态,从而在出现偏差时进行自我纠正。这一突破为机器人完成复杂多步骤任务(如组装、烹饪、手术辅助等)奠定了关键基础。

人形机器人走入日常应用场景
北京Dexmo推出轮式人形机器人APEX,正在真实场景中训练折叠衣物、商品上架和协助支付等日常任务,定位亲民及商业化应用,标志着人形机器人加速融入日常生活。Serve Robotics已在基辅附近与乌克兰地面部队开展机器人补给实际运营,成为自主餐食生产系统首次在活跃冲突区域部署的案例,这也是自主移动机器人系统在极端非结构化环境中可靠性的一次重要实战检验。
世界模型与全栈具身智能方案
小米机器人发布幽灵模型38B自回归世界基础模型,统一支持文本到图像、多视角场景生成、姿态迁移和视频生成,性能超越GPT Image 2.0,强化机器人场景理解与决策能力。自回归世界模型的核心价值在于让机器人建立对物理世界的因果预测能力——通过预测"执行某动作后世界状态将如何变化",机器人可以在真实操作前进行内部仿真推演,从而选择更优的行动策略。
腾讯在WAIC 2026升级发布具身智能全栈方案,贯穿云底座、模型层、平台层与应用层。所谓"全栈",是指从底层算力供给(云底座)、感知与决策模型(如视觉语言动作模型VLA)、开发者工具平台,到面向终端场景的应用集成,形成垂直贯通的完整技术链条。视觉语言动作模型(VLA)是当前具身智能的核心架构范式,它将计算机视觉、自然语言理解与机器人动作规划统一在同一模型框架内,使机器人能够理解自然语言指令、感知视觉环境,并输出具体的关节控制动作序列。这一模式的商业逻辑在于:机器人硬件本体供应商专注于机械结构与执行器优化,而云平台企业则通过提供"大脑即服务"(Brain-as-a-Service)切入机器人智能化升级赛道,以平台化方式聚合碎片化的机器人应用需求,构建可持续的生态护城河。ADP 4.0海外版同步上线,加速具身智能技术的全球化布局。

科技公司动向与大模型排行榜
据彭博报道,特朗普政府正考虑设立由行业参与的独立AI监管机构,对顶级AI模型开展安全审查,以回应硅谷对AI发布限制缺乏一致性和透明度的长期诉求。这一监管思路与欧盟《AI法案》的"外部强制合规"模式有所不同,更倾向于吸纳行业自律机制,反映了美国在维持技术竞争优势与强化安全监管之间寻求平衡的政策取向。据《纽约时报》报道,Meta正洽谈将其数据中心算力租借给Anthropic,潜在交易规模约100亿美元、期限两年,折射出AI产业对计算资源的巨大渴求。这笔交易若达成,将是AI行业迄今规模最大的算力租赁协议之一,也意味着即便是拥有强大算力储备的科技巨头,也开始将闲置算力资产化,形成"算力即服务"的新型商业模式。此外,据The Information报道,全球最大AI大模型API聚合平台OpenRouter已收到多家科技巨头收购意向,估值或高于13亿美元。
在模型排行榜方面,Artificial Analysis智力榜中Claude居首,GPT-5.6 SO和Kimi K3紧随其后;编程和智能体榜上GPT-5.6 SO均位居首位,Kimi K3两榜均跻身前四。国产模型在多个核心榜单进入第一梯队,大模型竞争格局愈发激烈。值得关注的是,Kimi K3由月之暗面开发,是国内首批在国际权威评测中持续稳居全球前五的旗舰模型之一,其在智能体和编程榜单的强劲表现,印证了国产大模型在代码生成和多步骤任务执行能力上的快速追赶态势。
核心要点
核心要点
相关推荐

开源权重模型之争:安全与开放如何平衡
深入分析开源权重模型的核心争论:模型权重公开发布带来透明度与创新,但也引发安全滥用风险。本文探讨分级发布、红队测试等折中方案,解读开源AI背后的行业博弈与治理挑战。

抱怨如何侵蚀你的心智:注意力自我强化效应解析
习惯性抱怨正在训练大脑发现更多负面信息,形成恶性循环。本文从注意力自我强化机制出发,解析抱怨的心理侵蚀过程,并提供主动管理注意力、跳出负面循环的实用方法。

Steam恶意软件溯源:比特币、Cookie和外卖订单如何锁定攻击者
一起Steam恶意软件案件中,调查人员通过比特币交易链、Google Cookie和Uber Eats外卖订单三条线索交叉验证,成功溯源攻击者真实身份。深入解析数字取证技术与匿名幻觉。