DeepSeek V4即将发布:Flash版或超越HY3,GPT-5.6推理能力被悄悄削减

距离上一波AI新闻还不到24小时,行业又迎来一轮密集更新。从DeepSeek新一代模型即将登场,到OpenAI承认悄悄调整GPT-5.6性能,再到Anthropic延长Fable 5访问权限、字节Seedance 2.5展示惊艳视频能力,以及旧金山AI抗议潮——这个AI之夏正在加速升温。本文将逐一梳理这些值得关注的动态。
DeepSeek V4即将到来:Flash版本或超越HY3
多方泄露信息显示,DeepSeek正准备在本月发布新一代模型,可能是DeepSeek V4正式版(GA)或V4.1,甚至有传闻称Flash版本会率先亮相。据可信爆料者透露,DeepSeek V4 Flash的正式版预计最早下周就会推出,而非Pro变体。
早期报告指出,新模型在参数规模上与前代保持一致,但性能有明显提升,并首次具备原生视觉能力(native vision capabilities)。所谓原生视觉,是指模型在预训练阶段就将图像、视频等多模态数据与文本数据联合训练,而非通过后期「插件式」适配器(adapter)将视觉编码器拼接到语言模型上。
这一区别在架构层面具有根本性意义。**原生多模态预训练(Native Multimodal Pretraining)**在统一的token空间中对图像patch和文本token进行联合自回归训练,使模型在权重层面形成跨模态语义绑定,模型能够在理解图文关系、空间推理和跨模态生成上实现更深层的语义对齐。相比之下,传统「视觉适配器」方案(如LLaVA系列)依赖CLIP等预训练视觉编码器提取特征后通过投影层对齐,两套参数体系相对独立,存在语义鸿沟,往往导致模态割裂和性能瓶颈。DeepSeek此前的V2/V3系列主要聚焦纯文本与代码,此次若真正实现原生视觉,意味着其架构层面完成了从单模态到多模态的根本性跃迁,将直接与GPT-4o、Gemini 1.5等一线多模态模型正面竞争。
理解DeepSeek V4「参数规模不变、性能提升」这一说法,需要了解其底层架构逻辑。DeepSeek V3/V4系列采用混合专家(Mixture of Experts, MoE)架构:模型总参数量(如6710亿)并非在每次推理时全部激活,而是通过路由机制(router)动态选择少量「专家」子网络(每次仅激活约370亿参数)处理特定输入。这使得MoE模型可以在保持稠密模型推理成本的前提下,拥有数倍于稠密模型的总参数容量,本质上是以存储换计算。
MoE架构的兴起,植根于过去数年Transformer扩展规律(Scaling Laws)研究的一次范式转移。2020年Kaplan等人确立的经典扩展定律表明,模型性能与参数量、数据量和计算量之间存在幂律关系;2022年Hoffman等人的Chinchilla论文则重新校准了「算力最优」的参数-数据比例,指出此前许多大模型存在训练不充分的问题。MoE架构本质上是对「如何在固定算力预算下最大化模型容量」的工程回应。然而早期MoE实现(如GShard、Switch Transformer)普遍存在「专家坍塌」(expert collapse)问题——少数专家被过度激活而多数专家退化为近乎无效的子网络,这是制约MoE实用化的核心障碍之一。
值得注意的是,DeepSeek在MoE路由策略上引入了**细粒度专家分组(Fine-Grained Expert Segmentation)和无辅助损失负载均衡(Auxiliary-Loss-Free Load Balancing)**两项关键创新,直接解决了上述专家坍塌问题。传统MoE依赖辅助损失函数强制专家负载均衡,但这会与主任务损失产生梯度冲突;DeepSeek则通过动态偏置调整路由logits,在不引入额外损失项的情况下实现均衡,显著提升了训练稳定性和专家专业化程度,这也是其在有限算力下实现超预期性能的根本结构性原因。
更值得关注的是,如果Flash版本的表现真如爆料所说,它有望超越此前我们介绍过的HY3——这是腾讯混元推出的模型,也是目前3000亿参数以下类别中最强的开源模型之一。开源模型社区通常以参数规模为分水岭划分性能梯队:千亿以下的轻量级模型(如7B、13B)、千亿至3000亿的中量级模型(HY3、DeepSeek V3等),以及3000亿以上的超大规模模型(如MiniMax的2.7万亿参数级规划)。DeepSeek V4 Flash若能超越HY3,意味着在推理效率与参数利用率上实现了质的突破,对于需要在本地或有限算力下部署的企业用户而言,实用价值极高,同时将重新定义该级别的性能基准。

灰度测试初现端倪
有用户报告称,DeepSeek V4的官方GA版本目前正在进行灰度测试,仅向极少数账户开放。早期测试者反馈,新模型在编程和前端生成方面有明显的能力跃升。一个典型案例是:仅凭一句话提示词,模型就生成了一个完整的Minecraft克隆游戏,包含不同矿石类型和洞穴系统,在设计、机制和整体呈现上均表现亮眼。

当然,这只是单个案例,不宜过早下结论。其质量虽还未达到近期其他开源模型的最高水准,但考虑到这是Flash轻量版本,已属难得。此外,据此前泄露信息,DeepSeek不仅在刷新现有产品线,还同步启动了一个更庞大的前沿旗舰模型研发,目标直指MiniMax正在打造的2.7万亿参数级Pro模型。
GPT-5.6被曝悄悄"降级":推理预算遭缩减
GPT-5.6 Sol发布仅四天后,OpenAI就确认调整了该模型的推理预算(reasoning budget)——此前已有不少开发者和用户注意到模型"变弱"了。
推理预算是指链式思维(Chain-of-Thought, CoT)或「思考型」模型在生成最终答案前,被允许消耗的中间推理token数量上限。链式思维推理作为训练范式,最早由Wei等人于2022年在PaLM上系统验证:通过在提示中加入中间推理步骤示例,模型在数学推理和逻辑任务上的表现可获得显著提升。OpenAI o系列模型将这一思想推进到新的层次——通过强化学习让模型自主学习「何时以及如何在思考空间中分配更多计算资源」,形成所谓的「测试时计算扩展」(Test-Time Compute Scaling)范式。这意味着模型能力不再是固定的,而是随推理预算动态变化的函数——OpenAI本质上是在向不同用户群体销售「不同深度的计算资源」,而非单一的模型访问权限。OpenAI的o系列及Sol模型通过动态分配这一预算来平衡答案质量与推理延迟:预算越高,模型能进行越深层的自我反思和多步验证,但计算成本和响应时间也成倍增加。
这一机制背后有深层的商业工程逻辑,业界称之为「思考税」困境。从基础设施经济学角度看,每个中间推理token与输出token消耗等量的GPU算力,当模型在「Extra High」档位运行时,单次请求的实际FLOPs可能是普通生成模式的数十倍。以OpenAI o3为例,其在ARC-AGI等困难基准上的高分,部分来自数百乃至数千个中间推理步骤——每一步都消耗真实的GPU算力。值得注意的是,o系列模型通过强化学习训练模型在「思考空间」中自主分配计算资源,而非由外部硬性截断,这意味着推理预算的调整需要在模型推理层面而非仅在API层面实施,技术复杂度远超简单的输出截断。
当GPT-5.6 Sol遭遇「意外高使用量」时,OpenAI面临的本质是算力成本与用户体验的实时博弈。这与云计算领域「超售」(oversubscription)问题高度相似:服务商在高峰期悄然降低承诺性能,是SaaS行业信任危机的经典触发点。
有意思的是,Codex产品负责人Thibaut最初否认了任何削弱,声称"没有降级,只有好东西",但随后承认OpenAI一直在试验模型内部的推理强度,也就是所谓的**「juice值」(juice values)**——这是OpenAI内部对推理强度参数的俗称,本质上是一个控制思考深度的旋钮——并已回滚了这些实验。
每个推理档位都下调了一级
据用户报告,OpenAI为了让模型更快、更高效,缩减了Sol的思考预算。实际效果是每个推理级别大约被下调了一个档位——比如发布时"extra high"档能提供的推理量,现在需要用"max"档才能达到类似效果。问题在于,这意味着原本最高的max推理档位实际上已经"消失"了。
Terra和Luna两个模型似乎未受影响,因此改动仅针对Sol,变化更加明显。OpenAI表示实验已回滚,Sol并未被永久削弱,但公司仍在进一步调整推理预算,未来几周还会继续试验,以应对意外的高使用量。
这引出了一个更大的问题:厂商是否应该在模型发布后,未明确告知用户的情况下悄悄改变其推理能力? 这种做法在软件行业相当于在用户不知情的情况下偷偷降低API的性能SLA,对于已依赖特定推理深度构建工作流的开发者而言,无疑是一次「静默降级」,严重损害了用户信任基础。OpenAI此次事件的真正风险在于:它打破了开发者对「模型能力稳定性」的基本预期,动摇了企业级用户将关键工作流锚定在特定模型推理深度上的信心根基。
Anthropic再度延长Fable 5访问权限
Anthropic再次将Fable 5的访问权限延长至7月19日,覆盖所有付费计划。Cloud Code的每周速率限制维持在高出50%的水平,用户可将每周额度的一半用于Fable 5,之后可选择用积分付费或切换到其他模型。

这一举措背后的逻辑并不难理解:随着OpenAI预计在未来几周推出GPT-6,Anthropic有动力尽可能把用户留在Fable 5上。同时,业内普遍反映Sonnet和Opus系列模型目前已有所退化,大部分资源和算力被重点转向Fable 5——这可能正是Anthropic应对GPT-6发布压力的战略举措。从产品策略角度看,Anthropic此举也是典型的「存量用户护城河」操作:通过超预期的访问宽限期和速率配额,将用户的日常工作流深度绑定在Fable 5生态上,在GPT-6发布引发用户迁移窗口期之前,最大化用户粘性和使用惯性。
Seedance 2.5:180秒4K视频生成能力引关注
字节跳动的Seedance 2.5正在成为最受期待的AI视频模型之一,目前测试者已经放出了一些独家生成结果。除了画质令人印象深刻,更大的升级在于规模——据报道,Seedance 2.5可以生成长达180秒的视频,并支持4K输出,这将是对当前多数视频生成模型的巨大跨越。
理解这一突破的意义,需要了解AI视频生成领域的架构演进脉络。这一领域在过去两年经历了从GAN(生成对抗网络)到扩散模型、再到扩散变换器(DiT)的技术代际更替。早期基于GAN的视频生成(如VideoGAN、MoCoGAN)虽然推理速度快,但存在训练不稳定、模式崩塌和长程一致性差等固有缺陷。2022-2023年间,基于U-Net的视频扩散模型(如Make-A-Video、Imagen Video)将图像扩散模型扩展至时间维度,但U-Net的归纳偏置限制了其处理长序列的能力。2024年以Sora为代表的扩散变换器(Diffusion Transformer, DiT)架构彻底改变了这一格局:与早期基于U-Net的图像扩散模型不同,DiT将Transformer的序列建模能力与扩散过程的去噪框架结合,允许模型在统一的注意力机制下同时处理空间(像素/latent patch)和时间(帧序列)维度。然而DiT的核心代价是计算量随序列长度呈平方级增长,这正是长时长高分辨率视频生成的根本瓶颈所在。主流模型普遍面临「时长—质量」的根本性权衡:生成时长越长,跨帧的**时序一致性(temporal consistency)**越难保持,人物形态、光照和物理运动规律极易出现「漂移」或突变。
从具体计算量来看,设视频帧数为T、每帧空间patch数为S,则全局自注意力的计算复杂度为O((T×S)²)。以4K分辨率(约为1080p的4倍空间token量)、180秒、24fps为例——约4500帧——token总数已达数十万量级,朴素全注意力计算量远超现有单机算力极限。字节跳动在Seedance 2.5中很可能引入了时空解耦注意力(Spatiotemporal Decoupled Attention)——先在空间维度进行帧内注意力,再在时间维度进行帧间注意力,将复杂度从O(T²S²)降至O(T²S + TS²)——以及视频VAE时序压缩:通过在latent空间对时间维度进行8x-16x压缩,大幅减少DiT实际处理的时序token数量,同时保留关键运动信息。字节依托豆包大模型基础设施与ByteDance全球数据中心的分布式推理流水线,以及其在短视频领域积累的海量高质量视频训练数据形成的数据飞轮优势,才得以同时攻克空间与时间两个维度的挑战。
当然,这仍是测试阶段的素材。但如果字节跳动能在长达3分钟的连续生成中保持这种一致性,Seedance 2.5有望成为市场上最强的AI视频生成模型,也预示着AI视频生成正从「短片段演示」迈向「可用于实际内容生产」的临界点。
旧金山AI抗议潮:能否真正叫停AI发展?
数百名抗议者聚集在OpenAI、Anthropic和Google DeepMind的旧金山办公室外,要求暂停AI开发。同时,预测市场Polymarket给出的数据显示,AI安全法案在年底前获得通过的概率约为16%。

试图完全叫停AI发展并不现实,其背后有深层的结构性逻辑。理解这一困境,需要了解当前国际AI治理的实际框架及其内在局限。欧盟《AI法案》(EU AI Act)于2024年正式生效,采用风险分级监管框架,将AI系统分为不可接受风险(禁止)、高风险(严格合规)、有限风险和最低风险四类,并对GPAI(通用人工智能)模型设立专门条款,要求训练量超过10^25 FLOPs的前沿模型履行系统性风险评估义务。值得注意的是,该法案从提案到正式生效历时三年,其中对GPAI模型的定义和规制条款,在起草过程中多次因GPT-4、Gemini等新模型的出现而不得不重新修订——这本身就揭示了监管框架设计周期(通常为数年)与AI能力演进速度(以月计)之间的结构性错配。美国则以行政令和自愿性承诺为主,英国布莱切利峰会建立了多国对话机制,但均缺乏强制执行力。
三条监管路径的共同困境是**「可核查性缺失」**:核军控条约的有效性建立在卫星侦察、现场核查等物理可核查机制上,而AI模型能力的真实评估远比核弹头计数复杂——同一套权重在不同推理配置下可呈现截然不同的能力边界,「训练算力阈值」(如10^25 FLOPs)作为监管触发条件存在明显的可规避性。更根本的挑战在于,AI系统的「危险性」难以通过静态指标衡量:同一个模型在不同部署场景、不同推理配置和不同用户群体下,可能呈现截然不同的风险特征。部分学者因此提出「敏捷治理」(Agile Governance)框架,主张监管机构建立持续的技术能力评估机制;另一些人则倡导借鉴金融监管的「监管沙盒」(Regulatory Sandbox)模式,允许新技术在受控环境中试运行。
AI监管的核心困境在于「单边约束的无效性」:若某一国家或企业单方面减速,竞争方将在博弈中获得战略优势,形成典型的囚徒困境——这与冷战时期核军备控制的逻辑高度相似,有效的军控条约需要多边参与和可核查机制,而非单方面弃权。Polymarket数据显示美国国内AI安全立法通过率仅16%,折射出科技产业游说力量与安全倡导团体的深层博弈,以及立法进程远落后于技术演进速度的结构性矛盾。
真正的讨论焦点应该是建立合理的安全防护和监管框架,而非期待技术能够「暂停」。抗议者的诉求在情感上可以理解,但在没有全球协调机制的前提下,单点施压的政策效果极为有限。AI正迅速演变为一场地缘政治竞赛,而历史表明,这类竞赛不会因为抗议而停止。
结语
从DeepSeek V4的即将登场、GPT-5.6推理能力的悄然调整,到Seedance 2.5视频生成能力的持续飞跃,这一轮密集更新再次印证了AI领域竞争的白热化。无论是模型透明度争议,还是安全与监管的博弈,都值得每一位从业者和用户持续关注。可以肯定的是,这个AI之夏,才刚刚开始升温。
核心要点
- DeepSeek V4 Flash:MoE架构+原生视觉能力,原生多模态预训练与视觉适配器方案存在根本架构差异,无辅助损失负载均衡解决了业界长期存在的专家坍塌问题,新模型有望超越HY3成为同级最强开源模型。
- GPT-5.6 Sol推理预算调整:每个推理档位实际下调一级,揭示「测试时计算扩展」范式下算力成本与用户体验的深层矛盾,「静默降级」损害开发者信任,动摇企业级用户对模型能力稳定性的基本预期。
- Anthropic延长Fable 5访问:典型的存量用户护城河策略,在GPT-6发布前最大化用户粘性。
- Seedance 2.5:180秒4K视频生成若属实,将是DiT架构在时空注意力复杂度上的重大工程突破,依托时空解耦注意力与视频VAE时序压缩等技术,标志AI视频从演示迈向实际内容生产。
- 旧金山AI抗议:监管框架设计周期与技术演进速度的结构性错配,加之可核查性缺失与囚徒困境,使单边减速面临根本性挑战,有效治理需多边协调机制而非单点施压。
相关推荐

开源权重模型之争:安全与开放如何平衡
深入分析开源权重模型的核心争论:模型权重公开发布带来透明度与创新,但也引发安全滥用风险。本文探讨分级发布、红队测试等折中方案,解读开源AI背后的行业博弈与治理挑战。

抱怨如何侵蚀你的心智:注意力自我强化效应解析
习惯性抱怨正在训练大脑发现更多负面信息,形成恶性循环。本文从注意力自我强化机制出发,解析抱怨的心理侵蚀过程,并提供主动管理注意力、跳出负面循环的实用方法。

Steam恶意软件溯源:比特币、Cookie和外卖订单如何锁定攻击者
一起Steam恶意软件案件中,调查人员通过比特币交易链、Google Cookie和Uber Eats外卖订单三条线索交叉验证,成功溯源攻击者真实身份。深入解析数字取证技术与匿名幻觉。