DeepSeek V4即将发布 GPT-5.6被证实悄然削弱推理能力

在AI技术迭代进入以"天"为单位的当下,短短24小时内,业界再度迎来密集更新。从DeepSeek下一代旗舰模型的临近发布,到OpenAI承认悄然压缩模型推理预算,再到Anthropic的防御性策略布局与字节跳动视频模型的惊艳突破,本文逐一梳理这些值得关注的动向及其背后的行业逻辑。
DeepSeek V4 Flash:性能跃升,原生支持视觉
据可靠消息人士透露,DeepSeek正筹备推出Version 4乃至4.1版本,最快可能本月内落地。除即将发布的产品线更新外,DeepSeek还在同步研发一个规模更大的前沿模型(Frontier Model),意在角逐万亿参数量级的竞争舞台。

最新线索指向一个名为 DeepSeek V4 Flash GA 的正式版本(非Pro版),据称最快下周推出。该版本参数规模可能保持不变,但性能明显提升,并原生支持视觉能力。
值得注意的是,DeepSeek此前发布的V3和R1系列模型均采用混合专家(Mixture of Experts,MoE)架构。MoE的核心原理是将大型神经网络拆分为多个"专家子网络",每次推理时仅激活其中一小部分(通常为2-8个专家),而非像传统Dense模型那样激活全部参数。这一架构路线并非DeepSeek独创——Google早在2017年便通过"Sparsely-Gated Mixture of Experts"论文奠定了现代MoE的基础,Mistral AI的Mixtral 8x7B于2023年底将其带入主流开源视野。
MoE的核心工程挑战在于"负载均衡":如何确保各专家网络被均匀调用,避免少数专家过载而其他专家闲置。这一问题在早期MoE实现中长期困扰研究者——若路由机制(Router)存在偏向性,部分专家会被反复调用而过拟合,另一部分则近乎"休眠",导致模型实际可用容量远低于理论上限。DeepSeek通过引入辅助损失函数(Auxiliary Loss)——在训练目标中额外增加一项惩罚项,对专家调用频率的不均衡程度施加梯度压力——以及专家亲和力评分(Expert Affinity Scoring)——通过动态调整每个Token被分配至各专家的概率分布,使路由决策更具全局均衡性——系统性地解决了这一难题。其结果是:模型虽然总参数量高达数千亿,但单次推理实际使用的参数量远低于此,从而大幅降低计算成本和延迟,在保持较低推理成本的同时实现了接近千亿参数的等效表现。DeepSeek V3正是凭借这一架构优势,以远低于GPT-4o的运营成本实现了接近的性能水准,引发全球关注。
所谓"原生支持视觉能力",意味着视觉编码器(Vision Encoder)将被直接集成进主干网络,而非依赖外挂的多模态适配层。这一路线与GPT-4V、Claude 3的视觉接入方式相似,但对开源社区意义更为深远——一旦开放权重,开发者可直接在本地部署具备图文理解能力的完整模型,无需额外的API调用开销。这意味着DeepSeek正式补齐多模态短板,对整个开源生态不能忽视。
消息还称,作为轻量变体,V4 Flash甚至可能在性能上超越近期表现亮眼的开源模型HY3,为300亿参数以下量级树立新标杆。目前已有用户发现V4官方GA版本正在小范围灰度测试,早期反馈显示其在代码生成和前端开发任务上提升明显。
一句提示词生成完整Minecraft克隆
最直观的演示案例是:仅凭一条提示词,V4 Flash便生成了包含矿石系统与洞穴结构的完整Minecraft克隆游戏,机制设计和整体呈现一次成型。

不过需要客观看待——正如原始视频所强调的,这次的质量"并不比近期其他优秀开源模型更惊艳"。但考虑到这只是Flash轻量级变体,表现已相当可观。在官方正式确认前,上述消息仍需持保留态度。
GPT-5.6-Soul推理能力被证实暗中调低
这或许是近期最具争议的行业事件。GPT-5.6-Soul发布仅4天后,大批开发者和用户便察觉到体验明显下滑。起初OpenAI予以否认,Codex产品负责人Tibo甚至公开表态"模型没有被削弱",但随后承认公司确实在试验Soul的内部推理力度(即所谓"Juice"值)。
要理解这一事件的技术背景,需要先了解**推理预算(Reasoning Budget)**机制。推理预算是大型推理模型中用于控制"思考深度"的核心超参数,本质上是限制模型在输出最终答案前允许生成的内部推理Token数量上限。
这一机制有其深厚的理论根基。2022年谷歌发布的"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models"论文首次系统证明:让模型在给出答案前"展示推理过程"能显著提升复杂任务的准确率,且这种提升随模型规模增大而加速。DeepMind的AlphaCode和OpenAI的早期内部研究随后发现,允许模型进行更长时间的自我反思(Self-Reflection)可显著提升复杂任务的解题成功率,这一发现后来被系统化为**"测试时计算扩展"(Test-Time Compute Scaling)**理论:与训练时扩展参数量类似,在推理阶段投入更多计算资源同样能带来性能增益,且这种增益在数学、编程、逻辑推断等结构化任务上尤为显著。2024年OpenAI发布的o1技术报告中,明确展示了推理Token数量与AIME数学竞赛得分之间近乎线性的正相关关系,为这一理论提供了有力的实证支撑。
但"更多推理"意味着更多Token生成,而Token是大模型计算成本的基本计量单位,在GPU算力稀缺的背景下,这直接转化为巨大的运营成本压力。值得注意的是,测试时计算扩展的边际收益并非线性,存在明显的收益递减区间——即超过某一阈值后,继续增加推理Token带来的性能提升趋于平缓,这也是厂商在成本与质量之间进行精细化调控的技术依据。以OpenAI的o系列和Soul模型为例,系统通常设置Low、Medium、High、Extra High、Max等多个档位,档位越高,模型允许进行更长的链式推理,理论上能解决更复杂的问题,但同时也消耗更多算力、增加响应延迟并提升成本。
OpenAI因此引入了分档控制机制,让用户或系统在速度与质量之间主动权衡。真相是:OpenAI为提升响应效率,主动下调了Soul的思考预算,导致每个推理档位实际上被整体下移一级——原本Extra High档能实现的能力,现在需要Max档才能勉强达到,而原有的Max顶级能力则基本不复存在。此次Soul事件暴露的问题在于,OpenAI在不改变对外API参数命名的前提下,悄然修改了这套隐性映射关系,导致用户在相同设置下获得的推理质量系统性下降,实质上构成了一种"功能缩水"行为。说个细节,同系列的Terra、Luxio和Luna并未受到影响,说明此次调整具有明确的针对性。
目前OpenAI表示实验已回滚,并称Soul并未被永久削弱,未来几周仍会持续调整推理预算,不排除恢复至此前水平。但这件事引出了一个更深层的行业拷问:厂商能否在不明确告知用户的情况下,悄然改变已上线模型的推理能力? 这直接关乎用户信任与产品透明度,值得持续关注。
Anthropic重开Fable 5:应对竞争的留存策略
Anthropic再次向所有付费用户开放Fable 5的访问权限,该政策将持续至7月19日,为用户额外争取一周测试时间。话说回来,Claude Code的每周额度上限维持高出50%的水平,用户可将其中一半额度用于Fable 5。

从竞争格局来看,此举很可能是一次防御性布局。OpenAI预计在未来几周推出GPT-6,Anthropic此时重开Fable 5,意在尽量延长用户在现有旗舰模型上的停留时间,避免在竞争对手发布重磅产品前被动失守。
值得关注的是,业界普遍反映Sonnet和Opus系列近期已出现性能降级迹象,根本原因很可能是大量算力资源被集中倾斜至Fable 5的维护与运营。这也从侧面印证了Anthropic在算力分配上的战略取舍——在资源有限的条件下,维持旗舰模型的竞争力与保障全线产品的稳定性之间,本质上是一道零和博弈。
理解这一取舍的背景,需要了解AI基础设施的成本结构:顶级推理模型的单日服务成本可达数百万美元级别,而旗舰模型与次级模型共享同一GPU集群时,流量调度策略直接决定了用户所能感知的响应质量。Anthropic作为一家尚未盈利的AI安全导向公司,其算力采购高度依赖亚马逊AWS的战略投资协议——亚马逊已累计向Anthropic承诺投资超过40亿美元,但这一协议同时要求Anthropic优先使用AWS的Trainium和Inferentia芯片,而非英伟达GPU,这在工程适配层面引入了额外的复杂性,使得其在算力扩张速度上受到外部约束,进一步加剧了内部资源竞争的烈度。此次重开Fable 5的决策,本质上是一次"以时间换空间"的防御操作:用旗舰模型的短期开放吸引力,为下一代模型的正式发布争取窗口期。
字节跳动C-Dance 2.5:3分钟4K视频生成
视频生成领域同样传来重磅消息。字节跳动的 C-Dance 2.5 有望成为近期最强AI视频模型之一。目前流出的Beta测试素材画质相当惊艳。

真正令人瞩目的是能力规模:据称C-Dance 2.5最长可生成 180秒(3分钟)视频,并支持 4K分辨率输出。要理解这一突破的技术含量,需要了解当前视频生成领域的核心架构演进与瓶颈。
AI视频生成领域经历了从GAN(生成对抗网络)到扩散模型(Diffusion Model)再到扩散变换器(DiT)的三代架构跃迁。第一代GAN方案(如早期的VGAN和MoCoGAN)通过生成器与判别器的对抗训练生成视频,但存在训练不稳定、多样性不足的固有缺陷;第二代以U-Net为骨干的扩散模型(如Runway Gen-1和Stability AI的SVD)在图像质量上取得飞跃,但U-Net的卷积结构对全局语义建模能力有限;2024年初OpenAI公开展示Sora后,以Peebles & Xie 2022年论文为基础的DiT(Diffusion Transformer)架构被推向行业标准地位——这一架构将U-Net骨干替换为Transformer,通过全局自注意力机制大幅提升长程依赖建模能力,但也继承了Transformer的固有弱点:自注意力机制的计算复杂度为O(n²),序列长度翻倍则计算量翻四倍。
将DiT扩展至长视频生成时,这一问题被急剧放大:随着视频时长增加,模型需要在更长的时间维度上保持主体外观、光照和物理逻辑的连贯性(即时序一致性,Temporal Consistency),而一段3分钟的24fps视频包含约4320帧,每帧又有数百万像素需要建模;4K分辨率(3840×2160)意味着每帧像素数是1080p的四倍,进一步放大了计算压力。业界目前普遍采用的缓解策略包括:将视频切分为重叠片段分别生成再拼接的分块注意力(Chunked Attention)、根据运动幅度动态调整不同区域建模精度的动态分辨率推理,以及通过时序压缩(Temporal Compression)将相邻帧在潜空间(Latent Space)中合并表示的帧压缩技术。
字节跳动在这一领域并非零基础入局。其图像生成产品即梦(Dreamina)的底层扩散模型技术与视频生成团队存在深度共享,加之字节在大规模分布式训练基础设施(豆包大模型集群)上的长期投入,为C-Dance 2.5的工程实现提供了坚实的算力底座。C-Dance 2.5若能实现3分钟4K视频的稳定生成,意味着字节跳动在上述工程优化方向上取得了实质性突破。这些内容仍属Beta阶段,但若字节跳动能在三分钟长视频中保持稳定的画面一致性,C-Dance 2.5极有可能成为AI视频生成领域的新基准。
值得补充的是,3分钟4K视频生成能力一旦落地,其商业应用场景将远超技术演示范畴。短视频平台(抖音/TikTok)的内容生产成本有望被压缩至现有水平的数十分之一,广告主可实现"文字稿到成片"的全流程自动化,而影视行业的预可视化(Previz)和概念版(Animatic)制作流程也将被根本性重塑。字节跳动作为全球最大短视频平台的母公司,若能将C-Dance 2.5直接整合进抖音/TikTok的创作者工具链,将形成技术能力与分发渠道的双重闭环,这一战略意义远超纯粹的模型性能指标。
AI抗议潮背后:监管还是暂停?
最后一条颇具社会意义的动态:数百名抗议者聚集在旧金山的OpenAI、Anthropic和Google DeepMind办公室外,要求暂停AI研发。预测市场Polymarket给出的"年内通过AI安全立法"概率约为16%。
当前全球AI监管格局呈现明显的分化态势,且这种分歧不仅体现在立法层面,更深层的裂痕在于"监管哲学"的根本差异。理解这一格局,不妨从互联网监管史中寻找参照系——1996年美国《通信规范法》第230条赋予平台免责保护的立法逻辑,与今天部分国家对AI厂商采取的"宽松准入"政策如出一辙;而欧盟GDPR对数据处理的严格规制,则预示了其AI法案的监管哲学取向。
当前三条主要监管路线的逻辑各有其历史脉络:**欧盟《AI法案》(EU AI Act)**已于2024年正式生效,代表了基于"预防原则(Precautionary Principle)"的强规制路线,将AI系统按风险等级分为不可接受风险、高风险、有限风险和最低风险四类,要求高风险场景(如医疗诊断、关键基础设施管控)在部署前完成强制合规认证,这一框架与欧洲长期以来对技术监管秉持的"举证责任倒置"哲学一脉相承;美国以拜登政府2023年《AI安全行政令》和各大厂商自愿签署的"安全承诺"为主要手段,优先保护创新空间,特朗普政府上台后更明确撤销了多项监管措施,整体回归宽松路线;中国通过《生成式人工智能服务管理暂行办法》等行政法规推进监管落地,将"意识形态安全"纳入考量,要求内容符合社会主义核心价值观,具有鲜明的本土化特色。
AI监管的复杂性还在于其"双用途技术"(Dual-Use Technology)属性——同一套能力既可用于医疗诊断,也可用于自动化武器系统,这使得传统的"用途分类监管"框架面临根本性挑战。英国人工智能安全研究所(AISI)和美国NIST AI风险管理框架代表了一种务实的中间路线:通过标准化评估方法论而非直接立法来建立行业护栏,其核心逻辑是:在技术演进速度远超立法速度的当下,建立可动态更新的评估标准库比制定静态法规更具现实可操作性。
值得注意的是,即便在同一国家内部,政府各部门对AI监管力度的立场也大相径庭——美国国防部和情报机构积极推动AI军事化应用,而商务部和FTC则更关注竞争层面的垄断问题。这种内部张力使得系统性立法在短期内极难推进,也在一定程度上解释了Polymarket仅给出16%概率的判断依据。
从行业现实来看,全面叫停AI研发并不可行。抗议者所呼吁的"暂停"在现实操作层面极难实现,核心原因在于AI能力已与国家战略竞争深度绑定——美国国防部、情报机构与前沿AI实验室的合作日益密切,中美双方均将AI视为下一个十年的核心战略资产。即便某家公司或某个国家主动放缓,其他参与者仍会持续推进。更具建设性的方向,是推动建立合理的安全防护机制与监管框架——类似核不扩散条约逻辑的国际协议,以及强制性安全评估标准,而非寄望于技术发展能被外部压力按下暂停键。AI竞赛正在快速演变为一场地缘政治博弈,接下来的竞争只会更加激烈。
核心要点
- DeepSeek V4 Flash 即将发布,原生支持视觉理解,基于MoE架构的轻量设计有望在300亿参数量级重新定义开源基准;其负载均衡技术(辅助损失函数+专家亲和力评分)是实现低成本高性能的核心工程突破
- OpenAI Soul事件揭示了推理预算的隐性下调问题,折射出测试时计算扩展在商业化落地中的成本与透明度双重张力,引发业界对厂商产品诚信的深层追问;测试时计算扩展的边际收益递减特性为厂商的精细化调控提供了技术依据,但也为"静默降级"行为留下了灰色空间
- Anthropic重开Fable 5是一次典型的防御性留存策略,折射出头部玩家在GPT-6发布前的竞争焦虑;其背后的算力资源零和博弈与AWS战略投资协议的约束条件,深刻揭示了AI公司在扩张速度与服务稳定性之间的深层矛盾
- 字节跳动C-Dance 2.5在DiT架构的时序建模和高分辨率推理上实现突破,分块注意力与动态分辨率推理等工程优化是3分钟4K视频生成能力的技术支撑,与抖音/TikTok生态的战略协同赋予其超越技术层面的商业意义
- AI监管分歧短期内难以弥合,欧盟预防原则路线、美国宽松创新路线与中国行政监管路线的三元分化格局,叠加双用途技术属性与国家战略竞争的深度绑定,使得单边暂停几乎不可行;NIST风险管理框架式的标准化评估路径比单边立法更具现实可操作性
相关推荐

开源权重模型之争:安全与开放如何平衡
深入分析开源权重模型的核心争论:模型权重公开发布带来透明度与创新,但也引发安全滥用风险。本文探讨分级发布、红队测试等折中方案,解读开源AI背后的行业博弈与治理挑战。

抱怨如何侵蚀你的心智:注意力自我强化效应解析
习惯性抱怨正在训练大脑发现更多负面信息,形成恶性循环。本文从注意力自我强化机制出发,解析抱怨的心理侵蚀过程,并提供主动管理注意力、跳出负面循环的实用方法。

Steam恶意软件溯源:比特币、Cookie和外卖订单如何锁定攻击者
一起Steam恶意软件案件中,调查人员通过比特币交易链、Google Cookie和Uber Eats外卖订单三条线索交叉验证,成功溯源攻击者真实身份。深入解析数字取证技术与匿名幻觉。