国产大模型三线齐发:Qwen、DeepSeek V4、GLM下一代即将登场

中国AI实验室集体加速
AI热潮不仅没有降温,反而在中国的AI实验室这一侧再度升温。近期,阿里巴巴、DeepSeek 和智谱(GLM)三家头部实验室几乎同步释放出下一代旗舰模型的信号,让整个行业进入了一段密集的"发布前夜"。
据海外AI博主追踪,阿里巴巴正在筹备下一代 Qwen 系列旗舰模型(传闻中的 Qwen3.8 与 Qwen4.0);DeepSeek V4 GA(Generally Available)正在扩大灰度开放;而智谱 GLM 团队也已在内部平台悄然启动下一代模型的公开测试。三条产品线几乎同时逼近发布节点,这在过去一年的国产大模型竞赛中并不多见。
本文将梳理这三条线索的核心信息,并对当前热议的"蒸馏"争议做出分析。需要提醒的是,以下多数信息来自海外测试者与爆料者的观察,尚未获得官方确认,读者应保持理性判断。
Qwen 下一代:两款 Stealth 模型进入竞技场
最直接的信号来自 Code Arena(代码竞技场)测试平台。近期有两款代号分别为 Kaleb 与 Terrania Alpha 的匿名(Stealth)模型进入测试。其中 Kaleb 被普遍认为是阿里巴巴的下一代旗舰 Qwen 模型,早期结果在复杂的 3D 编程任务上表现相当惊艳;而 Terrania Alpha 目前测试样本较少,归属仍不明朗。

有意思的是,这两款模型的知识截止时间都指向较远的未来,说明它们很可能是较新的 Frontier 检查点(checkpoint)。测试者还从多个侧面推断 Kaleb 属于 Qwen 系列:它会像以往 Qwen 版本一样误读某些不常见字符串(例如把邮政编码拆成互不相关的词),在空提示词下也会照常回应,并且在部分政治类问题上的回答暗示其来自中国实验室。
发布时间线仍是推测
根据 Reddit 上一则未经证实的帖子,有人在巴黎的一场会议上从阿里巴巴内部人士处听说,Qwen3.8 可能在未来数月内发布,目标是超过 GLM 下一代的能力水平;Qwen4.0 则据说紧随其后。这些时间点均无官方背书,但 Stealth 模型进入公开测试,通常意味着正式发布已经不远。
从实测看,Kaleb 生成的带背景动画落地页在滚动触发、字体设计和整体设计感上都相当出色,"完全不像 AI 生成的 Landing Page",而在 3D 任务上的表现甚至可与顶级闭源模型相提并论。
DeepSeek V4 GA:疑似大规模蒸馏 Fable 5
第二条线索指向 DeepSeek。多位用户已通过灰度入口获得 DeepSeek V4 Pro(V4 GA)的访问权限,流出的结果显示其在代码质量、视觉设计和整体稳定性上均有明显提升。

引发争议的是其编码风格:测试者发现 V4 处理提示词的方式与某闭源模型(视频中称为 Fable 5)高度相似,经常给出"润色过、功能丰富"的同类结果。一个可佐证的实测是——用 DeepSeek V4 GA 生成的 Windows 11 克隆界面,不仅高度还原真实系统外观,还为 Edge 等应用逐一写出了 SVG 图标,甚至附带记事本、画图应用和 3D 图标等细节。
路由行为与分类器的可疑一致性
更值得关注的是关于"蒸馏"甚至"路由"的技术观察。爆料者与测试团队发现:
- 在复杂的 3D 游戏 + 知识问答任务中,V4 的输出有时与 Fable 5 极为相似,其思维链(Chain of Thought)也不同于用户对 DeepSeek 的一贯预期;
- 当提示词变简单时,模型风格又回归到更"DeepSeek"的形态;
- 最关键的测试是加入网络安全或生物学相关请求——这类内容会触发闭源模型的安全分类器。一旦混入这类敏感请求,输出质量会突然明显下降。

一种可能的解释是:某些高复杂度提示会先被路由到类似 Fable 5 的专有模型,而在分类器被触发时再回退到另一个模型。这并不能直接证明蒸馏或路由的存在,但相似性、分类器行为与质量突降三者的高度一致,确实让人难以完全排除该假设。此前 Anthropic 也曾对国产模型有过类似指控,业内普遍认为多家实验室都在从闭源巨头身上做蒸馏。
发布时间的间接线索
DeepSeek 曾在约三周前的邮件中承诺,价格变动正式生效前 24 小时会再发通知。若近期发布的传闻属实,那么用户最早在发布前一天就会收到官方邮件——这成为判断发布节奏的一个间接指标。此外,用户还可通过思考风格(如是否使用"M、L"等表述)来辨别自己是否已被切换到新检查点。
GLM 下一代:静默测试中
第三条线索来自智谱(GLM)。据博主从 CAI 团队联系人处获得的消息,GLM 的下一代重大模型已在内部平台启动测试,正式发布"很快就会来",可能落在今年三季度或稍后。目前细节极为有限,同样属于尚未证实的传闻。

从已流出的效果看,有用户用 DeepSeek V4 GA 搭出了一个纯 HTML 实现、完整可探索的"混合风格"游戏,将多个游戏系统和视觉想法整合成一个有意图的统一体验——这类演示正在成为衡量新一代大模型能力的重要标尺。
对用户意味着什么
抛开蒸馏争议不谈,从用户视角看,这轮国产大模型竞赛的本质是:能否以更低的成本和价格,做出接近顶级闭源模型的质量。 如果国产模型能够稳定复现上述效果,并延续激进的定价策略,那么今年最具颠覆性的编程模型之一,很可能就出自这三家之中。
当然,本文所述内容大多来自海外测试者的观察与爆料,Qwen、DeepSeek V4、GLM 三条线的具体发布日期均未获官方确认。真正的答案,或许最快就在近期揭晓。
相关推荐

开源权重模型之争:安全与开放如何平衡
深入分析开源权重模型的核心争论:模型权重公开发布带来透明度与创新,但也引发安全滥用风险。本文探讨分级发布、红队测试等折中方案,解读开源AI背后的行业博弈与治理挑战。

抱怨如何侵蚀你的心智:注意力自我强化效应解析
习惯性抱怨正在训练大脑发现更多负面信息,形成恶性循环。本文从注意力自我强化机制出发,解析抱怨的心理侵蚀过程,并提供主动管理注意力、跳出负面循环的实用方法。

Steam恶意软件溯源:比特币、Cookie和外卖订单如何锁定攻击者
一起Steam恶意软件案件中,调查人员通过比特币交易链、Google Cookie和Uber Eats外卖订单三条线索交叉验证,成功溯源攻击者真实身份。深入解析数字取证技术与匿名幻觉。