Qwen4、DeepSeek V4、GLM同台竞技:国产大模型密集冲刺

中国AI实验室再度提速
这个AI夏天没有丝毫放缓的迹象,反而因中国头部实验室的密集动作再度升温。据YouTube频道WorldofAI的最新情报,阿里巴巴、DeepSeek与智谱(ZAI)三家厂商几乎同步进入新一轮模型冲刺阶段:Qwen新旗舰疑似已悄然进入公开测试,DeepSeek V4的灰度推送持续扩大,GLM的下一代模型也已开始内测。
本文将梳理这三条并行推进的产品线,拆解其背后的技术信号,并探讨一个愈发难以回避的议题——中国模型是否正在大规模「蒸馏」海外专有模型。
需要说明的是,以下内容多来自匿名信源与匿名隐身模型的行为推断,尚无官方确认,读者应保持独立判断。

Qwen新旗舰:两个隐身模型的蛛丝马迹
Caleb与Terrania Alpha
据情报显示,代号为 Caleb 和 Terrania Alpha 的两个隐身模型近期进入了Code Arena(代码竞技场)测试。其中Caleb被认为很可能是阿里巴巴下一代Qwen旗舰,而Terrania Alpha则更为神秘,目前测试样本有限,暂无法判定其归属的模型系列。
一个值得关注的技术信号是:两个模型的知识截止日期均落在2025年末至2026年初区间,强烈暗示它们是非常新近的前沿检查点(frontier checkpoint)。
在深度学习训练流程中,「检查点」(checkpoint)指训练过程中定期保存的模型权重快照——可以将其理解为训练进度的「存档点」,允许研究者在任意时刻恢复或对比不同阶段的模型状态。「前沿检查点」特指处于当前能力边界的最新版本,通常集成了最新的训练数据、RLHF(人类反馈强化学习)对齐优化与最新架构改进。知识截止日期(knowledge cutoff)则是预训练语料的时间边界——模型无法从训练数据中获取截止日期之后发生的事件信息。落在2025年末至2026年初的截止日期,意味着模型在预训练阶段摄入了极为新近的语料,大概率代表尚未公开的最新训练轮次。这一指标之所以重要,是因为采集、清洗并将互联网级别的新鲜语料纳入预训练体系,通常需要数月的工程周期;能够将知识截止日期推进至如此近期,是判断检查点新旧程度最直接的指标之一。
如何辨认这是Qwen模型?
Caleb在对话中反复自我介绍为「Cloud」,但用户通过输出模式与分词(tokenization)特征识别出了明显的Qwen痕迹:
- 与历代Qwen版本一致,Caleb在处理邮政编码等非常规字符串时容易误判,有时甚至将此类输入视作空提示;
- 面对特定政治类问题时的回应方式,也指向中国AI实验室的典型风格。
分词特征之所以能成为识别依据,根源在于分词器(Tokenizer)工作机制的底层差异。分词器是大语言模型预处理流程的第一个环节,负责将原始文本切分为模型可处理的最小单元(token)。不同模型系列通常使用各自独立训练的词表:GPT系列采用标准BPE(字节对编码)算法,而Qwen系列在此基础上针对中文与代码做了深度定制优化,例如对中文字符的细粒度子词切分、对代码关键字的特殊处理,以及对混合语言文本的跨语言对齐策略。对同一字符串——尤其是邮政编码、混合语言片段或特殊符号——不同词表会产生系统性的切分差异。这种差异发生在推理链路的最底层,难以通过提示工程(prompt engineering)掩盖,构成类似「语言指纹」的识别手段。
在竞争情报分析中,研究者有时还会结合嵌入向量相似度(embedding similarity)分析进一步验证——将待测模型对同一批输入的内部表征与已知模型的表征进行聚类比对,已知模型的输出分布在向量空间中往往具有可辨识的聚集模式。具体而言,这一方法通过向待测模型与基准模型输入相同的「探针提示集」(probe prompt set),提取各自的隐层激活向量,再用UMAP或t-SNE等降维算法可视化其分布形态——若两组向量在降维空间中高度重叠,则强烈暗示两者共享相似的预训练数据分布或架构设计。这些线索虽不能官方证实,但已足以「连点成线」推断其为Qwen系列模型。
实测表现:3D与前端设计出色
在被要求生成一个含多种着色器(shader)和动画Hero区块的落地页时,Caleb交出了相当出色的答卷——滚动触发动效、字体排版与整体设计品味均颇具水准,已不太像典型的AI生成页面。
着色器(Shader)是运行在GPU上的小型专用程序,使用GLSL、HLSL等特定着色器语言编写,负责决定3D场景中每个像素或顶点的最终颜色、光照与材质效果,是现代实时图形渲染管线的核心组件。着色器的运行环境极为特殊:它在GPU的数千个并行计算单元上同时执行,无法访问传统意义上的全局变量或内存堆栈,所有计算必须以纯函数(pure function)形式完成。能够正确生成着色器代码被视为AI编码能力的高阶指标,因为这要求模型同时掌握图形学数学(矩阵变换、法向量计算、光照模型如Blinn-Phong或PBR)、着色器语言特有语法,以及与宿主环境(WebGL、Canvas API、Three.js等框架)的正确集成逻辑。与通用编程任务不同,着色器错误往往产生视觉上无意义的输出(全黑屏幕、随机噪点)而非明确的报错信息,调试难度极高,因此成为评估模型代码理解深度的有效压力测试场景。Caleb的3D任务表现尤为亮眼,据称可与GPT-5.6等前沿模型相媲美。
情报进一步透露,Qwen 3.8可能在2026年8月发布,目标是超越GLM 5.2级别的能力;Qwen 4.0则瞄准2026年9月。隐身模型进入公测,通常意味着正式发布已为期不远。

DeepSeek V4 GA:灰度扩大,发布在即
灰度推送持续放量
DeepSeek V4 GA(Generally Available,正式可用版)的灰度推送范围正在持续扩大,越来越多用户获得访问权限。
灰度发布(又称金丝雀发布,Canary Release)是互联网产品领域成熟的发布工程策略,指在正式全量上线前,先向一小部分用户群体(通常按地域、账号哈希或订阅等级筛选)开放新版本,通过真实流量验证稳定性、收集反馈并监控异常指标。名称「金丝雀」源自矿工携带金丝雀入矿的古老做法——金丝雀对有毒气体更为敏感,可提前预警危险;类似地,小规模用户群在产品全量发布前充当「早期预警系统」的角色。对大语言模型而言,灰度发布还承担着额外功能:一方面可在生产环境中A/B对比新旧检查点的输出质量差异,另一方面可借助真实用户的多样化提示,发现合成评测集(benchmark)难以覆盖的边缘案例(edge cases)。
需要指出的是,大模型的灰度发布与传统软件灰度存在本质区别——由于模型输出的随机性(temperature采样)与用户提示的无限多样性,任何封闭测试集都无法穷举真实用户的使用场景。这也是头部实验室普遍采用「小流量灰度→扩大流量→全量上线」三阶段策略的根本原因:每个阶段都在以更大规模的真实流量替代有限的内部评估,从而逐步建立对模型稳定性的信心。DeepSeek V4 GA持续扩大的灰度范围,意味着官方已在收集足够大规模的真实用户反馈,是判断正式发布时间窗口的重要信号。X和Bilibili上流传的输出案例显示,DeepSeek V4在编码质量、视觉设计与整体稳定性上均有明显提升。
一个可能的发布时间线索来自DeepSeek约三周前发出的邮件:官方承诺会在价格调整生效前24小时再次发送通知。若传闻中的「下周一发布」属实,正式通知邮件最快可能明天就会到达。
令人瞩目的实测案例
最受关注的案例是DeepSeek V4 GA生成的 Windows 11克隆:它不仅还原了操作系统的视觉外观,还为每个应用手写了SVG图标,涵盖记事本、画图应用,甚至内置了一个3D霓虹赛车游戏。另一个案例中,用户让其用纯HTML构建了融合Minecraft与《无人深空》风格的混合游戏,包含地形探索、环境细节和统一的视觉风格——已远超基础技术演示的范畴。
SVG(可缩放矢量图形,Scalable Vector Graphics)图标的自动生成是一项尤为值得关注的细节:SVG本质上是结构化的XML代码,其核心由路径(<path>)、形状(<circle>、<rect>)和变换(transform)等指令构成。手写SVG图标要求模型能够将视觉语义(「这是一个文件夹图标」)精确映射为几何路径指令(贝塞尔曲线的控制点坐标、arc命令的半径与旋转角、坐标变换的矩阵参数),这需要极强的空间推理能力与代码语义理解能力的协同。更值得注意的是,SVG图标的生成还涉及视觉一致性问题——Windows 11的Fluent Design图标体系有其内在的风格规范(圆角程度、描边粗细、阴影处理),模型需要跨多个独立图标维持这种隐式一致性,而非逐一孤立生成。这类能力在传统编码基准测试中往往得不到充分评估,却是衡量模型「创作性编码」(creative coding)能力的重要维度。
识别V4的一个实用技巧
用户发现,V4 GA的思维链(Chain of Thought,CoT)风格发生了变化,倾向使用「I'm」「I'll」而非旧版的「let me」,这可作为判断是否命中新检查点的参考标志。
思维链推理(CoT)由Wei等人于2022年在Google Brain提出,核心思想是引导或训练模型在给出最终答案前,先输出分步骤的中间推理过程,从而在数学、逻辑推理和多步问答等复杂任务上显著提升准确率。从认知科学角度看,CoT与人类「外化思维」(externalized thinking)的过程高度类似——将内隐的推理步骤显式化,不仅帮助模型「思考得更清晰」,也为研究者提供了可解释的推理轨迹。
CoT不仅是功能性机制,其特有的语言风格——包括段落结构、过渡词选择、自我质疑句式——往往成为识别特定模型系列的「文体指纹」。DeepSeek历代模型的CoT以「let me think」「let me verify」等自我对话风格著称,这种风格来自其RLHF训练阶段的偏好数据分布。从技术机制来看,RLHF中的奖励模型(Reward Model)会对模型输出进行评分,训练信号不仅影响答案的正确性,还会系统性地塑造输出的语言习惯与风格倾向——这正是为什么不同实验室的模型即便在相同架构下也会产生截然不同的「语感」。V4 GA转向更直接的「I'm」「I'll」第一人称表达,暗示底层训练数据分布或奖励模型的偏好设置发生了系统性变化——这一细节在后续的蒸馏调查中也成为重要佐证。

蒸馏疑云:DeepSeek是否在「借道」Fable 5?
这是本期情报中最具争议的部分。知名爆料者Leo等人调查发现,DeepSeek V4的输出与专有模型 Fable 5 高度相似,怀疑其可能通过API大规模采集专有模型输出进行蒸馏。
知识蒸馏(Knowledge Distillation)最早由Hinton、Vinyals与Dean于2015年在Google提出,原始场景是模型压缩:让小型「学生模型」学习大型「教师模型」输出的软标签(soft logits,即完整的概率分布而非仅最高概率类别),从而以更低参数量逼近教师模型的能力边界。软标签之所以优于硬标签(one-hot编码),是因为它保留了教师模型对不同类别的「置信度分布」,传递了远比单一正确答案更丰富的语义信息——例如,教师模型可能对某图片的分类在「猫」(70%)和「豹」(25%)之间犹豫,这一不确定性本身就是有价值的训练信号。
在大模型时代,这一概念衍生出更具争议的形态:通过API大规模采集专有模型的文本输出作为监督微调(SFT)数据,再用这些数据训练自有模型,本质上是「借用」专有模型的推理能力而绕开其权重与训练细节。这种做法在学术界被称为「黑盒蒸馏」(black-box distillation)或「API蒸馏」,与白盒蒸馏(需要访问教师模型内部logits)相对。OpenAI、Anthropic、Google等公司均在服务条款中明确禁止将API输出用于训练竞争性模型,但技术层面的检测与取证极为困难——监管机构通常只能依赖输出风格相似性、嵌入空间聚类、分类器行为异常等间接证据进行推断。更深层的挑战在于,「相似输出」本身可能来自多种原因:相同的训练数据、相同的架构设计、或真实的蒸馏行为,三者在证据层面难以明确区分。尚无成熟的法律先例确立明确边界,这一议题正在成为AI治理领域的核心争议之一。
调查中有几处发现值得细看:
- 对于复杂的3D游戏加知识型问题,疑似DeepSeek V4检查点产生的输出与Fable 5惊人地接近,且思维链模式明显有别于DeepSeek以往风格;
- 切换为简单提示后,模型行为又回归DeepSeek常态;
- 当在3D编码提示中混入会触发Fable安全分类器的网络安全或生物学内容时,输出质量骤然下滑。
一种可能的解释是:某些复杂提示被路由至Fable 5等专有模型处理,一旦分类器被触发则回退到另一个模型。这种混合推理路由(hybrid inference routing)架构在技术上完全可行——系统可以根据提示的复杂度、类型或语义特征,将不同请求动态分发至不同模型后端,对用户呈现统一接口。这类路由系统通常由一个轻量级「分类器网络」(classifier network)或基于规则的调度层实现,能够在毫秒级延迟内完成提示分析与后端选择。这一架构的存在本身并不违规——许多企业级AI平台都在用类似的「模型混合路由」策略平衡成本与质量。但若后端路由的是未经授权使用的专有模型API,则涉及服务条款层面的法律风险。调查者还注意到,DeepSeek在调查期间似乎持续调整其路由策略,这本身也是值得记录的行为模式。
这些证据尚不能百分之百证明蒸馏或路由行为的存在,但输出相似性的一致性、分类器行为以及质量骤降的规律,使这一推断「难以轻易否定」。
值得一提的是,Anthropic此前也曾对Qwen提出类似指控,多家实验室被怀疑在蒸馏美国专有头部模型。

用户视角:够便宜、够好用就是赢
视频作者坦言了一个务实的立场:无论DeepSeek或其他中国实验室是否借助蒸馏提升能力,只要能以显著更低的成本交付接近Fable 5的能力水准,对用户而言就是实实在在的利好。若DeepSeek V4能延续一贯的激进定价策略,它很可能成为近期最具颠覆性的AI编码模型之一。
GLM也来了:智谱ZAI酝酿下一代
最后是智谱ZAI的动向。据情报,ZAI团队已在其内部平台启动下一代GLM模型的公测,版本可能是GLM 5.3或5.5,不排除直接跳代至第六代(但概率较低)。
GLM(General Language Model)系列由智谱AI基于清华大学KEG实验室团队研发,其核心技术论文发表于2022年ACL会议。与GPT系列纯自回归(autoregressive)的从左到右生成范式不同,GLM最初采用「自回归空白填充」(autoregressive blank infilling)作为预训练目标:随机遮蔽输入文本的连续片段,训练模型以自回归方式重建被遮蔽内容,从而在单一预训练框架中同时覆盖自然语言理解(NLU)与自然语言生成(NLG)任务。这一设计理念与BERT(双向编码器)和GPT(单向解码器)各执一端的范式形成对比——GLM试图在一个统一的预训练目标下兼顾两者的优势,避免为不同下游任务维护不同的预训练模型。
这一框架与Google T5模型的「Text-to-Text」统一范式有相似之处,但GLM在实现上针对中文语言特性做了深度适配——中文缺乏明确词边界(word boundary),词级遮蔽策略需要结合中文分词逻辑(如基于字频统计或神经网络分词器),并对汉字的多义性与语境依赖性做了特殊处理,这使GLM在中文推理、文档补全与代码生成领域积累了独特优势。随着GLM-4系列的演进,智谱AI逐步向标准Transformer解码器架构靠拢,并引入多模态扩展(图文理解)与工具调用(function calling)能力,成为国内学术界与工业界结合最为紧密的大模型系列之一。GLM系列的开源策略也使其积累了活跃的研究社区,大量基于GLM的垂直领域微调版本在医疗、法律、金融等专业场景中得到广泛应用。
目前公开细节稀少,唯一确定的是内部测试已经启动。作者的ZAI联系人透露,一次重大模型发布即将到来,时间窗口大约在8月至9月,预计下一季度落地。
结语:这场竞速远未结束
从Qwen到DeepSeek再到GLM,三条产品线几乎在同一时间窗口密集推进,折射出国产大模型在编码与3D生成能力上的快速追赶。同时,围绕「蒸馏」的争议也在提醒整个行业:模型能力的来源与竞争的边界,正成为无法回避的核心议题。蒸馏技术的合法性边界、专有输出数据的产权归属,以及如何在开放生态与商业保护之间寻找平衡,将是未来AI治理讨论中愈发重要的议题。
对开发者和普通用户而言,无论各家技术路线如何演进,更强、更实惠的模型选择正在加速到来。未来几周,三家厂商的正式发布节奏值得持续关注。
核心要点
- Qwen隐身模型:代号Caleb与Terrania Alpha的两个模型已进入Code Arena测试,知识截止日期落在2025年末至2026年初,分词器特征与政治问答风格指向Qwen系列;3D着色器与前端设计能力据称可与GPT-5.6媲美。
- DeepSeek V4 GA:灰度推送持续扩大,Windows 11克隆与混合游戏等实测案例引发广泛关注;思维链风格从「let me」转向「I'm/I'll」可作为命中新检查点的识别标志;发布通知邮件可能即将送达。
- 蒸馏争议:调查发现DeepSeek V4特定检查点输出与Fable 5高度相似,安全分类器触发后质量骤降的规律使「路由或蒸馏」推断难以轻易否定,但尚无确凿证据;这一议题正演变为AI治理领域的核心争点。
- GLM下一代:智谱ZAI已启动内部测试,发布窗口预计在2026年第三季度,具体版本号尚不明确。
相关推荐

开源权重模型之争:安全与开放如何平衡
深入分析开源权重模型的核心争论:模型权重公开发布带来透明度与创新,但也引发安全滥用风险。本文探讨分级发布、红队测试等折中方案,解读开源AI背后的行业博弈与治理挑战。

抱怨如何侵蚀你的心智:注意力自我强化效应解析
习惯性抱怨正在训练大脑发现更多负面信息,形成恶性循环。本文从注意力自我强化机制出发,解析抱怨的心理侵蚀过程,并提供主动管理注意力、跳出负面循环的实用方法。

Steam恶意软件溯源:比特币、Cookie和外卖订单如何锁定攻击者
一起Steam恶意软件案件中,调查人员通过比特币交易链、Google Cookie和Uber Eats外卖订单三条线索交叉验证,成功溯源攻击者真实身份。深入解析数字取证技术与匿名幻觉。