GLM-5.3开源登顶 Gemini 3.7 Flash发布 DeepSeek V4 Pro撤回

开源大模型再迎里程碑:智谱GLM-5.3发布
8月14日的AI领域可谓热闹非凡,多家头部厂商密集发布新品,同时也出现了旗舰模型意外撤回的插曲。首先值得关注的是智谱推出的GLM-5.3。
据B站AI风向标频道的报道,GLM-5.3基于743B的庞大基座进行了大幅后训练,主打编程与智能体两大核心场景,并在网络安全维度树立了开源领域的新标杆。这里的743B(7430亿参数)是当前开源模型中参数规模最大的基座之一。参数量级直接影响模型的知识容量和推理能力,但单纯堆参数并非万能——后训练(Post-Training)环节同样至关重要。后训练通常包括监督微调(SFT)、基于人类反馈的强化学习(RLHF)以及针对特定场景的对齐训练。智谱在编程与智能体两个方向的深度后训练,意味着模型在代码生成、多步推理和工具调用等维度经过了大量专项优化。从实际表现看,其编程体感评测相较前代GLM-5.2提升约50%,这一显著的迭代幅度正是后训练深度优化的直接体现。
在多项公开基准测试中,GLM-5.3稳居开源模型头部位置。更值得称道的是,智谱在完成安全加固后,承诺两周内开放全部权重。这种"先安全、再开放"的策略,既回应了业界对大模型安全性的担忧,也延续了国产开源阵营一贯的开放姿态。对于开发者而言,一个编程能力大幅跃升、又完全开源的模型,无疑是极具吸引力的选择。
谷歌闪电迭代:Gemini 3.7 Flash编码能力大跃进
谷歌DeepMind的更新节奏同样惊人。距离上一版本仅仅三周,Gemini 3.7 Flash便正式登场,定位为编程与智能体场景下的最强工作模型。
这一代Flash在编码基准上有了大幅提升:Frontier Code得分达到43.6%,DeepSWE则达到65.3%。Frontier Code聚焦于前沿级别的代码生成与推理任务,涵盖算法设计、系统架构等高难度场景,能有效区分模型在复杂编程任务上的天花板。DeepSWE则模拟真实软件工程工作流,包括Bug修复、代码审查、跨文件重构等实际开发场景,更贴近工程师的日常工作。Gemini 3.7 Flash在DeepSWE上达到65.3%,意味着它能够在近三分之二的真实软件工程任务中给出正确或高质量的解决方案,这一水平已经具备实用价值。更关键的是定价策略——Gemini 3.7 Flash的价格仅为3.6 Flash的一半,展现出谷歌在成本效率上的激进打法。
目前该模型已经上线Cursor、Devin、GitHub Copilot等主流开发工具,这意味着开发者可以第一时间在实际工作流中体验其能力。"更快、更便宜、更强"的组合拳,正是Flash系列一贯的产品定位,也是谷歌应对激烈竞争的核心武器。
DeepSeek V4 Pro旗舰撤回:一场不到24小时的插曲
本期最富戏剧性的事件,莫过于DeepSeek V4 Pro 0813的意外撤回。

据报道,DeepSeek官网的V4 Pro 0813发布通知及开放平台公告均已被撤回,距离8月12日晚间的静默发布还不到24小时。不过颇为耐人寻味的是,官方API文档中DeepSeek V4 Pro 0813的相关信息目前仍然可见。
这种"发布即撤回"的操作在业界并不常见,背后可能涉及模型质量把控、发布节奏调整或其他战略考量。无论原因为何,这一插曲都反映出当前大模型竞争的高度紧张——厂商既想抢占发布先机,又需在质量与稳定性上审慎权衡。对于外界而言,我们或许还需静待DeepSeek后续的正式官宣。
OpenAI双线出击:UltraFast API与Computer History记忆功能
OpenAI在本轮竞争中同样动作频频,一口气推出了两项重要功能。
首先是全新的UltraFast API服务层级。该服务运行GPT-5.64,速度最高提升14倍,由Cerebras提供算力支持,每秒可输出多达750个Token。Cerebras Systems是一家专注于AI加速硬件的公司,其核心产品WSE(Wafer Scale Engine)是全球最大的单芯片处理器,整片晶圆上集成了数万亿晶体管。与传统GPU方案相比,Cerebras在推理场景下的核心优势在于极低延迟和极高吞吐量,因为其架构消除了芯片间通信的瓶颈。OpenAI选择Cerebras作为算力支撑,正是看中了这种架构优势——每秒750 Token的输出速度大约是常规API服务的10倍以上,能够满足实时对话、智能体多轮调用等对延迟极度敏感的应用场景。该层级主要面向延迟敏感的智能体应用与高并发场景,目前处于抢先体验阶段。

其次是可选的Computer History功能。该功能可将macOS上最近的计算机活动捕获为本地时间线,并转化为ChatGPT和Codex可用的记忆。从技术角度看,这属于"环境感知AI"范畴——它通过在macOS系统层面捕获用户的屏幕活动、应用切换和操作记录,构建一条本地化的时间线数据流,再将这些信息结构化后注入ChatGPT的上下文窗口。这与传统的聊天记忆有本质区别:后者只记住对话内容,而Computer History记住的是用户在整个电脑上的行为轨迹。借助它,ChatGPT Work能够跨选定的应用和网站恢复上下文,理解"你刚才在浏览器看了什么文档""你在IDE里修改了哪段代码"等跨应用场景,从而让AI基于用户近期的电脑操作提供更连贯、更精准的辅助。你可能没注意到,该功能默认关闭,需由用户主动开启——这在隐私保护上体现了合理的设计考量,因为屏幕活动数据的敏感性远高于普通聊天记录。
音乐生成与开发工具的双重进化
除了大模型本身,配套的应用生态也在快速演进。
MiniMax推出了Music 3.0,这是新一代开源权重、生产级的音乐生成模型。它可以根据创意概念与可选歌词,一次性完成整首歌的作曲、编曲、演奏与制作,单曲最长可达5分钟。该模型面向创作者与生产场景,并将权重开放下载,进一步降低了AI音乐创作的门槛。

在开发工具方面,Cursor推出了Bios for Cloud Agents,可在后台持续准备即用的开发环境副本,让云智能体无需等待配置即可开始工作。官方称环境启动提速最高10倍,首Token生成提速约3倍,即使依赖更新失败也能保持运行。该功能不额外收费,并将于8月17日起成为默认选项。这类基础设施优化,正是提升智能体实用性的关键一环——当AI编码助手的环境启动时间从分钟级缩短到秒级,开发者的体验将发生质的飞跃。
国产算力加速布局:Token资费标准化与芯片适配
在产业侧,国产厂商的布局同样引人关注。
中国移动在中期业绩说明会上宣布,将面向个人和企业客户推出标准化的全国Token资费方案。Token是大语言模型处理文本的基本计量单位,一个中文字大约对应1.5-2个Token。当前行业的大模型API定价普遍以每百万Token为计费单元,但各厂商的价格体系、计费粒度和套餐结构差异巨大,给企业采购和成本核算带来了困难。中国移动的标准化资费方案类似于电信行业早期将话费、流量统一为标准套餐的做法,本质上是将AI推理能力商品化。上半年公司已完成多档位Token资费设计并在多省试点,同时搭建统一的AI模型平台,意图将大模型调用纳入标准化计费体系。这标志着AI能力正逐步走向"水电煤"式的基础设施化运营,不仅降低了中小企业使用大模型的门槛,也为AI能力的大规模普及奠定了计费基础。

芯片厂商寒武纪也交出了亮眼的半年度成绩:上半年营收59.96亿元,同比增长108.13%;净利润23.11亿元,同比增长122.61%。董事长陈天石透露,公司已完成GLM、DeepSeek、Qwen、Kimi、MiniMax五款国产主流大模型的推理适配,第六代芯片架构正在研发中。值得注意的是,大模型推理适配远非简单的"换一块芯片"就能实现。主流大模型的训练和推理框架(如PyTorch、vLLM、TensorRT-LLM等)长期围绕NVIDIA CUDA生态构建,算子库、并行策略、内存管理都深度耦合。国产芯片要实现适配,需要在编译器、算子优化、分布式推理框架等多个层面重新开发或移植。寒武纪完成五款主流模型的推理适配,意味着其软件栈已经具备了覆盖MoE混合专家模型、Dense稠密模型等主流架构的通用能力,这是国产AI芯片生态成熟度的重要标志。国产芯片与国产大模型的深度协同,正在构建起更自主可控的AI技术栈。
AI模型能力排行榜:当前竞争格局透视
最后来看当前的AI模型能力排行榜。Claude Opus 5以63分领跑智力榜,并称霸智能体榜;GPT-5.6主导编程头部竞争;Claude 3.8 Max稳居智能体第三,证明开源正逼近闭源阵营。而新锐的Gemini 3.7 Flash入榜智力第九,以56分凸显了其速度优势。
综合来看,8月14日这一天的密集发布,清晰勾勒出当前AI竞争的三条主线:开源模型持续逼近闭源顶尖水平、编程与智能体成为核心战场、算力与成本效率决定商业化成败。无论是智谱、谷歌、OpenAI还是国产芯片厂商,都在各自赛道上加速狂奔。这场竞赛远未到终局,值得我们持续关注。
相关推荐

研究生证明分形上的量子不确定性原理:跨越傅里叶分析与几何的突破
一位研究生成功为分形结构证明了量子不确定性原理,建立了函数在分形集合上集中程度与傅里叶变换之间的定量约束,将经典调和分析延伸到分形领域,为数学与物理交叉研究开辟新方向。

NeurIPS投稿揭示AI时代科研协作新趋势
从一则Reddit招募帖分析NeurIPS Workshop投稿策略、AI编程工具如何重塑科研生产力,以及年轻研究者全球化协作的机遇与风险,深度解读AI时代学术科研的变局与新生态。

AQuA量化模型消融实验解读:IC提升0.023从何而来
深入解读AQuA混合量化模型的IC提升归因问题。分析为何0.023的IC差距需要消融实验验证,梳理特征工程、混合架构拆解、训练配方三大消融优先级,探讨量化研究方法论中的对照严谨性与可复现性。