AI日报:GLM赠1亿token、GPT降价20%、智能体进入飞书办公

引言:AI工具竞争进入白热化阶段
8月22日的AI行业动态密集且信息量庞大,从模型能力升级到开发者福利,从多模态突破到智能体生态扩张,头部厂商正在多条战线上同时发力。本文将梳理当日最具价值的几则动态,剖析背后的行业趋势——一个由「用量补贴」「价格战」和「多模态能力竞赛」共同驱动的新阶段正在到来。
用量补贴与价格战:厂商争抢开发者
本期最引人注目的莫过于各家厂商在成本端的激进动作。ZCode宣布向新注册用户免费赠送总计1亿GLM-5.3 Token,采取先到先得的限时限量模式(太平洋时间8月21日至23日)。
Token是大语言模型计费的基本单位,一个Token大约相当于英文中的3/4个单词或中文中的1-2个字。模型处理用户输入(prompt)和生成输出都需要消耗Token,因此Token数量直接决定了API调用成本。1亿Token看似庞大,但对于企业级应用(如大规模文档处理、代码生成)来说可能仅够数天使用。这种「大额token赠送」本质上是一种典型的获客补贴,通过降低新用户尝试门槛来抢占开发者心智。这一策略借鉴了云计算早期AWS和Google Cloud的免费额度获客逻辑——一旦开发者在某个平台上构建了应用并形成依赖,迁移成本将使其长期留存。
同时,OpenAI宣布面向GPT-5.6 Sol开发者的API价格将在未来三个月内下调超过20%。说个细节,基于Token的套餐中用户积分在Codex里可以使用更久,而订阅自带的额度保持不变——这意味着OpenAI的降价更倾向于激励重度API调用者,而非普通订阅用户。
更激进的是Aux(Auxo)的隐形模型GLM,宣称将于下周免费开放,支持100万上下文、多模态、零数据保留,并设置宽松速率限制,声称每日可处理100万亿tokens供用户近乎无限使用。上下文窗口(Context Window)是指模型在单次推理中能够「记住」的文本长度。早期GPT-3.5仅支持4K token上下文,而100万token的上下文意味着模型可以一次性处理约750页英文文档或一整本中型书籍。实现超长上下文需要克服Transformer架构中注意力机制的二次方复杂度问题,常见技术路线包括稀疏注意力(Sparse Attention)、滑动窗口注意力、以及RoPE位置编码的外推优化。零数据保留则意味着平台承诺不存储用户的输入输出数据,这对处理敏感商业信息的企业用户至关重要。
当「近乎免费」成为部分厂商的策略,可以预见AI推理成本的下降速度将远超此前预期。
多模态与推理能力持续突破
DeepSeek将实验性多模态模型V4-Flash-Vision-EXP上线API平台。其文本能力与V4 Flash持平,覆盖智能体、推理与世界知识,而在多模态智能体基准测试上相较V4 Flash实现大幅提升,性能已接近Opus 4.8水平。这标志着多模态智能体正从「能看图」走向「能基于视觉执行任务」的实用阶段。
NVIDIA则在Hugging Face上发布了一个550B参数的指令遵循教师模型,官方强调其擅长约束遵循、结构化输出和格式控制,特别适合用于蒸馏和数据生成。模型蒸馏(Knowledge Distillation)是一种由Hinton等人于2015年提出的模型压缩技术,其核心思想是用一个大型「教师模型」的输出分布来指导训练一个小型「学生模型」,使学生模型在参数量大幅减少的情况下尽可能保留教师模型的能力。NVIDIA发布550B参数教师模型的战略意义在于:开发者可以利用它生成高质量的合成训练数据(synthetic data),或直接蒸馏出70B甚至7B规模的模型用于生产部署,从而将推理成本降低一到两个数量级。指令遵循能力对教师模型尤为关键,因为它决定了生成的训练数据是否严格符合预期格式和约束。

此外,Google发布了TIPS-VR,提供四种规模,每种均配备通用图文编码器与用于密集视觉任务的DPT版本,采用宽松的Apache 2.0许可证。零样本分割(Zero-shot Segmentation)指模型在未见过特定类别训练样本的情况下,仍能准确分割出图像中的目标物体,这需要模型具备强大的视觉-语言对齐能力。DPT(Dense Prediction Transformer)是一种将Transformer架构应用于密集预测任务(如深度估计、语义分割)的方法。Apache 2.0许可证是最宽松的开源协议之一,允许商业使用、修改和再分发。该模型在全部四项零样本分割基准上取得SOTA,并在多项图文和纯图像评测中名列前二,显示出开源视觉模型正快速逼近闭源水平。
智能体生态:从「对话」走向「数字同事」
本期动态中,AI智能体的产品形态正在发生质变——从被动应答的对话框,进化为主动参与工作流的「数字同事」。
Kimi推出的AI同事Mira正式进入Beta测试,其最大亮点是驻扎在飞书内部,无需切换应用。成员可以像@真实同事一样给她派任务,她还会在后台持续整理消息、定时巡查、跟进项目并提醒任务。这种「嵌入现有协作工具」的思路代表了AI智能体的一个重要范式转变:从「用户主动访问AI」转向「AI主动融入用户现有工作流」。Slack的AI功能、Microsoft 365 Copilot都遵循类似逻辑——与其要求用户学习新工具,不如将AI能力注入他们已经使用的工具中。后台持续运行、定时巡查的能力意味着这类智能体需要具备长期记忆管理、任务调度和事件驱动触发等工程能力,本质上是一个持久化运行的异步智能体系统,远超传统的单轮对话模型。

OpenAI则上线了Apple Messages插件,接入ChatGPT Work和Codex桌面端后,ChatGPT可直接在Mac上搜索历史消息、总结聊天记录、找出需要跟进的人和事,甚至替用户起草并发送回复。这一动作意味着AI正深入操作系统级的日常沟通场景。
在编程智能体方面,Google DeepMind为Anti-Gravity编程代理推出远程控制功能,开发者通过标准网页浏览器即可跨设备管理和监控自己的代理,目前仅向Ultra用户开放。

图像生成两大痛点被攻克:一致性编辑与透明背景
图像生成领域出现两则实用性极强的更新。微软AI推出图像模型MyImage 2.6,可修改图像的颜色、风格和视觉细节,并在多次迭代中保持一致性。一致性编辑(Consistent Editing)是指在修改图像某些属性时,保持图像中其他元素(如主体身份、空间布局、光照关系)不变。这在技术上极具挑战,因为扩散模型(Diffusion Model)的生成过程本质上是随机的——即使使用相同的文本提示,每次生成的结果都会有差异。解决方案通常包括图像反演(Image Inversion)将原图映射回潜空间再编辑、注意力注入(Attention Injection)保持结构一致性、以及基于ControlNet的条件控制。MyImage 2.6能在多次迭代中保持一致性,意味着它可能引入了身份锚定或参考图像条件生成机制——这正是此前生成式图像编辑的最大短板。
而OpenAI的GPT Image 2 API新增支持生成透明背景图片,开发者可直接获取透明通道素材,无需手动抠图。此前社区长期抱怨透明背景支持不足,这一功能对商品图、网页设计稿、营销海报等场景意义重大——生成后的图片可直接叠加到不同背景使用。

此外,DeepSeek上线了免费的Files API,图片只需上传一次即可通过File ID重复引用,显著节省请求带宽,对高频调用多模态接口的开发者是一大利好。
前沿研究与硬件动态
值得单独一提的是,Google DeepMind借助AlphaEvolve改进了矩阵乘法的最优理论界。矩阵乘法是几乎所有科学计算和深度学习的核心运算,朴素算法的时间复杂度为O(n³),1969年Strassen首次证明可以用亚立方复杂度完成,此后数十年间研究者不断压低矩阵乘法指数ω的上界。ω的理论下界为2(即线性复杂度),此前最佳记录为2.371339。AlphaEvolve系统反复修改并优化研究人员的代码,通过进化搜索策略自动探索算法改进空间,帮助找到比此前记录更好的矩阵乘法界——将矩阵乘法指数Omega进一步压缩。即使是小数点后第四位的改进,在超大规模矩阵运算中也能转化为显著的计算节省。这是AI辅助数学研究的又一里程碑,展示了AI不是替代数学家,而是在庞大的搜索空间中找到人类难以手动穷尽的优化路径。
开源数据方面,OpenBMB发布了面向LLM预训练的开放英文网页语料库UltraFineWeb,总量超过1万亿token、约11.4亿篇文档,全部来自Common Crawl并以Apache 2.0许可证开放。Common Crawl是一个非营利组织维护的开放网页抓取数据集,自2008年起持续抓取互联网内容,目前存储量超过250PB,是绝大多数开源LLM预训练数据的上游来源。UltraFineWeb的价值在于其经过精细清洗和去重处理,相比原始Common Crawl数据质量显著更高。
机器人领域,语术科技发布IPO后首款产品,配备灵巧手的仿生七轴机械臂,起售价9900元人民币(约1471美元),采用高精度七轴仿生关节,两条机械臂协同可实现物料分拣和装配,并具备开放程序接口。七轴设计相比工业中常见的六轴机械臂多一个冗余自由度,使其能像人类手臂一样在避障的同时完成精细操作,这对在狭窄空间内执行复杂任务至关重要。
模型能力排行榜:多强并立无人独占
在最新的AI模型能力排行榜上,竞争已进入白热化:
- 智能体榜:Cloud Opus 5 Max、GLM-5.3、Grog 4.6同以59分并列第一,无人独占鳌头;
- 智力榜:Cloud Opus 5 Max以63分登顶,Cloud Fable 5以62分居次,GPT-5.6 Sol与Grog 4.6均以61分并列第三。
从榜单可以看出,头部模型之间的能力差距正在收窄,「一超多强」的格局已被「多强并立」取代。这一趋势的底层原因在于:当模型架构(Transformer及其变体)、训练方法(RLHF/DPO对齐)和数据规模都趋于同质化后,各家厂商的差异化优势正从「基础模型能力」转向「推理效率」「工具集成」和「生态锁定」等工程与产品层面。
结语
综合当日动态,AI行业正呈现三条清晰主线:成本端的持续下探(token赠送、API降价、近乎免费的推理)、能力端的多模态与智能体化(视觉智能体、驻扎协作工具的AI同事),以及开源生态的快速追赶(NVIDIA教师模型、Google TIPS-VR、UltraFineWeb语料)。对开发者而言,这既意味着更低的使用门槛,也意味着更激烈的选型决策——在模型能力趋于同质化的今天,API稳定性、生态工具链完整度、以及长期价格承诺正成为选型的关键考量因素。
核心要点
相关推荐

OPENBOT:开源AI智能体平台,把Agent变成你的数字同事
OPENBOT是Grokbot的开源替代品,通过长生命周期具名智能体、持久化记忆、共享计算环境和MCP双通道执行策略,将AI Agent从一次性聊天框升级为有记忆、有日程的数字同事,支持自托管部署。

认知偏差学院:免费学习190+种思维陷阱的科普平台
认知偏差学院是一个免费开放的认知科学学习平台,涵盖190余种认知偏差的溯源、诊断与自察方法,支持66种语言,引用1800+学术文献,帮助你系统识别并纠正日常思维中的判断陷阱。

吴恩达AI工程技能地图:从构建到部署的完整能力拆解
深度解读吴恩达提出的AI工程技能地图,涵盖基础模型运用、提示词工程、RAG检索增强生成、模型评估与生产化部署等核心技能,帮助开发者系统掌握AI工程师的关键能力栈。