DeepSeek V4视觉版开源,智谱收入暴涨400%

DeepSeek V4视觉权重开源:305B多模态模型正式登场
9月1日的AI圈可谓热闹非凡。开源阵营方面,DeepSeek放出了V4的首个视觉版本权重,模型规模达到305B(约3050亿参数),并同步提供了最小推理实现,方便开发者上手体验和二次开发。这一参数规模使其跻身全球最大开源多模态模型之列。所谓多模态模型,是指能够同时处理和理解文本、图像、音频等多种信息形式的AI模型,相比纯文本大模型具有更丰富的感知和推理能力。视觉权重的开源,意味着模型中负责图像理解、视觉推理的参数矩阵被完整公开,社区开发者可以直接在此基础上进行下游任务的适配和优化。
从架构层面来看,DeepSeek V4采用的是MoE(Mixture of Experts,混合专家)架构,305B的总参数中实际每次推理仅激活其中一部分专家网络,这使得模型在保持巨大参数容量的同时控制了实际计算开销。MoE架构的核心机制是通过一个可学习的门控网络(Gating Network)来决定每个输入token应该被路由到哪些专家子网络。具体而言,305B总参数可能包含数百个专家模块,但每次推理时门控网络只会选择其中的少数几个(如8-16个)进行计算,因此实际激活参数量可能仅为总参数的10%-20%左右。这种稀疏激活机制最早由Google在Switch Transformer中大规模验证,后被Mixtral、DeepSeek等模型广泛采用,其优势在于模型可以在不等比增加计算量的前提下大幅扩展参数容量,从而存储更多知识。这种设计理念类似于人脑处理不同类型问题时激活不同脑区——面对图像理解任务和数学推理任务时,模型会路由到不同的专家子网络。视觉权重的开源具体涉及Vision Encoder(视觉编码器)和跨模态对齐层等关键组件,视觉编码器负责将图像像素信息提取为高维特征向量,而跨模态对齐层则负责将这些视觉特征映射到与文本表征兼容的向量空间,使得模型能够在统一的语义空间中理解图文信息。
不过,规模巨大也意味着部署门槛不低。官方给出的部署要求是需要4张GB300显卡才能支撑起完整的推理服务。GB300是NVIDIA最新一代基于Blackwell架构的数据中心GPU,采用台积电4NP定制工艺,支持FP4精度计算,在推理吞吐上相比前代H100/H200有数倍提升。其搭载的HBM3e(High Bandwidth Memory,高带宽内存)显存单卡容量可达192GB-288GB,带宽超过8TB/s,专为超大规模模型推理设计。4张GB300意味着推理所需的显存总量可能超过1TB,还需要通过NVLink第五代高速互联技术(带宽达1.8TB/s,支持最多72个GPU通过NVSwitch组成统一内存池)实现多卡间的张量并行——即将单个矩阵运算切分到多张GPU上并行执行,要求GPU间的通信带宽足够高以避免成为瓶颈。这在当前硬件条件下属于典型的企业级配置,对于普通开发者和小型团队而言并不友好,更多是面向具备充足算力资源的企业和研究机构。DeepSeek此次将视觉能力开源,标志着其正式从纯文本模型迈向多模态领域,也为国产开源多模态生态注入了新的活力。
值得关注的是,DeepSeek坚持开源路线的策略,与其一贯的技术普惠理念相符。视觉权重的开放,意味着社区可以在此基础上进行微调、蒸馏(即通过知识蒸馏技术将大模型的能力压缩到更小的模型中),衍生出更多轻量化、可落地的应用版本,从而在一定程度上缓解高部署门槛带来的使用障碍。知识蒸馏技术由Hinton等人在2015年正式提出,其核心原理是让一个小型"学生模型"模仿大型"教师模型"的输出分布,从而在参数量大幅减少的情况下保留大部分能力。具体来说,教师模型输出的软标签(soft label)——即各类别的概率分布——包含了丰富的"暗知识",例如教师模型判断某图片90%是猫、8%是豹,这个分布本身就传递了"猫和豹在视觉特征上相近"的信息。在大模型生态中,蒸馏已发展出多种变体,包括特征蒸馏(模仿中间层表征)、注意力蒸馏(模仿注意力分布)以及基于合成数据的蒸馏(用教师模型生成训练数据来训练学生模型)。这种"大模型开源、社区蒸馏"的路径已经在LLaMA等开源生态中被验证为行之有效的技术扩散方式——LLaMA开源后,社区迅速涌现出Alpaca、Vicuna等大量衍生模型,极大地推动了开源大模型生态的繁荣。
ChatGPT Apps年化收入破10亿美元,OpenAI商业化提速
在商业化维度,OpenAI交出了一份亮眼的成绩单。ChatGPT Apps上线还不到200天,其年化收入运行率(ARR)就已经达到了10亿美元的量级,增长速度令人瞩目。ARR(Annual Recurring Revenue,年度经常性收入)是SaaS和订阅制企业最核心的财务指标之一,它将当前收入水平按年化方式计算——通常是将最近一个月的经常性收入乘以12,或将最近一个季度的经常性收入乘以4——用以衡量业务的可持续增长能力和未来收入的可预测性。它之所以成为SaaS行业的核心指标,是因为订阅制收入具有可预测性和累积性——只要客户不流失,收入就会自然累积。与之相关的关键指标还包括Net Revenue Retention(净收入留存率)、CAC(客户获取成本)和LTV(客户终身价值)。10亿美元ARR在SaaS行业中被称为"Centaur"级别的商业里程碑,全球达到这一水平的SaaS公司不超过150家——Slack花了约5年、Zoom花了约10年才达到这一水平,而ChatGPT Apps在不到200天内便触及这一门槛,充分说明AI应用生态的商业爆发力远超传统SaaS产品。ChatGPT Apps是OpenAI推出的应用生态平台,允许第三方开发者基于GPT模型构建独立应用并分发给用户,类似于苹果App Store的模式,但底层能力由AI模型驱动,OpenAI从中抽取平台分成。

话说回来,OpenAI的广告业务已经覆盖40多个国家,自助投放服务也扩展到了印度、欧洲、中东和北非等新兴市场。广告业务的全球化布局标志着OpenAI正在借鉴Google和Meta验证过的成熟变现路径——通过AI驱动的精准广告投放来创造规模化收入。与传统的关键词匹配广告不同,OpenAI的广告系统可以利用GPT模型对用户对话意图的深层理解来实现更精准的广告定向,例如在用户讨论旅行计划时推荐相关的酒店或机票服务,这种基于语义理解的广告投放效率理论上远高于传统搜索广告。自助投放服务的推出则进一步降低了广告主的使用门槛,中小企业无需通过广告代理即可直接在ChatGPT生态中投放广告。这一系列布局表明,OpenAI正在从单一的技术供应商,加速转型为具备"技术平台+广告变现+订阅收入"多元商业闭环的平台型公司。广告与自助投放的全球化铺开,也预示着AI应用的商业模式正在逐步走向成熟,从依赖融资输血的烧钱阶段迈向自我造血的新阶段。
智谱收入暴涨400%,API业务占比超八成但亏损仍是隐忧
把目光转回国内市场,智谱公布的财务数据同样引人关注。上半年智谱实现收入9.54亿元,同比增长约400%,增速惊人。其中API(Application Programming Interface,应用程序编程接口)业务占据了收入的86.5%,成为绝对的营收主力。API业务模式是当前大模型公司最主要的B端变现方式,企业客户通过调用API接口获取模型的推理能力,通常按token(模型处理文本的基本单位,一个中文字约对应1-2个token)用量计费。86.5%的高占比说明智谱的收入结构高度依赖企业级客户的模型调用需求,反映出国内企业对大模型能力接入的旺盛需求正在快速转化为实际购买力。

需要注意的是,国内大模型API市场在2024年下半年至2025年经历了一轮异常激烈的价格战。这轮价格战始于2024年5月DeepSeek V2的发布,其API定价大幅低于行业平均水平,引发连锁反应。随后字节跳动、阿里、百度等厂商纷纷跟进降价,百万token的调用价格从最初的数十元(GPT-4级别约120元)一路降至个位数甚至不足1元。价格战的底层逻辑包括:一是MoE架构和推理优化技术(如vLLM、PagedAttention等)大幅降低了实际推理成本;二是各厂商将API视为获客工具而非利润中心,试图通过低价锁定开发者生态;三是开源模型的竞争使得闭源API必须在价格上保持竞争力。部分厂商甚至推出大额免费调用额度以抢占市场份额,这场价格战被业内称为"百模大战中的定价绞杀"。智谱在这一环境下仍实现400%的收入增长,说明其客户基数和调用量的增长远超价格下降的幅度,体现了"以价换量"策略的短期有效性。但这种策略的风险在于,一旦市场形成低价预期,未来提价将面临极大阻力。
然而,高增长的背后仍有隐忧。同期智谱亏损达到20.72亿元,远超其收入规模,亏损额约为收入的2.2倍。这一数据折射出当前大模型行业普遍面临的结构性困境:训练一个前沿大模型的算力成本动辄数亿元甚至更高——以千卡级A100/H100集群训练数月为例,仅电费和GPU租赁费用就是一笔天文数字——加上持续的推理服务器运营费用、高端AI人才的薪酬支出(顶级AI研究员的年薪可达数百万元),以及行业激烈价格战导致的API定价压力,使得收入增长在短期内难以覆盖总成本。20.72亿元的亏损也暗示,当前行业的API定价水平很可能低于实际推理成本的盈亏平衡点,厂商们在用亏损补贴来维持市场份额。这种"以亏损换规模"的策略在互联网行业并不罕见(如早期的滴滴、美团),但大模型行业的资本密集程度更高,因为其成本结构中GPU等硬件支出占据了绝对大头,且这些成本随着模型规模增长呈超线性上升。如何在快速扩张与财务健康之间找到平衡,将是智谱乃至整个国产大模型厂商需要长期面对的课题。
Runway Solaris界面生成与Meta MuseCode开发工具升级
在产品形态上,两大动向值得关注。首先是Runway推出的界面模型Solaris,它能够根据用户的点击和拖拽操作,逐帧生成下一张界面,而无需先编写代码。这种交互式的界面生成方式代表了一种全新的人机交互范式——不再是人类用代码或设计工具描述界面,而是通过自然的交互动作,由AI实时推断并生成下一帧界面状态。从技术本质上看,Solaris将UI设计问题转化为了视觉序列预测问题,类似于视频生成模型对下一帧画面的预测,极大降低了原型设计和界面开发的门槛。
Solaris的核心技术思路可以追溯到世界模型(World Model)的概念。世界模型由Yann LeCun等人系统阐述,指的是AI系统建立关于环境运作方式的内部表征,从而能够预测行为的后果。在Solaris的语境下,世界模型理解UI元素之间的空间关系、交互逻辑和状态转换规则——例如点击下拉菜单应该展开选项列表,拖拽滑块应该改变对应的数值显示。这与Runway此前在视频生成领域积累的Gen-1、Gen-2、Gen-3系列模型有着深层的技术同源性,本质上都是条件序列生成问题:给定当前帧和一个条件(在视频中是文本描述,在Solaris中是用户操作),生成下一帧。只不过模拟的对象从物理世界变成了数字界面世界。该技术可能基于Vision Transformer架构,将UI截图作为视觉输入,用户操作作为条件输入,自回归地生成下一帧UI状态。Runway将这种视频帧预测的能力迁移到UI帧的生成上,开辟了一个全新的应用方向。
在官方评测中,71%的自然行为偏好投给了Solaris,意味着在对比测试中,大多数用户认为Solaris生成的界面响应比传统方法更符合直觉预期,显示出其在交互体验上的显著优势。不过,文字处理仍是它的短板。这一问题实际上是当前视觉生成模型的普遍瓶颈——文字的渲染需要像素级的精确性,每个字符的笔画、间距、字体都必须严格正确,而生成模型擅长的是语义层面的内容创作,在像素精确控制上存在天然的困难。这也是Stable Diffusion、DALL-E等图像生成模型长期面临的挑战,至今仍未完全解决。两者之间的精度差距说明当前的界面生成模型在细节精度上仍有提升空间,未来可能需要结合传统渲染引擎来解决文字等需要精确控制的元素。

在开发工具方面,Meta的MuseCode正式结束Beta测试,开始面向更复杂的工程任务,并开放了开发者预览SDK(Software Development Kit,软件开发工具包)。SDK是一套完整的开发工具集合,包含API库、文档、示例代码和调试工具,开发者可以基于SDK将MuseCode的AI能力集成到自己的开发环境和工作流中。该SDK支持自定义工具、流式进度反馈和恢复绘画等功能,同时产品还新增了阅读套餐。流式进度反馈(Streaming Progress)意味着开发者可以实时监控AI执行任务的中间状态——比如在AI重构一段复杂代码时,开发者可以看到每一步的修改过程而非等待最终结果一次性返回,这在处理耗时较长的复杂工程任务时尤为重要,既提升了用户体验也增强了对AI行为的可控性和可调试性。这一系列升级表明,Meta正在将其AI开发工具从实验阶段推向生产级应用,为开发者提供更完整的工程化支持,与GitHub Copilot、Cursor等AI编程工具形成更直接的竞争。当前AI编程工具市场正处于快速洗牌期,各家巨头都在争夺开发者生态的入口,因为谁赢得了开发者,谁就能在AI基础设施层面建立持久的竞争壁垒。
Google TimesFM 3发布:330M参数时序预测基础模型
研究前沿方面,Google发布了TimesFM 3,这是一个拥有330M参数的多变量预测模型。它在超过1万亿个时间点的数据上进行训练,能够在一次前向传播中联合预测多个目标,并输出9个概率分位数。

时间序列预测在金融风控、能源调度、供应链管理、气象预报等领域有着广泛应用。传统的时序预测方法包括ARIMA(自回归积分滑动平均模型)、Prophet(Facebook开源的时序预测工具)等统计模型和LSTM(长短期记忆网络)等深度学习方法,但这些模型通常需要针对特定数据集单独训练和调参,泛化能力有限。TimesFM 3的创新在于采用了基础模型(Foundation Model)的思路——正如GPT在海量文本上预训练后获得了通用的语言理解能力,TimesFM 3在超过1万亿个时间点的大规模异构数据(涵盖金融、零售、天气、交通等多个领域)上进行预训练,使其获得了跨领域的通用时序理解能力,无需为每个新场景从零训练。这种范式的核心创新在于将预训练-微调(pretrain-finetune)的范式从NLP领域迁移到时序分析中。传统时序预测的工作流是:为每个业务场景收集数据→选择模型→调参→部署,这个过程需要大量领域专家参与且难以规模化。基础模型范式则是:在海量异构时序数据上预训练一个通用模型→对新场景进行零样本或少样本预测。TimesFM系列的前身TimesFM 1.0于2024年发布,已在零样本预测(Zero-shot Forecasting)任务中展现出接近甚至超越专门训练模型的能力,与之同期的竞品还包括Amazon的Chronos、Salesforce的Moirai和IBM的Tiny Time Mixers等,这些模型共同推动了时序预测领域的"GPT时刻"。TimesFM 3在此基础上进一步增强了多变量联合预测的性能。
其多变量联合预测能力意味着它能够同时预测多个相互关联的指标(如同时预测某商品的价格、销量和库存),通过建模变量之间的协方差结构来捕捉协同变化关系,而非孤立地处理单个变量。这在实际业务中至关重要,因为现实世界中的指标往往相互影响——例如油价上涨会同时影响运输成本、商品零售价和消费者需求。9个概率分位数输出(如第5、10、25、50、75、90、95百分位等)采用了分位数回归(Quantile Regression)技术。分位数回归由Roger Koenker于1978年提出,与传统的均值回归(OLS)不同,它估计的是条件分布的特定分位数而非条件均值,无需假设误差的分布形式(如正态分布),能够自然地处理偏态分布和厚尾分布。相比简单的点预测或假设正态分布的置信区间,这种方法能够刻画非对称的不确定性分布,这在极端事件预测中尤为重要——在金融市场和极端天气预测中,收益和损失的分布通常是高度非对称的,传统的均值±标准差置信区间会严重低估尾部风险。决策者可以据此评估最乐观和最悲观的情景,这对于风险管理和资源规划具有重要的实际价值——例如供应链管理者可以根据第90百分位的需求预测来制定安全库存策略,确保在需求高峰时不会断货;而金融风控人员则可以关注第5百分位的收益预测来评估投资组合的下行风险(即VaR,在险价值)。
值得注意的是,330M的参数量相对于动辄数百亿参数的大语言模型来说非常轻量,其模型架构基于针对时序数据优化的Transformer结构,包含专门设计的时间位置编码和多尺度注意力机制。这种轻量化设计使其在边缘部署和实时预测场景中更具可行性——一张消费级GPU甚至CPU就能运行推理,极大降低了企业级时序预测的硬件门槛。TimesFM 3正在成为时序预测领域的新范式,推动这一领域从"一个场景一个模型"的碎片化状态迈向"一个基础模型通吃多场景"的统一范式。
总结
从DeepSeek V4视觉权重开源,到智谱营收的爆发式增长,再到OpenAI商业化的加速推进,9月1日的AI动态清晰地勾勒出行业的两条主线:一方面是技术能力的持续突破,多模态、界面生成、时序预测等方向百花齐放;另一方面是商业化探索的全面提速,但高增长与高亏损并存的局面,也提醒着行业参与者们,AI的规模化盈利之路仍需时间验证。开源与闭源两种路线在技术扩散和商业变现上各有优劣——开源路线通过社区力量加速技术迭代和生态建设,但面临直接变现困难;闭源路线则更容易构建商业护城河,但可能在技术迭代速度上落后于开源社区的集体智慧。而如何平衡技术投入的长期价值与短期财务压力,将持续考验每一家AI公司的战略定力。
相关推荐

对抗AI代码腐化:规格、结果笔记与文件清单的实战方法
一位开发者用八个月、650次提交、4.3万行代码的实战,总结出防止AI智能体代码库腐化的方法:前置规格与验收标准、任务结果笔记、文件清单约束,以及用触发式钩子取代规则文件。核心洞察是——指令只是建议,机制才能在长会话中存活。

"Tokens Exhausted":一段机器人视频背后的AI焦虑
一段名为「Tokens Exhausted」的机器人视频在 Reddit 引发热议,网友已分不清它是否为波士顿动力真实作品。本文解析这段AI讽刺内容为何戳中神经,以及它折射出的合成媒体与LLM时代焦虑。

4千美元淘到全新DGX Spark:本地部署大模型的性价比之选
一位Reddit用户以4000美元在Craigslist淘到全新DGX Spark,用于本地托管AI模型。本文解析这笔交易背后的性价比、二手交易安全,以及本地部署大模型的兴起趋势。