DeepSeek V4首个多模态模型开源:305B权重MIT协议全放开

DeepSeek再度深夜炸场
8月31日深夜,DeepSeek在Hugging Face悄然上线了DeepSeek V4-Flash-Vision-Exp,这是V4系列的首个实验性多模态视觉模型。与以往不同的是,本次发布不仅带来了架构层面的突破,更以MIT协议完全开放——总参数量高达305B的模型权重全部可供自由使用、修改和商用,这在当前头部大模型普遍收紧开源尺度的背景下显得格外引人注目。
MIT协议是由麻省理工学院制定的一种极简开源许可证,其核心条款仅要求在再分发时保留原始版权声明和许可说明,除此之外对使用、复制、修改、合并、发布、分发、再许可和销售几乎不设任何限制。相比之下,GPL协议要求衍生作品也必须开源(即"传染性"条款),Apache 2.0则增加了专利授权和商标使用的相关规定。在大模型领域,许多厂商虽然标榜"开源",但实际采用的往往是自定义许可证——例如Meta的Llama系列对月活超过7亿的商业使用设有限制。DeepSeek选择MIT协议意味着任何企业或个人均可无条件地将这一305B模型用于商业产品,这在当前头部模型中极为罕见。

从命名上不难看出,这是一个带有"Exp"(Experimental,实验性)标记的版本。DeepSeek选择将实验性模型直接开源,某种程度上表明了其"边研发边共享"的技术路线——不等到产品完全成熟,而是让社区尽早参与到迭代和验证中来。
305B参数规模与48个权重分片
此次开源的模型总参数达到305B,采用了48个权重分片(weight shards)的形式进行分发。权重分片是指将大型神经网络的参数文件拆分成多个较小文件进行存储和分发的技术。对于305B参数规模的模型,若以FP16精度存储,其权重文件总大小约为610GB,单个文件显然无法被高效传输和加载。通过拆分为48个分片,每个分片约12-13GB,不仅便于网络下载时的断点续传和并行传输,更关键的是能够适配张量并行(Tensor Parallelism)和流水线并行(Pipeline Parallelism)等分布式推理策略。在实际部署中,不同的分片可以被分配到不同的GPU上,每张显卡只需加载部分权重即可参与推理,从而让高端多卡服务器(如8×H100集群)能够高效运行完整模型。

值得一提的是,DeepSeek还随权重附带了一份覆盖视觉编码器和MoE结构的最小化PyTorch推理实现。这里的MoE(Mixture of Experts,混合专家)是一种稀疏激活的神经网络架构,其核心思想是将模型的前馈网络层替换为多个"专家"子网络,并通过一个门控网络(Gating Network)在每次推理时动态选择少量专家进行计算。例如,一个拥有256个专家的MoE模型可能在每个token处理时只激活其中8个专家,这意味着虽然模型总参数量高达305B,但实际推理时的活跃参数量可能仅为总量的几分之一,通常在30-60B左右。这种设计使得MoE模型在保持大参数带来的知识容量优势的同时,推理成本远低于同等规模的密集模型。DeepSeek从V2版本开始便深度投入MoE架构研究,其DeepSeekMoE架构引入了细粒度专家分割和共享专家机制,被认为是当前最高效的MoE实现之一。
这份参考代码让研究者能够快速理解模型的内部机制,也为二次开发和定制化改造提供了清晰的起点。相比只放出权重、不提供推理代码的"半开源"做法,DeepSeek的这一举措显得更加诚意十足。
基于V4-Flash架构的视觉能力扩展
从技术路径来看,V4-Flash-Vision-Exp并非从零训练的全新模型,而是基于V4-Flash架构,加入视觉模块后继续训练得到的产物。这种在成熟文本基座上叠加视觉能力的做法,既能复用已有的语言理解和推理能力,又能以相对较低的成本获得多模态感知能力。
多模态大模型要实现"看懂图片"的能力,核心组件是视觉编码器(Vision Encoder)。当前主流方案通常采用预训练的ViT(Vision Transformer)作为视觉编码器,将输入图像切分为固定大小的图块(patch),通过Transformer层提取视觉特征,然后经过一个投影层(Projection Layer)将视觉token映射到与文本token相同的嵌入空间中,使语言模型能够像处理文本一样处理视觉信息。这种"在成熟文本基座上叠加视觉能力"的路线由LLaVA等早期工作验证了可行性,其优势在于语言模型已有的知识和推理能力几乎不受影响,视觉能力以增量方式引入。然而挑战在于训练过程中需要精心平衡视觉和语言两个模态的学习率和数据配比,否则容易出现"灾难性遗忘"——即新能力的获取导致旧能力退化。

具体而言,该模型能够读取截图、解析图表,并进一步结合工具调用来完成多模态Agent任务。AI Agent(智能体)是当前大模型应用的重要方向,其核心思想是让模型不仅生成文本回答,更能自主规划任务步骤、调用外部工具、观察执行结果并迭代调整。工具调用(Tool Calling / Function Calling)是Agent能力的关键基础设施,模型通过结构化输出来触发API调用、代码执行、网页浏览等外部操作。在多模态Agent场景中,视觉能力带来了全新的交互维度:模型可以通过截图理解当前界面状态(如GUI Agent),通过读取图表获取数据进行分析,或通过观察物理环境来规划操作。
这意味着它不仅仅是"看懂图片",更能将视觉信息纳入到复杂的任务执行链路中——例如观察界面截图后自主操作、读取数据图表后进行分析决策等。这类将视觉信息融入Agent"感知-思考-行动"循环的能力,正是当前AI Agent走向实用化的关键一环。
基准测试表现:三项成绩反超Opus 4.8
性能方面,官方公布的基准数据颇具看点。在Agent's Last Exam、ZeroBench、DeepSWE三项测试中,V4-Flash-Vision-Exp的成绩反超了Opus 4.8。
这三项基准测试各有侧重:Agent's Last Exam是一项综合性Agent能力评测,要求模型完成多步骤、跨工具的复杂任务;ZeroBench聚焦于零样本视觉推理能力,测试模型在未见过的任务类型上的泛化表现;DeepSWE则面向软件工程场景,评估模型理解代码仓库、定位Bug并生成修复方案的能力。Opus 4.8是Anthropic Claude系列中定位最高端的模型,以强大的长文本理解和复杂推理能力著称,其API定价也是行业最高之列。一个开源模型在这三项测试中反超顶级闭源模型,标志着开源与闭源之间的能力差距正在被快速缩小,尤其是在Agent这一被认为是闭源模型"护城河"的领域。

另一边,官方也指出,该模型在纯文本Agent能力上与V4-Flash基本持平。这一点值得关注:加入视觉模块并继续训练后,模型的原有文本能力并未出现明显退化,这说明视觉能力的引入是"增量式"的,而非以牺牲语言能力为代价。从技术角度来看,这意味着DeepSeek在训练过程中成功避免了"灾难性遗忘"问题——即模型在学习新任务时丢失已有能力。这通常需要在训练数据中维持一定比例的纯文本数据(即数据回放),并对视觉相关模块和语言主干网络采用差异化的学习率策略。对于希望统一部署单一模型来处理文本与多模态任务的团队来说,这是一个相当理想的特性。
MIT协议开源的深远意义
DeepSeek此番以MIT协议开放305B多模态权重,其影响可能超出模型本身的技术指标。MIT作为最宽松的开源许可之一,几乎不设商用限制,这为下游厂商、研究机构乃至个人开发者打开了极大的想象空间。在实际产业链中,这意味着云服务商可以直接将其封装为API产品,硬件厂商可以将其适配到自有芯片平台上,初创公司可以在此基础上训练垂直领域的专用模型,而这一切都无需与DeepSeek进行任何形式的授权谈判。
不过也需保持理性看待:一方面,"Exp"标记提醒我们这仍是实验性版本,稳定性、鲁棒性以及在真实生产环境中的表现仍有待社区的广泛验证;另一方面,305B的参数规模对本地部署提出了不小的算力要求——即便借助MoE架构的稀疏激活特性降低了实际计算量,模型权重仍需全部加载到显存中,这意味着至少需要多张高端GPU组成的集群才能完成推理,普通用户想要完整跑通仍存在门槛。
无论如何,DeepSeek持续以高强度、高开放度的节奏推进模型迭代,正在为整个开源大模型生态注入新的活力。V4-Flash-Vision-Exp的发布,或许正是V4系列多模态能力全面铺开的序章。
相关推荐

无障碍主题CAD黑客松:3天设计挑战赛全解析
深入解析The CAD Challenge无障碍辅助设备设计黑客松,涵盖比赛规则、参赛准备建议、CAD建模工具推荐及3D打印设计要点,帮助工业设计爱好者和创客快速了解这场以社会公益为导向的三维建模挑战赛。

苹果新Mac四款齐发:从桌边智能体到本地大模型工作站全拆解
苹果发布四款新Mac,从899美元Mac mini到5499美元Mac Studio Ultra,构建完整本地AI价格阶梯。本文从内存账本、性能瓶颈、产品分层三个维度,拆解苹果对本地AI的判断,分析每一档Mac适合跑多大的模型。

DeepSeek开源V4多模态视觉模型,国产AI生态全面提速
DeepSeek开源V4-Flash-Vision-Exp多模态视觉模型,305B参数MoE架构仅激活13B,MIT许可自由商用。同期国产算力协同、政策采购加码、AI安全攻防升级,国产AI产业链多线并进。