DeepSeek开源V4多模态视觉模型,国产AI生态全面提速

DeepSeek发布V4系列首款多模态视觉模型
8月3日,DeepSeek在HuggingFace上开源了V4系列的首款实验性多模态视觉模型——DeepSeek-V4-Flash-Vision-Exp。这是DeepSeek V4架构进入多模态领域的重要一步,标志着国产大模型在视觉理解能力上迈出了实质性进展。
从技术规格来看,该模型采用MoE(混合专家)架构,总参数约305B,但每个Token仅激活约13B,激活率控制在约4.6%的极低水平。MoE是一种稀疏激活的神经网络架构设计——传统密集模型在推理时需要激活全部参数,而MoE架构将模型内部划分为多个"专家"子网络,每次推理时通过门控(Gating)机制只选择少数专家参与计算。这意味着模型可以拥有极大的总参数量(从而具备更强的知识容量和表达能力),但实际推理时的计算量仅相当于一个小模型。Google的Switch Transformer是早期推动MoE大规模应用的里程碑工作,而DeepSeek从V2开始就将MoE作为核心架构策略。这种设计延续了DeepSeek一贯的高性价比路线——通过稀疏激活的方式,在保持大参数规模带来能力上限的同时,大幅降低实际推理时的计算开销。
架构设计与训练方式
该模型基于V4 Flash架构,在此基础上叠加视觉模块,通过持续训练(continued training)获得图像理解能力。持续训练是指在已经充分预训练好的基础模型之上,注入新模态(如视觉)的数据继续进行训练,使模型获得跨模态理解能力。与从零开始训练一个多模态模型相比,这种方式能够充分复用语言模型已有的推理能力、世界知识和指令遵循能力,同时大幅降低训练成本。典型的实现路径包括:在语言模型前端接入视觉编码器(如ViT),通过投影层将图像特征映射到语言模型的嵌入空间,再用图文配对数据进行对齐训练。LLaVA、Qwen-VL等主流多模态模型均采用了类似路径。这种"文本底座+视觉增量训练"的方式,是当前多模态大模型的主流做法,能够在成熟的语言模型基础上快速扩展跨模态能力。
据官方披露,其多模态Agent能力已接近GPT-4级别(原文提及"接近OPIS 4.8",推测指代同代闭源模型的视觉能力水平),这对于一个实验性开源模型而言是相当有竞争力的表现。
MIT许可:完全开放的开发者生态
值得关注的是许可协议——DeepSeek采用MIT许可开放权重。MIT许可是开源软件领域最为宽松的许可协议之一,由麻省理工学院制定,仅要求保留版权声明和许可声明,对使用方式几乎没有限制——允许商业使用、修改、分发、私人使用,且不要求衍生作品以相同协议开源(这一点区别于GPL等Copyleft协议)。在大模型领域,许多开源模型采用的是附带限制条款的定制协议(如Meta的Llama协议限制月活超7亿的企业),而MIT许可则意味着任何规模的企业和个人都可以无障碍地将模型用于商业产品。此外,官方同步提供了Tensor与Tokenizer的参考实现,以及最小化的PyTorch推理代码,开发者可以直接在本地完成部署与定制开发。
这种"权重+参考实现+最小推理代码"的完整交付方式,极大降低了开发者上手门槛,也进一步巩固了DeepSeek在开源社区的号召力。对于希望构建多模态Agent应用的团队来说,这提供了一个可控、可商用的国产底座选择。
国产算力与基础设施加速协同
除了模型层面的突破,当天的产业动态也显示出国产AI基础设施正在多个环节形成合力。
软硬协同优化:沙箱调度性能大幅提升
海光信息宣布联合腾讯云开源项目Cube Sandbox完成深度适配调优。基于海光C86 CPU,从应用架构、微服务链路到Linux内核调度进行全栈软硬协同优化,重点解决了高并发MicroVM沙箱调度抖动、长尾延迟、跨NUMA内存访问延迟三大痛点。
MicroVM(微虚拟机)是一种轻量级虚拟化技术,代表性实现包括AWS的Firecracker。与传统虚拟机相比,MicroVM的启动时间可压缩到毫秒级,内存开销极小,非常适合用于Serverless函数计算和AI Agent的安全隔离执行环境。然而在高并发场景下,大量MicroVM的调度会产生"抖动"问题——即某些实例的响应延迟出现不可预测的突增。NUMA(Non-Uniform Memory Access,非一致性内存访问)是多路服务器的内存架构特征,CPU访问本节点内存比跨节点内存快得多,跨NUMA访问会引入显著的额外延迟。海光与腾讯云的联合优化正是针对这些底层系统级瓶颈进行深度调校,使国产CPU在AI基础设施场景中达到生产可用的稳定性水平。

这一优化为政务、金融、能源等行业的AI Agent国产化落地提供了更稳定的基础设施支撑。随着Agent应用逐渐进入生产环境,沙箱隔离与调度性能成为绑不开的工程难题,软硬协同的深度优化正是应对之道。
政策端释放确定性采购需求
工信部办公厅发布了人工智能应用服务商培育专项行动通知,明确要加大对大模型、智能体、Token等服务的采购力度。通知提出到2026年底建成超200家服务商资源池,并支持对接国家算力枢纽。
这一政策为云厂商打开了政企AI采购的确定性需求窗口,意味着国产大模型和算力将获得更明确的商业化落地场景。
云厂商与算力枢纽持续演进
在国际厂商方面,AWS宣布基于第五代自研芯片Graviton5的EC2 R9G内存优化实例正式可用。Graviton是AWS自研的基于Arm架构的服务器处理器系列,自2018年首代发布以来已迭代至第五代,Arm架构相较传统x86架构在能效比上具有天然优势,AWS通过自研芯片实现了对Intel/AMD的差异化竞争。相较Graviton3的R8G,R9G的计算性能提升最高25%,数据库性能提升30%,Web应用提升35%,机器学习提升35%,并首次引入经形式化验证的Nitro Isolation Engine。所谓"形式化验证"意味着其安全隔离逻辑通过数学证明方式确认了正确性,而非仅依赖测试覆盖,这在云计算安全领域代表了最高级别的验证标准。R9G还额外配备本地NVMe SSD。
国内方面,据报道位于天津武清的中国电信京津冀智能算力中心,是电信在该区域规模最大、技术最先进的绿色智能算力枢纽,可提供约3.76 EFLOPS的国产高性能算力。EFLOPS即ExaFLOPS(每秒百亿亿次浮点运算),是衡量超大规模算力的单位——作为参考,2024年全球排名第一的超级计算机Frontier的峰值性能约为1.7 EFLOPS,3.76 EFLOPS的规模相当可观。该中心以自主可控算力网打造"北京1毫秒、环京2毫秒"的低时延服务圈。"1毫秒时延圈"的概念源自数据中心选址策略——光纤中光信号传播约200公里/毫秒,1毫秒时延圈大致覆盖距数据中心100公里半径的区域,这对于实时AI推理、金融交易等延迟敏感型应用至关重要。
华为云在世博会期间也披露了贵安数据中心的数据——作为华为全球最大数据中心,占地1521亩,规划容纳100万台服务器,年均PUE压到1.1。PUE(Power Usage Effectiveness,电能使用效率)是衡量数据中心能效的核心指标,计算方式为数据中心总用电量除以IT设备用电量,理想值为1.0,工业界平均水平约1.5-1.6,1.1的年均PUE属于业界顶尖水平。华为通过iCooling AI智能温控系统预测热负载并实时调整制冷参数,同时利用贵州地区年均气温较低的地理优势实现自然冷却,最终达成年减碳81万吨——相当于种植约4500万棵树的碳吸收量。在全球数据中心碳排放占总排放约2-3%的背景下,绿色算力已成为行业刚性约束。

AI武器化:网络安全威胁的新形态
值得警惕的是,AI能力的普及也正在被攻击者滥用。
攻击者借助AI编码助手实施勒索攻击
据报道,俄语背景的勒索软件团伙利用AI编码助手(原文提及Cursor及底层Anthropic Claude)进行攻击规划与实战,用俄语编排攻击计划,并主动排除CIS范围目标。CIS(独立国家联合体)排除策略是俄语背景勒索团伙的典型特征——他们通常检查系统语言设置,如果检测到俄语或CIS国家语言则自动退出,以避免引起本国执法机构的注意。这种模式化的攻击特征本身也成为安全研究人员溯源归因的重要线索。同一趋势下,还出现了用AI构建整套攻击作业的工具包。

生成式AI被用于网络攻击主要体现在几个环节:攻击规划阶段,攻击者使用AI编码助手自动生成攻击脚本、编排攻击流程;社会工程阶段,AI生成高度定制化的钓鱼邮件和话术;自动化漏洞利用阶段,AI辅助分析目标系统并生成exploit代码。这反映出一个令人不安的现实:生成式AI正在降低网络攻击的技术门槛,使得攻击者能够更快速、更规模化地构建攻击链路。
防御理念的根本转变
面对新型威胁,Cloudflare发布了新的Bot检测引擎Adaptive Intelligence,其核心理念从"筑墙挡住攻击者"转向"让攻击变慢、变贵到不值得跑"。这一理念源自攻防经济学——攻击者也有成本(计算资源、时间、人力),如果防御方能持续提高攻击的边际成本,使其超过攻击收益,攻击者将理性地转向其他目标。
该引擎的核心机制是"规则瞬态化"——通过持续重训练的ML模型随时生成并丢弃检测规则,使攻击者无法通过长时间观察来逆向工程防御逻辑,从受保护流量中学习,以此消除攻击者赖以适应的稳定反馈信号。该引擎日均分析超1万亿请求——Cloudflare处理的流量约占全球互联网流量的20%以上,这为其ML模型提供了无可比拟的训练数据优势。

此外,还有中国关联的网络间谍组织将行动扩展到Cisco IOS XE路由器,把网络设备变成流量采集与凭证窃取平台;以及借国产桌面工具广告软件签名进行DLL侧加载的攻击手法出现。DLL侧加载(DLL Side-Loading)是一种利用Windows程序加载动态链接库机制的攻击技术——当合法程序启动时,Windows按照特定搜索顺序查找所需的DLL文件,攻击者将恶意DLL放置在优先搜索路径中,使合法程序在启动时无意中加载恶意代码。由于恶意DLL是通过受信任的、具有合法数字签名的程序加载的,许多安全软件会将其视为正常行为而放行,利用国产桌面工具的广告软件签名更进一步增加了检测难度。这些案例共同说明,AI时代的攻防对抗正在进入一个动态博弈的新阶段。
结语
从DeepSeek开源多模态视觉模型,到国产算力软硬协同、政策端需求释放,再到AI被武器化带来的安全挑战,这一天的技术动态勾勒出AI产业发展的多个侧面。模型能力的开放与普惠,正在同时催生新的产业机会与新的安全风险,如何在两者之间取得平衡,将是未来行业持续面对的课题。
相关推荐

无障碍主题CAD黑客松:3天设计挑战赛全解析
深入解析The CAD Challenge无障碍辅助设备设计黑客松,涵盖比赛规则、参赛准备建议、CAD建模工具推荐及3D打印设计要点,帮助工业设计爱好者和创客快速了解这场以社会公益为导向的三维建模挑战赛。

苹果新Mac四款齐发:从桌边智能体到本地大模型工作站全拆解
苹果发布四款新Mac,从899美元Mac mini到5499美元Mac Studio Ultra,构建完整本地AI价格阶梯。本文从内存账本、性能瓶颈、产品分层三个维度,拆解苹果对本地AI的判断,分析每一档Mac适合跑多大的模型。

DeepSeek V4首个多模态模型开源:305B权重MIT协议全放开
DeepSeek深夜开源V4-Flash-Vision-Exp多模态视觉模型,305B参数以MIT协议完全开放。基于V4-Flash架构扩展视觉能力,在Agent's Last Exam等三项基准反超Opus 4.8,支持截图解析、图表理解与工具调用。