[控场AI]
· 5 分钟阅读· 2,796 字

Mistral Large 4发布:欧洲万亿参数开源模型剑指GPT与Claude

Mistral Large 4发布:欧洲万亿参数开源模型剑指GPT与Claude

Mistral发布1.05万亿参数开源模型Large 4,以五分之一的竞品价格搅动全球AI市场格局。

法国AI实验室Mistral在阿布扎比发布了旗舰开源模型Mistral Large 4(绰号"Le Chonc"),总参数约1.05万亿,采用混合专家(MoE)架构,每token仅激活约490亿参数,在保持超大容量的同时大幅降低推理成本。模型支持多模态输入与100万token超长上下文,使用约3800块NVIDIA Blackwell芯片在欧洲本土训练。最具冲击力的是其定价策略:输出价格约为GPT-6.1和Gemini竞品的五分之一,直接加剧AI价格战。性能方面,官方数据显示其在软件工程、视觉定位及法律金融任务上表现不俗,但宣传口径为"美欧最佳开源权重模型"而非全球最佳,独立验证仍需等待10月底权重开放后进行。

欧洲的"大块头":Le Chonc登场

法国AI实验室Mistral于10月6日在阿布扎比举行的AI Everything大会上,由CEO Arthur Mensch正式发布了Mistral Large 4公开预览版。这款模型因其庞大的体量获得了"Le Chonc"(大块头)的昵称——约1.05万亿参数的规模,让它一跃成为欧洲在大模型竞赛中最具分量的回应。

但真正的看点并非单纯的参数堆砌,而在于它背后的架构选择与定价策略。对于OpenAI等头部玩家来说,后者可能才是最该警惕的信号。

混合专家架构:万亿参数的"省电"玄机

Mistral Large 4采用的是混合专家(Mixture of Experts, MoE)架构。虽然模型总参数量高达1.05万亿,但每处理一个token时,只有约490亿参数会被激活。

混合专家模型:每个token仅激活约490亿参数

可以把它理解为一支庞大的专家团队,面对每个问题时只唤醒最对口的几位专家来回答。这种设计让模型在保持超大容量的同时,大幅降低了实际推理成本,这也为后面的激进定价埋下伏笔。

在能力层面,该模型支持多模态输入,既能读文本也能理解图像,并且官方宣称可处理高达100万token的上下文长度。据相关报道,整个模型是在Mistral位于欧洲本土的数据中心、使用约3800块NVIDIA Blackwell芯片从零训练而成——这一"欧洲土壤"属性在当下的AI主权讨论中颇具象征意义。

混合专家(MoE)架构的核心思想源自1991年Jacobs等人提出的"专家混合"理论,近年被Google、Meta等头部机构大规模应用于大语言模型。其基本原理是将模型的前馈网络层拆分为多个"专家"子网络,并引入一个轻量级的"路由器"(Router)网络,负责为每个输入token动态选择激活哪几位专家(通常为Top-K选取,K远小于专家总数)。这样一来,模型的"知识容量"由全部专家的参数总量决定,而实际计算量仅取决于被激活的少数专家,从而实现了"参数量大、算力消耗低"的平衡。Google的Gemini 1.5、Meta的Llama 3系列以及DeepSeek广告系列均采用了类似设计。MoE的主要挑战在于负载均衡——若路由器总是偏向同一批专家,部分专家将长期闲置,因此实际训练中需要引入辅助损失函数来鼓励专家均匀分工。

价格才是真正的杀手锏

如果说参数和架构是技术层面的亮点,那么定价则是直接冲击市场格局的武器。

输出价格约为竞品的五分之一

在预览阶段的定价中,Mistral列出的价格约为每百万输入token 0.68美元,输出token约2.09美元。作为对比,视频中提及的GPT-6.1 Sol和Gemini 4 Argon的输出价格分别处于2美元和10美元的区间。这意味着Mistral的输出价格大约只有竞品的五分之一。

即便按部分渠道显示的更高"标价"(输出接近4美元)计算,也仍不到竞品价格的一半。结合此前已经打响的AI价格战,Mistral显然是带着明确的价格策略强势入场。

AI大模型的API定价通常以"每百万token"为计量单位,分别对输入(prompt)和输出(completion)分开收费,输出价格普遍高于输入,因为生成每个token需要逐步进行自回归推理,计算开销更大。价格战的深层驱动力来自两端:一是MoE等架构创新持续压低单token推理成本;二是开源模型的扩散使自托管成为可行的替代方案,迫使闭源厂商跟进降价以保留客户。2024年以来,OpenAI、Anthropic、Google均多次大幅下调旗舰模型的API定价,业界将这一趋势称为"token价格的摩尔定律"——即大模型的使用成本大约每一到两年下降一个数量级。Mistral此次的激进定价,正是在这一背景下进一步加速了这一趋势。

性能表现:官方数据与保留态度

那么,便宜之外它是否真的够强?根据Mistral自己给出的数据:

  • 在真实软件工程测试DeepSwee上得分约62%;
  • 在视觉定位(visual grounding)任务上以42%对41%的微弱优势略胜GPT-6 Astra;
  • 第三方测试显示其在法律和金融任务上的表现超过Astra。

第三方测试称其在法律与金融任务上超越Astra

不过有两点需要冷静看待。其一,Mistral的核心宣传语是"美国或欧洲最佳开源权重模型",而非"整体最佳模型"——这个限定词本身就划定了比较范围。其二,这些跑分大多来自Mistral自家测试,在独立第三方评测结果出炉前,仍应保持观望。

开源竞赛的全球格局

把视野放大到整个开源大模型赛道,会发现一个耐人寻味的现实:目前体量最大的几个开源模型其实来自中国。据视频梳理,DeepSeek V4 Pro约为1.6万亿参数,Kimi K3更是达到约2.8万亿参数。

Le Chonc是欧洲给出的答案

在这样的背景下,Le Chonc被定位为"欧洲的答案"——一个诞生于欧洲本土的大型开源模型。Mistral表示,模型权重将在10月底、经过更多红队(red team)安全测试后开放下载,应用方向瞄准软件、金融、法律和网络防御等领域。

文中提到的"红队"(Red Team)测试是AI安全领域的标准前置流程,借鉴自网络安全行业。具体做法是组织一批内部或外部测试人员,以攻击者视角主动尝试让模型输出有害内容、绕过安全护栏或泄露训练数据,从而在公开发布前发现并修补潜在风险点。随着欧盟《人工智能法案》(AI Act)对高风险AI系统提出强制合规要求,红队测试在欧洲AI公司的发布流程中正变得愈发制度化。Mistral选择在权重开放前完成更多红队测试,也是在兼顾开源透明度与监管合规之间寻求平衡的体现。

当开源模型变得足够强,会发生什么?

这正是当前整个AI行业激烈争论的核心问题。当顶级开源模型在性能上逼近闭源旗舰,同时价格只有后者的几分之一,并允许用户直接下载权重,市场的议价逻辑和竞争格局都将被重新改写。

对开发者和企业而言,这意味着更低的成本门槛和更高的部署自主权;而对以API收费为核心商业模式的厂商来说,则是实实在在的压力。Mistral Large 4能否兑现其宣传中的性能,仍需等待权重开放后的独立验证,但它所代表的"开源+低价+主权"组合拳,已经为这场竞赛注入了新的变量。

分享:

相关推荐