[控场AI]
模型DeepSeek V3 / DeepSeek V4 Pro / DeepSeek V4-Pro

DeepSeek V4

DeepSeek V4是由DeepSeek发布的大规模语言模型,采用混合专家(MoE)架构,具备在推理时仅激活部分参数的稀疏计算特性。该模型在编程、数学推理及智能体(Agent)任务等领域表现突出,属于开源大语言模型系列,支持多种通用自然语言处理与生成任务。

核心事实

时间轴 (近 90 天)

9月11日

读取2个GitHub项目、2个本地项目并编写2个小游戏的实测消耗为1.2元

待验证50%
9月11日

DeepSeek V4的成本数据基于8月17日之前的定价,之后价格可能上调

待验证50%
9月11日

DeepSeek发布了V4的首个视觉版本权重,模型规模达305B(约3050亿参数),并同步提供最小推理实现

待验证50%
9月10日

DeepSeek V4视觉版官方部署要求需要4张NVIDIA GB300显卡才能支撑完整推理服务

待验证50%
9月10日

DeepSeek发布了V4的首个视觉版本权重,模型规模达到305B(约3050亿参数)

待验证50%
9月1日

DeepSeek Harness在V0.1.1版本中正式加入对V4多模态模型的支持,以及Files文档存储系统功能

待验证50%
7月7日

文中提及 DeepSeek V4 Pro 是可选的底座模型版本,效果更佳

已过期65%

全部知识事实 (16)

已验证

DeepSeek-V4-Pro是DeepSeek推出的最新旗舰级大语言模型

90%
已验证

DeepSeek V4在编程、数学推理和多语言理解方面表现突出

80%
已验证

通过修改Claude Code的连接配置,可以将后端模型从Claude替换为DeepSeek V4

65%
待验证

DeepSeek V4采用MUON优化器替代AdamW进行训练

85%
待验证

DeepSeek V4引入了流形约束超链接(Manifold-constrained Hyperconnection,MHC)作为对传统残差连接的升级方案

85%
待验证

DeepSeek V4采用了MoE(Mixture of Experts,混合专家)架构

75%
待验证

原来跑百万上下文需要10张H20级别的显卡,DeepSeek V4现在1-2张就够了

75%
待验证

DeepSeek V4已与升腾(华为)和寒武纪等国产硬件厂商展开深度合作

75%
待验证

DeepSeek V4的成本数据基于8月17日之前的定价,之后价格可能上调

50%
待验证

读取2个GitHub项目、2个本地项目并编写2个小游戏的实测消耗为1.2元

50%
待验证

DeepSeek V4视觉版官方部署要求需要4张NVIDIA GB300显卡才能支撑完整推理服务

50%
待验证

使用DeepSeek V4 API按日常使用强度估算,每月费用通常在5-20元人民币之间

50%
待验证

DeepSeek发布了V4的首个视觉版本权重,模型规模达305B(约3050亿参数),并同步提供最小推理实现

50%
待验证

DeepSeek发布了V4的首个视觉版本权重,模型规模达到305B(约3050亿参数)

50%
待验证

DeepSeek Harness在V0.1.1版本中正式加入对V4多模态模型的支持,以及Files文档存储系统功能

50%
待验证

DeepSeek V4模型原本预计在3月发布,但已推迟到更晚时间

80%

来源文章