DeepSeek V4是由DeepSeek发布的大规模语言模型,采用混合专家(MoE)架构,具备在推理时仅激活部分参数的稀疏计算特性。该模型在编程、数学推理及智能体(Agent)任务等领域表现突出,属于开源大语言模型系列,支持多种通用自然语言处理与生成任务。
GPT-4、Claude 3.5、DeepSeek-V3等新一代模型的指令跟随能力和上下文理解能力大幅提升,使复杂提示词模板变得不再必要
DeepSeek发布了V3.2版本模型,在多项基准测试中追平Gemini 3.0 Pro
开源模型此前在绝对性能上通常落后闭源模型一到两个代际,DeepSeek-V3.2正在改写这一格局
DeepSeek-V3.2完整部署通常需要多张高端GPU(如NVIDIA A100/H100)组成的集群
DeepSeek-V3.2在Agent基准测试(如BFCL、τ-bench等)上取得突破性表现
DeepSeek-V3在多项评测中性能超越了通义千问2.5和Llama 3.1等开源模型
DeepSeek-V3的训练成本仅为GPT的二十分之一
DeepSeek-V3以极具竞争力的价格提供了接近一线模型的性能
DeepSeek-V3 的输入 Token 价格仅为 ¥1/百万 Token(缓存命中时更低)
DeepSeek-V3采用了混合专家架构(MoE),总参数量达6710亿,但每次推理仅激活约370亿参数
还有 14 条时间轴事件
DeepSeek-V4-Pro是DeepSeek推出的最新旗舰级大语言模型
90%已验证DeepSeek V4采用混合专家模型(MoE)架构
90%待验证DeepSeek V4采用MUON优化器替代AdamW进行训练
85%待验证使用Claude Code + DeepSeek V4开发的C++浏览器可执行文件仅约200KB(动态链接模式)
85%待验证DeepSeek V4引入了流形约束超链接(Manifold-constrained Hyperconnection,MHC)作为对传统残差连接的升级方案
85%待验证该逆向项目的长期目标是对接DeepSeek V4等国产大模型,打造基于国产生态的AI编程工具
80%待验证AI Agent首次生成的浏览器核心代码仅约86行即可正常加载网页
80%待验证DeepSeek V4模型原本预计在3月发布,但已推迟到更晚时间
80%已验证DeepSeek V4在编程、数学推理和多语言理解方面表现突出
80%待验证DeepSeek V4采用了MoE(Mixture of Experts,混合专家)架构
75%待验证DeepSeek V4系列包含多个变体(如Fresh、Pro、Fancy),分别针对不同使用场景进行了优化
75%待验证DeepSeek V4已与升腾(华为)和寒武纪等国产硬件厂商展开深度合作
75%待验证原来跑百万上下文需要10张H20级别的显卡,DeepSeek V4现在1-2张就够了
75%已验证DeepSeek V4的API兼容了Anthropic的Messages API接口协议,允许原本为Claude设计的工具链无缝切换到DeepSeek的模型服务
70%待验证开发者已经成功将DeepSeek V4等第三方模型通过CCX桥接方式接入OpenAI的Codex桌面应用
70%待验证Claude Code配合DeepSeek V4可以让开发者从写代码的程序员转变为下达任务的项目经理角色
70%待验证DeepSeek V4的核心创新包括对MoE(混合专家)架构的持续优化和对训练流水线的深度工程调优
70%已验证通过修改Claude Code的连接配置,可以将后端模型从Claude替换为DeepSeek V4
65%已验证DeepSeek V4采用MIT开源协议,允许商业使用
65%待验证DeepSeek V4选择不使用N-gram技术,放弃了此前在V3/R1中探索过的Multi-token Prediction结合N-gram的方案
60%