[控场AI]
模型DeepSeek Pro / 深度求索 / DeepSeek公司

DeepSeek

DeepSeek是由深度求索公司开发的大语言模型系列,具备自然语言理解与生成、代码编写、逻辑推理等核心能力。该系列模型以高性能与高效率为主要特征,支持多种自然语言处理任务,包括对话、问答、文本摘要及复杂推理,面向研究与商业应用场景提供开放或闭源版本。

核心事实

时间轴 (近 90 天)

9月14日

DeepSeek、通义千问和GLM三个项目均将模型权重完全公开发布,允许任何机构下载、微调和商业部署

待验证50%
9月13日

原帖认为DeepSeek及其他中国实验室正在无情地压低推理成本,这将使OpenAI和Anthropic难以收回在打造顶级模型上的巨额投入

待验证50%
9月13日

DeepSeek发布了DeepSeek-V4.1-Flash,该方法对KV缓存所需内存进行了大幅压缩

待验证50%
9月12日

原帖作者认为低价模型将请求转发给成本更高的Claude在经济上说不通

待验证50%
9月12日

近年来国产大模型的开源节奏明显加快,从阿里的 Qwen 系列到 DeepSeek 再到 Moonshot 的 Kimi K2

待验证50%
9月12日

Qwen 系列和 DeepSeek 均提供了允许商业使用的宽松开源协议

待验证50%
9月12日

Qwen、DeepSeek、MiniMax、Gemma 以及基础版 Llama 通过提示词工程都能达到接近专门微调的拟人化效果

待验证50%
9月12日

DeepSeek 发布了 v4.1-Flash 模型,采用被描述为「novel causal Encoder–Decoder」(新颖的因果编码器-解码器)架构

待验证50%
9月12日

DeepSeek官方宣布DeepSeek-V4-Flash官方API正式进入公开测试(public beta)阶段

待验证50%
9月12日

选择 MIT 许可证传递出 DeepSeek 希望最大化开发者采用率、优先扩大生态规模的战略意图

待验证50%

还有 40 条时间轴事件

全部知识事实 (20)

已验证

DeepSeek-V3采用了混合专家架构(MoE),总参数量达6710亿,但每次推理仅激活约370亿参数

90%
已验证

DeepSeek-V4-Pro是DeepSeek推出的最新旗舰级大语言模型

90%
已验证

AI行业正在从单纯追求模型能力转向又快又强的务实路线

90%
已验证

DeepSeek的深度思考模式本质上是链式推理(Chain-of-Thought)机制的增强实现

90%
已验证

DeepSeek是由中国人工智能公司深度求索开发的大语言模型系列

90%
已验证

GRPO(Group Relative Policy Optimization)由DeepSeek提出,无需单独训练价值网络,已成为当前智能体RL训练的主流算法选择

90%
已验证

DeepSeek Harness采用TypeScript编写

80%
已验证

AI赋能测试体系围绕Harness工程体系展开,目标是实现可约束、有序、高质量的AI辅助测试生产流程

80%
已验证

DeepSeek是由量化私募巨头幻方量化孵化的AI实验室

80%
已验证

DeepSeek的API平台地址为platform.deepseek.com

80%
已验证

DeepSeek API Key创建后只显示一次,之后无法再查看

80%
已验证

DeepSeek-R1是专注于推理能力的模型,通过强化学习训练具备链式思考能力

80%
已验证

DeepSeek 的缓存命中价格可低至常规价格的十分之一

80%
已验证

OpenAI 的 Chat Completions API 采用消息数组作为输入的格式已成为行业事实标准,Anthropic、Google Gemini、Mistral 等主流模型提供商都提供了兼容或类似的接口

80%
已验证

DeepSeek由深度求索公司开发

80%
已验证

DeepSeek是国产顶尖推理模型,擅长代码和数学任务

80%
已验证

DeepSeek在性价比方面目前表现突出

80%
已验证

Claude Code支持通过OpenAI兼容API格式接入任意大模型,国内用户可配置DeepSeek、通义千问Qwen、智谱GLM-4等模型使用

80%
已验证

DeepSeek采用MOE(Mixture of Experts,混合专家)架构,每次推理时只激活部分专家子网络而非全部参数

80%
已验证

DeepSeek采用了混合专家架构(MoE)和多头潜在注意力机制(MLA)

80%

来源文章