DeepSeek API涨价3倍:还能斩杀所有Coding Plan吗?

DeepSeek调价:从性价比之王到竞争力承压
8月14日,DeepSeek迎来了一个「悲喜交加」的日子:一方面,DeepSeek V4 Pro正式版完成发布;另一方面,官方宣布将于8月17日对API进行「峰谷计费」模式改造。据B站UP主鱼天的初步测算,在计费模式改变之后,DeepSeek API的整体调用价格预计会比原来上涨约3倍左右。
这一变化对于长期依赖DeepSeek低价API的开发者和创业者而言,无疑是一记重锤。此前DeepSeek凭借极致的性价比,几乎「斩杀」了市面上所有主流大模型,如今这一优势正在被显著削弱。

峰谷计费规则详解:高峰期价格最高翻4倍
根据DeepSeek官方给出的定价参考,新的计费模式将区分「峰值」与「非峰值」时段。具体规则大致如下:
- 峰值时段:北京时间早上9点到12点,以及下午2点到6点,这两个工作高峰期调用API的价格会来到约4倍的水平;
- 常规时段:计费约为原来旧价格的2倍;
- 24小时连续使用:若不区分时段全天候调用,整体价格约在2.6倍到2.8倍。
峰谷计费(Time-of-Use Pricing)并非AI行业首创,而是源自电力行业的经典定价策略。电网公司长期采用峰谷电价来平衡供需——高峰时段电价上浮以抑制需求,低谷时段降价以鼓励用电。云计算领域的AWS、Google Cloud等也早已推出类似的Spot Instance(竞价实例)和预留实例机制。Spot Instance允许用户以大幅折扣价格使用云端闲置计算资源,但代价是平台可以在需求高峰时随时回收这些资源——本质上是用「不确定的可用性」换取「确定的低价格」。DeepSeek将这一模式引入大模型API定价,本质上反映了GPU推理资源与电力一样具有明显的供需波动特征:工作时段请求量激增导致GPU利用率接近满载,而凌晨时段则大量闲置。通过价格信号引导用户错峰调用,理论上可以提高整体资源利用效率,但对于必须在工作时间响应用户请求的ToC应用开发者而言,几乎无法享受低谷价格的优惠。
从技术角度来看,峰谷计费的背后还涉及GPU推理服务的架构特性。现代大模型推理通常采用批处理(Batching)技术来提高GPU利用率——将多个用户的请求打包成一个批次同时送入GPU处理。当高峰期请求量激增时,批处理队列迅速积压,导致用户感知到的延迟(Latency)显著上升,即首个Token的等待时间(Time to First Token, TTFT)变长。vLLM、TensorRT-LLM等推理引擎虽然通过PagedAttention、连续批处理(Continuous Batching)等技术大幅提升了吞吐量,但物理GPU的显存和算力终究是硬约束。峰谷计费本质上是将这种物理资源约束转化为经济信号,让市场机制来完成「流量整形」的工作。
由于大多数开发者恰恰是在高峰期集中使用AI,因此实际感受到的综合倍率会落在3倍到3.2倍之间。这意味着,对于真实业务场景,「涨价3倍」并非危言耸听,而是相当接近实际体验的估算。
DeepSeek API价格对比:性价比排位显著下滑
涨价前后的对比最能说明问题。以下是DeepSeek在新旧计费模式下与其他Coding Plan的横向对比。
在大模型API的计费体系中,Token是最基本的计量单位。一个Token大约对应中文的1-2个字或英文的4个字符(一个英文单词通常被拆分为1-3个Token,这取决于所使用的分词器Tokenizer的具体实现)。大模型处理用户请求时,需要同时计算输入Token(即用户发送的Prompt,包括系统指令、上下文历史和当前问题)和输出Token(即模型生成的回答),两者通常采用不同的价格,且输出Token往往比输入Token贵2-4倍,因为生成过程需要逐个Token自回归解码(Autoregressive Decoding),每生成一个新Token都要对之前所有Token进行一次注意力计算,计算成本呈累积式增长。「百万Token」(即1M Tokens)作为计费单位已成为行业惯例,类似于通信行业按MB/GB计费。以0.15元/百万Token为例,生成一篇2000字的文章大约消耗3000-4000个Token,成本不到0.001元——看似微不足道,但对于日均调用量达数百万次的企业级应用,费用会迅速累积到可观的规模。以一个日活百万的AI聊天应用为例,若每次对话平均消耗2000个Token,日均Token消耗量就达到20亿,按0.15元/百万Token计算,日成本约300元看似不高,但若输出Token占比较大且单价更贵,实际日成本可能飙升至数千甚至上万元。
值得注意的是,在实际API调用中,Token成本还受到两个容易被忽视的因素影响。一是KV Cache(键值缓存)命中率:当多次请求共享相同的系统提示词(System Prompt)前缀时,部分厂商(包括DeepSeek)会对缓存命中的输入Token给予折扣价,因为这些Token无需重新计算注意力矩阵。涨价后这一折扣是否保留、折扣比例是否调整,将直接影响使用长系统提示词场景的成本测算。二是思维链(Chain-of-Thought)推理模型的隐藏Token消耗:DeepSeek-R1等推理增强模型在生成最终答案前,会产生大量中间推理Token,这些「思考Token」虽然用户不一定可见,但同样计入输出Token费用,可能使实际成本比直觉预估高出数倍。对于依赖推理模型的复杂任务(如多步数学证明、深层代码逻辑分析),这一隐藏成本在涨价后尤为需要关注。
在旧模式下,DeepSeek以约5分钱每百万Token的价格,基本碾压了市面上所有大模型,几乎无人能敌。而在峰谷调价之后,这一价格来到了约0.15元每百万Token的水平。

在0.15元每百万Token这个新价位上,情况发生了微妙变化——这个价格区间已经能够买到一些相当不错的第三方模型,甚至可以调用到Claude系列的高阶模型。Coding Plan是近年来兴起的一种面向开发者的AI编程助手订阅服务模式,以Cursor、Windsurf、GitHub Copilot等为代表的AI编程工具通常提供月费制的订阅套餐(月费从10美元到数十美元不等),用户支付固定费用后可在额度内大量调用底层大模型进行代码生成、补全、调试、重构等操作。这些Coding Plan的本质是在用户和大模型API之间充当「中间商」——平台方通过与模型提供商签订批量采购协议(Enterprise Agreement),以远低于公开零售价的单价获取大量API额度,再以订阅制打包出售给终端用户。由于Cursor、Windsurf等产品之间竞争日益白热化,各家不断压低订阅价格或提高额度上限,导致终端用户实际享受到的单Token价格已被压到极低水平,甚至低于直接调用API的官方价格。
Coding Plan市场的定价博弈还涉及一个关键的经济学概念——交叉补贴(Cross-Subsidy)。Cursor等AI编程工具的核心商业逻辑并非单纯靠API差价盈利,而是通过低价甚至亏损的AI调用额度吸引开发者进入其IDE生态,再通过团队版订阅、企业版定制、代码库索引等增值服务实现盈利。这意味着Coding Plan的单Token价格可以长期维持在低于模型供应商官方零售价的水平,因为亏损的部分由其他收入来源补贴。这种模式对DeepSeek等纯API供应商构成结构性压力——即使DeepSeek不涨价,Coding Plan中间商的存在也会持续压缩其定价空间。当DeepSeek API涨价后,其单价反而可能高于通过Coding Plan间接调用Claude、GPT-4等模型的成本。换言之,DeepSeek曾经引以为傲的绝对价格优势,正在被竞争对手从多个维度蚕食。
DeepSeek V4 Pro正式版定价:0.6元区间引发担忧
更值得关注的是DeepSeek V4 Pro正式版的定价。如果其原本约0.2元的价格在翻三倍之后来到0.6元区间,这将是一个相当夸张的数字。分析认为,0.6元左右的倍率意味着市面上几乎所有Coding Plan的调用价格都会比DeepSeek V4 Pro的新版计费更便宜。
作为参照,订阅ChatGPT Plus套餐使用Claude高阶模型的价格大约在0.43元每百万Token的水平。Claude是Anthropic公司开发的大语言模型系列,以其在安全对齐(Constitutional AI)、超长上下文处理能力(Claude 3及以后版本支持高达200K Token的上下文窗口,远超早期GPT-4的8K/32K限制)和代码生成质量方面的突出表现著称。Claude的产品线按能力和成本分为三个层级:Haiku是轻量快速的版本,适合对延迟敏感、任务简单的场景;Sonnet是均衡型,兼顾能力与成本,是最广泛使用的版本;Opus则是旗舰型,代表了Anthropic最高端的模型能力,在复杂推理、多步骤代码编写和长文档理解等任务上处于行业顶尖水平。值得注意的是,Anthropic由前OpenAI研究副总裁Dario Amodei和其妹妹Daniela Amodei于2021年联合创立,公司从成立之初就将AI安全作为核心研究方向。Anthropic已获得亚马逊(投资高达40亿美元并成为最大外部投资方)、Google等科技巨头的大规模战略投资,累计融资超过百亿美元,是OpenAI在商业大模型领域最强劲的竞争对手之一。相比之下,用1.5倍的价格去买一个能力上「还不如」对手的模型,DeepSeek的竞争力自然会打上折扣。
DeepSeek V4 Pro能力测评:进步是否达预期?
除了价格,V4 Pro的实际能力也是市场关注的焦点。在官方介绍中,DeepSeek V4 Pro正式版被定位为与Claude Opus 4.x「差不多持平」的水平。
然而根据第三方评测机构Artificial Analysis的排行榜数据,V4 Pro的进步幅度并没有那么明显——分数仅从52分提升到53分,仅有1分的差距。Artificial Analysis是一个独立的第三方AI模型评测平台,致力于为行业提供客观、标准化、可复现的大模型性能基准测试。与各大模型公司自行发布的评测结果不同,Artificial Analysis采用统一的测试条件和评分标准,对所有参评模型一视同仁,因此其数据具有较高的横向可比性。其综合评分体系涵盖多个维度:通用知识问答能力(通过MMLU等多选题基准测试衡量模型在57个学科上的知识广度和准确率)、数学推理能力(通过MATH和GSM8K等数据集测试从小学应用题到竞赛级数学问题的求解能力)、代码生成能力(通过HumanEval和MBPP等编程基准测试评估模型编写正确、可执行代码的能力)、指令遵循能力(衡量模型是否能精确按照用户指示的格式和约束条件生成内容),以及推理速度(即每秒生成Token的速度,直接影响用户体验)等。
不过,这些标准化基准测试正面临一个日益严峻的深层问题——古德哈特定律(Goodhart's Law):当一个指标变成目标时,它就不再是好的指标。随着MMLU、HumanEval等基准测试成为模型公司竞争的焦点,越来越多的证据表明部分模型可能在训练数据中「污染」了测试题(即模型在训练时已经「见过」测试集中的题目),导致评测分数虚高。此外,这些标准化测试大多考察模型的单轮、短上下文能力,而真实编程任务往往涉及跨文件的代码理解、多轮调试迭代和对项目级架构的把握——这些维度在现有评测体系中严重不足。这也是为什么行业越来越重视SWE-bench(一个基于真实GitHub issue修复的软件工程能力基准)和Aider Polyglot(多语言代码编辑基准)等更贴近实际开发场景的评测。虽然在排行榜头部区间1分的差距看似微小,但需要注意的是,当多个顶级模型的分数已经高度集中时,1分的提升可能意味着在某些特定任务上的显著改进——但也同样可能仅是评测数据的统计波动,或者反映了模型在某些子任务上的进步被其他子任务的退步所抵消。

不过,需要理性看待这一数据。排行榜反映的仅仅是模型本身的裸能力,而实际使用中如果配合DeepSeek新的Harness(智能体框架/工具链),是否能获得进一步的能力提升,目前尚不明确。在大模型生态中,Harness通常指的是围绕基础模型构建的智能体(Agent)框架和工具调用链。单纯的大模型只能进行文本生成——它接收一段文字输入,输出一段文字回答,本质上是一个「文本到文本」的函数。而通过Harness,模型可以被赋予与外部世界交互的能力——例如执行代码、搜索互联网获取实时信息、读写本地文件、操作数据库、调用第三方API等。这一层「脚手架」往往能极大地放大模型的实际效用,使其从「聊天机器人」进化为「能执行任务的智能代理」。以编程场景为例,一个配备了完善Harness的模型可以自动将生成的代码提交到沙箱环境运行、捕获运行时错误和测试失败的反馈、然后基于这些反馈迭代修改代码直到所有测试通过,其最终输出质量可能远超裸模型在静态评测中的分数所能反映的水平。目前行业内主流的Harness实现包括:OpenAI的Function Calling(允许模型声明并调用预定义的外部函数)、Anthropic的Tool Use(Claude模型的工具调用能力,支持计算机操控等高级功能)、以及开源社区的LangChain(一个用于构建LLM应用的通用框架,支持链式调用、记忆管理和工具集成)、AutoGen(微软推出的多Agent协作框架)等。DeepSeek若能推出高质量的原生Harness,配合其模型本身的推理能力,有望在编程助手、数据分析、自动化工作流等实战场景中展现出超越裸模型评测分数的竞争力,在一定程度上弥补纸面分数上的差距。这也是许多用户比较期待验证的部分。

涨价背后的逻辑:算力向训练倾斜
为什么DeepSeek会选择在这个时间点涨价?一个合理的解读是:DeepSeek当前的算力重点,很可能仍然放在训练下一代新模型上。如果大量用户疯狂进行API调用,会占用宝贵的推理算力资源,进而挤压训练资源。
大模型公司面临的核心资源瓶颈之一,是训练算力与推理算力之间的零和博弈。训练(Training)是指使用海量数据(通常达数万亿Token的语料规模)和大规模计算资源来优化模型数十亿乃至数万亿参数的过程,通常需要数千张高端GPU(如NVIDIA H100/H200,单卡售价约2.5-4万美元)组成集群,通过高速互联网络(如InfiniBand或NVLink)连接,连续运算数周乃至数月。一次前沿大模型的完整训练耗资可达数亿甚至超过十亿美元。推理(Inference)则是模型训练完成后,部署到服务器上响应用户实时请求的过程——用户发送一条消息,模型生成一条回答。虽然单次推理的计算量远小于训练,但当并发请求量达到百万级(如DeepSeek作为广受欢迎的API服务所面临的情况)时,为了保持毫秒级响应速度,所需部署的GPU总量同样极为惊人。对于DeepSeek这样同时承担前沿模型研发与大规模公共API服务的公司,每一张GPU都面临「是用来训练下一代更强模型以维持技术领先,还是用来服务当前用户以维护市场份额和收入」的艰难抉择。
这一困境在当前全球GPU供应受限的大背景下更为突出。美国自2022年10月起陆续收紧对华先进半导体出口限制,最初针对的是NVIDIA A100和H100等高性能训练芯片。随后,NVIDIA专门为中国市场推出了降低互联带宽和计算性能的「合规版」芯片(如A800和H800),但美国商务部在2023年10月的更新规则中将这些降规版芯片也纳入管制范围,进一步限制了中国AI公司获取顶级训练硬件的渠道。2024年的后续政策更是将管制扩展到了更多型号和更多国家。这一系列出口管制措施使得中国AI公司获取前沿训练芯片的难度和成本显著上升——不仅需要通过复杂的供应链寻找替代方案,还需要投入更多工程资源来优化在次优硬件上的训练效率,这让本就紧张的算力资源分配决策变得更加关键和敏感。
从这个角度看,涨价既是商业上的调整,也是一种算力分配的策略性选择——通过价格杠杆抑制过度的推理需求,为新模型的研发腾出空间。这一逻辑对于任何一家同时承担训练与推理任务的AI公司都具有普遍参考意义。事实上,OpenAI也曾在GPT-4发布初期通过极高的API定价来控制调用量,随着推理优化技术的成熟和专用推理芯片的部署才逐步降价。
值得指出的是,除了通过涨价来平衡供需之外,推理成本的降低还可以通过技术手段实现。当前行业主要的推理优化方向包括:模型量化(Quantization),即将模型参数从FP16(16位浮点)压缩到INT8甚至INT4精度,以牺牲微小的精度换取2-4倍的显存节省和推理加速;推测性解码(Speculative Decoding),使用一个小型「草稿模型」快速生成多个候选Token,再由大模型并行验证,从而将自回归解码的串行瓶颈部分并行化;以及模型蒸馏(Distillation),用大模型的输出作为训练数据来训练一个参数量更小但能力接近的学生模型。DeepSeek在推理效率方面一直有技术积累(如其创新性的MLA——多头潜在注意力机制,通过低秩分解显著降低了推理过程中KV Cache的显存占用),未来若这些优化技术进一步成熟并大规模部署,当前的涨价趋势也未必不可逆转。
总结:DeepSeek涨价后还值得用吗?
综合来看,这次调价并不意味着DeepSeek「完全没办法使用」,而是它相对于竞争对手的性价比优势被明显削弱了。对于价格敏感的开发者而言,选择空间正在变大——除了直接调用各家API,通过Coding Plan订阅、API聚合平台(如OpenRouter,一个一站式接入多家模型的中间平台,开发者可以在同一个API接口下按需切换不同模型)等方式获取高性价比的模型调用正变得越来越便利。
值得一提的是,如果API价格确实上去了,DeepSeek是否会顺势推出自己的Coding Plan订阅套餐?此外,通过订阅OpenCode等第三方套餐,用户在涨价后仍能获得较好的价格减免,因此「无DeepSeek可用」的担忧大可不必。
最终,DeepSeek能否守住市场口碑、V4 Pro的实战能力能否兑现官方承诺,仍需时间与更多真实场景的检验。对于广大用户而言,保持理性期待,或许是当下最好的态度。在大模型行业竞争日益激烈的当下,价格战、性能战和生态战正在同步展开,没有任何一家公司能永远占据绝对优势。保持对多个模型和平台的关注与评估能力,才是开发者在这个快速变化的市场中最可靠的策略。
相关推荐

零依赖AI记忆层:不用向量数据库也能搞定Agent记忆
探讨零依赖AI Agent记忆层方案,分析在无需向量数据库的情况下如何实现智能体记忆能力。对比传统RAG架构的优劣势,解析适用场景与技术权衡,为开发者提供更灵活的技术选型思路。

Linear创业故事:从离开Coinbase到重新定义开发者工具
Linear联合创始人Jori Lallo在2018年离开Coinbase,投身开发者项目管理工具赛道。七年间,Linear凭借极致的开发者体验在Jira、Asana等巨头林立的红海中成功突围,其创业历程揭示了垂直深耕与反共识创业的核心逻辑。

AWS S3为何被称为世界第八大奇迹?云存储的隐形力量
一条技术圈热门推文将AWS S3列为世界第八大奇迹。本文解析S3凭借11个9的数据持久性、无处不在的架构渗透力,如何成为现代数字文明的隐形基石,以及这个玩笑背后的深层技术文化。