Ollama改用积分制:老Pro用户切换将损失67%额度

事件概览:Ollama付费方案重大调整
近日,本地大模型运行工具 Ollama 宣布调整其付费方案,根据官方所称的"用户反馈",将原有的固定算力套餐转向**积分制(credit model)**计费。这一变动在 Reddit 社区引发热议,一位仍在使用旧版 $20 Pro 套餐的用户发出提醒(PSA):如果你还在老计划上,千万不要点击切换按钮,否则实际可用额度可能大幅缩水。
Ollama 是一款开源的本地大语言模型运行框架,允许用户在自己的电脑上下载、运行和管理各种开源大模型(如 Llama、Mistral、Gemma 等)。它的核心卖点是极大简化了本地部署大模型的技术门槛——用户无需手动配置 Python 环境、下载模型权重、处理量化格式等繁琐步骤,只需一行命令即可运行模型。从技术架构上看,Ollama 底层基于 llama.cpp 这一高性能 C/C++ 推理引擎构建,并在此之上封装了一个类似 Docker 的模型管理抽象层——用户通过 Modelfile 定义模型配置,通过 ollama pull 和 ollama run 等命令管理模型生命周期,这种设计让不具备深度 ML 工程经验的开发者也能轻松上手。在本地大模型运行工具的生态中,Ollama 与 LM Studio(提供图形化界面)、GPT4All(侧重离线隐私场景)、Jan(强调开放架构)等形成了差异化竞争格局,但 Ollama 凭借其 CLI 优先的设计哲学和对开发者工作流的良好适配,在技术社区中积累了最大的用户基数。除了免费的本地运行功能外,Ollama 还提供云端付费服务,让用户可以调用更强大的闭源模型或获得更高的算力支持,而此次争议正是围绕这部分付费服务展开。
这类由固定套餐转向按量计费的调整,在 AI 工具订阅领域并不罕见,但对于重度用户而言,往往意味着实际成本的显著上升。这位用户在切换前做了一笔详细的账,结果让他庆幸自己没有贸然操作。

新旧方案对比:一笔关键的账
该用户基于自己真实的使用模式进行了详细测算,核心数据对比如下:
旧方案 vs 新方案的token额度差异
- 旧版 $20 Pro 套餐:每月约可获得 21 亿(2.1B)tokens 的 Deepseek v4 flash 用量。
- 新版 $20 积分套餐:提供 $60 的积分额度,换算到相同工作负载下,约等于 7 亿(700M)tokens。
这里需要解释一下 token 这一核心计量概念。在大语言模型领域,token 是文本处理的基本计量单位,一个 token 大致等于英文中的 3/4 个单词,或中文中的 1-2 个汉字。更准确地说,token 是由分词器(tokenizer)将原始文本切分后得到的基本单元——现代大模型普遍采用 BPE(Byte Pair Encoding)或 SentencePiece 等子词分词算法,常见的英文单词通常被编码为 1-2 个 token,而不常见的专业术语或非拉丁语系文字可能会被拆分为更多 token。模型每处理一个 token 都需要消耗 GPU 算力,因此 token 数量直接决定了 API 调用的成本。Token 分为输入 token(用户发送的提示词和上下文)和输出 token(模型生成的回复),通常输出 token 的单价高于输入 token,因为生成过程需要逐个自回归推理计算——输入 token 可以并行处理(prefill 阶段),而输出 token 必须一个一个依次生成(decode 阶段),这种串行特性导致输出阶段的 GPU 利用效率更低,成本自然更高。当我们说 21 亿 tokens 时,这个数字涵盖了输入和输出的总量。
关于用户测算中提到的 Deepseek v4 flash 模型,这里也值得展开。Deepseek 是由中国 AI 公司深度求索(DeepSeek)推出的大语言模型系列,该公司由量化投资巨头幻方量化孵化,凭借强大的工程能力和对高效训练技术的深入研究,在短时间内成为全球 AI 模型竞争格局中的重要参与者。Deepseek 系列模型以性价比著称,其旗舰模型 Deepseek-V2/V3 采用了 MoE(Mixture of Experts,混合专家)架构——这种架构的核心思想是将一个超大规模模型拆分为多个"专家"子网络,每次推理时只激活其中一小部分,从而在保持模型总参数量(和能力)的同时大幅降低实际计算量。例如 Deepseek-V2 拥有 2360 亿总参数,但每次推理只激活约 210 亿参数,这使得其推理成本远低于同等能力的稠密模型。"flash" 后缀通常表示该模型是经过进一步推理优化的轻量化版本,在保持较高能力的同时再次降低推理成本和延迟。这类 flash 模型在行业中越来越流行——Google 的 Gemini Flash、Anthropic 的 Claude Haiku 都是类似定位,它们共同反映了一个行业趋势:在"智能程度够用"的前提下,用户越来越倾向于选择成本更低、速度更快的模型来处理大规模日常任务。用户选择 Deepseek v4 flash 进行测算,说明其工作负载追求的是性价比而非极致性能,这也解释了为什么他的 token 消耗量如此巨大——低单价模型往往被用于大规模批量处理任务,如文档摘要、数据提取、自动化代码生成或构建 AI Agent 工作流等场景。
说个细节,这一测算已经考虑了他自身使用场景中高达 97% 的缓存命中率(cache hit)——也就是说,即便在极为有利的缓存条件下,新方案能提供的 token 数量仍然只有旧方案的约三分之一。
所谓缓存命中率,在大模型 API 调用场景中指的是 KV Cache(键值缓存)的复用比例。要理解这一概念,需要简单了解 Transformer 模型的推理过程:当模型处理输入文本时,每一层的自注意力机制都会为每个 token 计算一组 Key(键)和 Value(值)向量,这些向量对后续 token 的生成至关重要。KV Cache 的核心思想是将这些已经计算好的键值对存储起来,避免重复计算。而"前缀缓存"(Prefix Caching)则更进一步——当多个请求共享相同的开头部分(如相同的系统提示词或相同的文档上下文)时,服务商可以在请求之间复用这部分的 KV Cache,显著减少计算量。97% 的缓存命中率意味着该用户的工作负载中绝大部分请求都共享相似的上下文前缀——这在批量处理、RAG(检索增强生成)管道或代码补全等场景中非常常见。以 RAG 为例,用户通常会将大段检索到的文档片段作为上下文前缀,再附上不同的具体问题,此时文档部分的 KV Cache 可以在多个问题间共享。许多 API 服务商对缓存命中的 token 给予大幅折扣(通常为正常价格的 1/4 到 1/10),例如 Anthropic 对缓存命中的 token 只收取原价的 10%,OpenAI 则给予 50% 的折扣。然而即便算上了这个有利因素,新方案的 token 额度依然大幅缩水,这恰恰说明了新旧方案之间的差距有多大。
换算下来:
| 方案 | 月费 | 可用 tokens(Deepseek v4 flash) |
|---|---|---|
| 旧 Pro 套餐 | $20 | 约 21 亿 |
| 新积分套餐 | $20 | 约 7 亿 |
同样花 $20,token 数量减少了约 67%。 对于一个每月消耗数十亿 token 的用户来说,这几乎意味着单位成本翻了三倍。
为什么会出现这种差异?
固定套餐与积分制的本质区别
固定算力套餐的逻辑是"包月无忧":只要在算力上限内,用户无需关心每次调用的具体消耗,边际成本趋近于零。这对重度用户极为友好,因为高频、大量的调用被摊薄到一个固定价格里。从经济学角度看,固定套餐实质上是供应商对用户使用量分布做出的一个"赌注"——供应商假设大多数用户不会用满额度,因此可以用轻度用户的"闲置额度"来补贴重度用户的超额消耗。这与健身房会员、自助餐厅的商业逻辑本质相同,行业术语称之为"超售"(oversubscription)。
而积分制则将每一次 token 消耗都明码标价。$60 的积分听起来比 $20 的套餐"给得更多",但一旦按实际 token 单价折算,重度用户的用量很快就会把积分消耗殆尽。积分制的定价通常更接近底层 GPU 算力的实际成本,因为供应商不再需要承担用量预估的风险——这也意味着那些曾经从"超售模型"中受益的重度用户将失去隐性补贴。
简单来说:
- 轻度用户:积分制可能更划算,用多少付多少,不浪费。
- 重度用户:积分制是明显的成本上升,固定套餐的性价比优势消失。
"基于用户反馈"的调整背后
Ollama 官方将此次变动归因于"用户反馈"。从商业角度看,固定套餐若被少数重度用户消耗掉大量算力,供应商的成本压力会非常大。转向积分制,本质上是把成本更精确地转嫁给高消耗用户,这在订阅制 AI 服务中是一种常见的商业修正手段。
事实上,这种计费模式的演变正在整个 AI 行业中上演。早期许多服务采用类似"自助餐"的定价策略——ChatGPT Plus 的 $20/月固定订阅是最典型的例子,用户最初可以无限制使用 GPT-4,后来被逐步加上了每 3 小时 25 条(后调整为 40 条、80 条)的速率限制。Anthropic 的 Claude Pro 订阅同样经历了类似的"先宽松后收紧"过程。更具代表性的是 Google 的 Gemini API 定价策略演变:从最初的免费慷慨配额,到逐步引入分级定价和按量计费,清晰地展现了"获客期补贴→成长期回收成本"的商业逻辑。随着用户规模扩大,供应商逐渐发现少数重度用户的 GPU 算力消耗远超预期——在 AI 推理场景中,GPU 算力成本是最大的支出项,一张 NVIDIA H100 GPU 的云端租赁成本约为每小时 $2-4,而一个重度用户的持续高频调用可以轻松占满一张或多张 GPU 的全部算力。当这些成本无法被轻度用户的闲置额度覆盖时,"自助餐模式"就变得不可持续。积分制本质上是将定价权从"包月自助餐"转向"按菜点单",对供应商而言能更精确地控制成本结构,但也意味着当价格透明度提高后,重度用户会明显感知到实际支出的上升。Ollama 的这次调整,正是这一行业趋势在中小型 AI 工具服务商身上的又一次体现——而对于中小型服务商而言,由于缺乏头部公司那样的规模效应和交叉补贴能力,从固定套餐转向按量计费的动力往往来得更快、更强烈。
不过,这也提醒我们:平台方所说的"优化"或"回应反馈",未必对所有用户群体都是好消息。 对个体用户而言,最可靠的判断依据永远是基于自身真实使用数据的测算,而非官方宣传中的"更多额度"字样。
切换前必做:实用成本测算指南
四步算清你的真实成本
这起案例最大的价值,在于它展示了一个朴素但极易被忽视的原则:在点击"升级"或"切换"按钮前,用自己的真实用量做一次成本测算。
具体步骤如下:
- 统计真实用量:查看自己每月实际消耗的 token 数量,不要凭感觉估算。大多数 AI 服务都提供使用量仪表盘或 API 调用日志,这些是最可靠的数据来源。如果使用 Ollama 本地服务,可以查看其日志中的 token 统计信息;使用 OpenAI API 的用户可以在 Usage 页面查看详细的按日/按模型用量分解。建议至少收集 2-3 个月的数据以平滑波动,同时注意区分输入 token 和输出 token,因为它们的单价通常不同。
- 换算新方案单价:将新套餐提供的积分金额除以你使用模型的 token 单价,算出实际可用 token 数。需要注意的是,不同模型的 token 单价差异极大——以当前市场行情为参考,GPT-4o 的输出价格约为 $15/百万 token,而 GPT-4o-mini 仅为 $0.6/百万 token,差距高达 25 倍;Deepseek 系列的定价通常更具竞争力,这也是其在注重性价比的用户群体中广受欢迎的原因。因此务必按自己实际使用的模型来计算,不能简单地用"平均价格"代替。
- 考虑缓存因素:如果你的工作负载有较高的缓存命中率,把这一优惠纳入计算,让对比更贴近真实场景。可以通过分析请求中共享前缀的比例来估算自己的缓存命中率——如果你的请求中大量使用相同的系统提示词或文档上下文,缓存命中率可能在 50%-90% 之间;如果每次请求的内容完全不同,则缓存命中率可能趋近于零。API 返回的 usage 字段中通常会标注 cached tokens 的数量,可以据此精确计算。
- 横向对比:把新旧方案在相同价格、相同工作负载下的 token 数量直接放在一起,差异一目了然。同时不要忘记将其他替代服务(如直接使用 Deepseek 官方 API、OpenRouter 等聚合平台)的价格也纳入对比范围——在积分制下,Ollama 的单位 token 价格可能不再具有相对优势。
重度用户的应对策略
对于像本案例这样每月消耗数十亿 token 的重度用户,套餐制被替换为积分制往往是不利信号。几点建议:
- 如果旧方案仍然可用,优先保留旧方案,这通常是更经济的选择。在 SaaS 行业中,保留老用户原有计划(所谓"祖父条款" / Grandfathering)是一种常见做法——企业出于法律义务或用户留存考虑,允许现有用户继续使用已经停售的旧套餐。但供应商也可能在未来某个时间点强制迁移,通常会提前 30-90 天发出通知,因此需要持续关注相关公告和服务条款的变更。
- 关注 Ollama 是否会强制迁移旧套餐用户,提前做好备选方案。
- 评估其他本地部署方案或替代服务,看是否能以更低成本满足高频调用需求。对于有一定技术能力的用户,完全本地化的部署方案虽然前期投入较高,但在长期大规模使用场景下,单 token 成本往往远低于任何云端付费方案。目前主流的本地推理框架各有特色:llama.cpp 是最轻量级的选择,支持 CPU 和消费级 GPU 推理,适合个人用户在笔记本或台式机上运行中小型模型;vLLM 专为高吞吐量服务场景设计,采用 PagedAttention 技术优化显存管理,能够在单张 GPU 上高效服务多个并发请求,是搭建私有 API 服务的首选;Hugging Face TGI(Text Generation Inference) 则提供了完整的生产级部署解决方案,内置负载均衡和请求队列管理。硬件方面,一张消费级的 NVIDIA RTX 4090(24GB 显存,售价约 $1,600)可以流畅运行 70B 参数的 4-bit 量化模型,按电费计算每月运行成本不到 $30——相比每月 $20 的云端订阅看似差别不大,但 GPU 是一次性投入且没有 token 数量限制,对于月消耗数十亿 token 的用户而言,可能在 1-2 个月内就能回收硬件成本。当然,自建方案需要承担硬件维护、模型更新、服务可用性保障等额外工作量,用户需要根据自身技术能力和时间成本综合评估。
结语
Ollama 从固定套餐转向积分制的调整,本身是订阅服务演进中的常见一步,但对不同用户群体的影响差异巨大。这位 Reddit 用户通过一次简单的测算,避免了额度缩水 67% 的损失,也为整个社区提了个醒。
在 AI 工具订阅日益普及的今天,"看起来更划算"的新方案未必真的划算。养成在变更计费方案前主动核算成本的习惯,是每一位 AI 工具用户都应具备的基本素养。 尤其是在 AI 行业仍处于快速变化期的当下——模型能力在提升、推理成本在下降、竞争格局在重塑——今天的"最优方案"可能在三个月后就不再是最优选择。保持对市场价格的敏感度,定期审视自己的使用模式和成本结构,才能在这个快速演变的生态中做出真正明智的决策。
相关推荐

OpenAI与Cursor决裂内幕:模型访问将于11月切断
海外科技博主爆料OpenAI与Cursor决裂内幕:因Cursor被SpaceX收购引发数据蒸馏担忧,OpenAI将于11月12日切断模型访问,新模型Astra成关键。附用户应对方案。

Antigravity调用Gemini报错真相:IP风控实测与应对
Google Antigravity IDE调用Gemini模型频繁报错?实测发现同一账号仅切换IP即可恢复,且同IP在AI Studio仍可正常使用。本文解析这一基于IP的风控策略、成因推测及排查应对思路。

AI超级员工系统拆解:营销自动化工具的能力与风险
一款宣称"全接管基础岗位"的AI超级员工系统在B站流传,本文拆解其视频生成、数字人克隆、智能体和批量获客等功能,并客观分析其中的合规与安全风险,提醒用户警惕"免费领取"营销套路。