OpenAI内部Codex使用量暴增56倍,AI编程正在吞噬一切

核心数据:Codex输出token的爆炸式增长
OpenAI近日披露了一组令人震撼的内部数据:自2025年11月以来,其内部使用Codex(代码生成AI)的中位输出token数量出现了惊人的增长。具体来看:
- 研究部门:增长 56倍
- 客户支持部门:增长 32倍
- 工程部门:增长 27倍
- 法务部门:增长 13倍

这不是外部用户的使用数据,而是OpenAI自身员工在日常工作中对AI编程工具的依赖程度。当AI公司自己都在以这样的速度拥抱AI辅助工作流,这个信号的意义远超数字本身。
理解Codex:不只是代码补全工具
OpenAI Codex是基于GPT架构专门针对代码生成任务微调的大型语言模型,最初于2021年作为GitHub Copilot的底层引擎发布。Codex在数十亿行公开代码上进行训练,能够理解自然语言描述并将其转化为可执行代码,支持Python、JavaScript、TypeScript、Go、Ruby等数十种编程语言。
2025年,OpenAI推出了新一代Codex,将其整合进ChatGPT及API生态,并引入了**"代理模式"(Agentic Mode)**——这代表了大型语言模型应用范式的根本性转变。传统的代码补全模型采用"单轮推理"架构:接收一个提示词,输出一段代码,交互即告结束。而代理模式引入了"规划-执行-反思"循环(Plan-Execute-Reflect Loop):模型首先将复杂任务分解为子任务序列,逐步执行并在每个节点评估输出质量,必要时自我修正后继续推进。这种架构在技术上依赖于工具调用(Tool Use)、代码解释器(Code Interpreter)和长上下文窗口(Long Context Window)三项能力的协同。以一个典型的研究任务为例:传统Codex可能输出50个token的函数片段,而代理模式下,同一任务可能触发数轮迭代,累计输出包含完整数据处理管道、单元测试和文档注释的数万token代码库。这正是token输出量出现数十倍增长的底层技术逻辑。
为什么用"输出token"衡量使用深度?
Token是大型语言模型处理文本的基本单位,并非严格对应单词或字符。在英文中,一个token大约对应4个字符或0.75个单词;对于代码而言,一个函数定义、一段注释或一行逻辑语句都可能被拆分为多个token。AI公司普遍以"输出token数量"作为使用量的核心指标,原因在于:输出token直接反映模型的计算负载,也是API计费的主要依据。输出token的增长意味着用户不再满足于让AI生成简短的代码片段,而是开始委托AI完成完整的模块、系统或文档——这是使用深度的质变,而非简单的频次增加。从这个角度看,数十倍的增长所揭示的,是员工与AI协作方式的根本性转变。
为什么研究部门增长最快?
研究部门56倍的增长位居榜首,这并不令人意外。AI研究本身就是一个高度代码密集型的领域——从模型训练脚本、数据处理管道到实验自动化,几乎每个环节都可以通过Codex加速。
更深层的原因在于,研究人员往往需要快速原型验证想法。传统方式下,一个实验假设从构思到代码实现可能需要数小时甚至数天,而借助Codex,研究人员可以将更多精力放在创意和分析上,让AI处理繁琐的代码编写工作。56倍的增长意味着研究人员正在让Codex承担越来越多的"重活",生成更长、更复杂的代码输出。
非技术部门的渗透同样惊人
最值得关注的或许不是工程和研究部门的数据,而是客户支持(32倍)和法务(13倍)这两个传统上被视为"非技术"的部门。这一现象折射出一个更宏观的行业趋势:"公民开发者"(Citizen Developer)运动的AI化升级。
公民开发者概念最早由Gartner于2009年正式定义,描述那些使用IT部门批准的工具构建业务应用的非IT员工。这一运动经历了三个明显的技术浪潮:第一浪潮(2010-2015年)以Excel宏和Access数据库为代表;第二浪潮(2015-2022年)以Salesforce、Power Apps、Airtable等低代码/无代码平台为代表,拖拽式界面大幅降低了应用构建门槛;第三浪潮(2023年至今)以自然语言驱动的AI编程工具为代表,彻底消除了"需要理解代码逻辑"这一最后的技术门槛。与前两次浪潮相比,AI驱动的公民开发者运动具有一个关键差异:用户不再需要学习平台特定的操作逻辑,自然语言本身就是唯一的交互界面,这使得技术扩散速度理论上可以达到前所未有的量级。OpenAI法务和客户支持部门的数据,正是第三浪潮的早期实证,彻底模糊了技术与非技术岗位之间的边界。
客户支持:32倍增长的背后
客户支持部门使用Codex输出token增长32倍,说明AI编程工具正在被深度整合到客户服务流程中。这可能包括:自动生成技术文档、编写自动化响应脚本、构建内部工具来追踪和分析客户问题,甚至是用代码来复现客户报告的bug。客户支持正在从纯人工沟通转向"代码驱动的问题解决"。
法务部门:13倍增长的意义
法务部门13倍的增长虽然在四个部门中最低,但考虑到法律工作的性质,这个数字同样令人印象深刻。法务团队可能在利用Codex进行合同分析自动化、合规检查脚本编写、数据提取与整理等工作。Gartner预测,到2026年,低代码/无代码应用开发中将有超过80%的使用者来自非IT部门——而AI编程工具正在加速这一进程,法务部门的数据正是这一趋势的早期印证。
这组数据的深层含义
"吃自己的狗粮"效应
OpenAI公开这组内部数据,本身就是一种强有力的产品背书——"我们自己就是最重度的用户"。"Dogfooding"(吃自己的狗粮)这一术语起源于1980年代的微软,当时管理层要求员工必须在日常工作中使用自家尚未发布的软件产品,以便在真实场景中发现问题。这一实践后来成为硅谷科技公司的标准文化。对于AI公司而言,dogfooding具有双重意义:一方面,内部使用能够快速暴露模型的边界与缺陷,形成高质量的反馈闭环;另一方面,公开内部使用数据本身就是一种市场信号,向外部客户传递"我们对自己产品有足够信心"的信息。56倍的增长幅度,让这种背书具有了相当的说服力。
AI使用量的复利效应
从2025年11月至今不过数月时间,token输出量就实现了数十倍增长。这暗示AI工具的使用存在明显的复利效应,其机制与技术扩散理论中的"创新扩散曲线"(Diffusion of Innovations)高度吻合。
埃弗雷特·罗杰斯(Everett Rogers)于1962年提出的这一理论将技术采用者划分为五个群体:创新者(2.5%)、早期采用者(13.5%)、早期多数(34%)、晚期多数(34%)和落后者(16%)。理论的核心洞察在于:当采用率跨越约16%的临界点时,技术往往进入爆发期,增长曲线从线性转为指数型。OpenAI内部数据所呈现的数十倍增长,在时间维度上与这一理论高度吻合——AI编程工具在2023-2024年间完成了早期采用者阶段的积累,2025年开始向早期多数渗透。值得注意的是,企业内部的技术扩散往往比市场整体更快,因为组织内部存在强制性的知识共享机制和管理层推动力。
在AI编程工具领域,这种复利效应还有其特殊机制:员工在某一场景中获得正向体验后,会主动将工具引入相邻场景;成功案例在团队内部口耳相传,降低了其他成员的尝试门槛;随着使用经验积累,员工提示词(prompt)质量提升,AI输出质量随之改善,进一步强化使用意愿。这种自我增强的正反馈回路一旦启动,增长曲线将持续陡峭。
对行业的启示
如果连OpenAI内部都在以这样的速度增加AI编程工具的使用,那么整个行业的AI采用率很可能正处于一个拐点。对于企业决策者而言,问题已经不是"是否采用AI编程工具",而是"如何更快地全面铺开"。
值得思考的问题
当然,我们也需要保持审慎。输出token数量的增长并不直接等同于生产力的等比例提升。在软件工程领域,"代码行数"(Lines of Code, LoC)曾长期被用作生产力指标,但这一指标的局限性早在1980年代就被充分讨论——更多的代码行数可能意味着更低效的实现,而非更高的产出价值。AI时代的"输出token数量"面临类似的测量困境:token数量与代码质量之间不存在线性关系,AI生成代码的**"采纳率"(Acceptance Rate)**才是更接近生产力本质的指标——GitHub Copilot曾披露其代码建议的平均采纳率约为26-35%,但这一数字在不同任务类型间差异显著。此外,AI辅助编程的价值还体现在"认知负荷转移"上:即便最终代码经过大量修改,AI生成的初稿仍然可能显著降低了工程师的思维启动成本(Cognitive Startup Cost)。因此,评估AI编程工具的真实ROI,需要构建包含代码采纳率、缺陷率、迭代周期和工程师主观满意度的多维指标体系,而非单一依赖token计数。
此外,这组数据来自OpenAI内部——一个对AI工具天然友好、技术素养极高的组织。其他行业和企业能否复制这样的增长轨迹,仍有待观察。
但无论如何,当AI公司自己的使用数据都在以指数级增长时,"It's happening"这句简短的评论,或许是对当下AI编程浪潮最精准的概括。
核心要点
- OpenAI内部Codex输出token自2025年11月以来,研究部门增长56倍,客户支持32倍,工程27倍,法务13倍
- Codex新一代"代理模式"引入"规划-执行-反思"循环,使单次任务输出从数十token扩展至数万token,是增长的技术根源
- 非技术部门(客户支持、法务)的高速增长标志着公民开发者运动进入第三浪潮:自然语言即交互界面,技术门槛趋近于零
- AI工具使用符合创新扩散曲线规律,当前可能正处于早期多数渗透阶段的指数增长拐点
- 输出token增长不直接等同于生产力等比例提升,代码采纳率、缺陷率等多维指标才是评估真实ROI的关键
- OpenAI公开内部数据是强有力的产品背书,但其高技术素养的组织文化使得增长轨迹能否被其他行业复制仍有待观察
相关推荐
行业洞察纳德拉提出Loopcraft框架:用反馈循环构建AI生态系统
微软CEO纳德拉发表Loopcraft(循环工艺)文章,提出通过技术、商业、生态三重反馈循环构建前沿AI生态系统的方法论,解析微软AI战略布局及对行业的深层启示。
行业洞察美国国税局IRS全面引入Claude AI,联邦政府AI化进程加速
美国国税局IRS正在招募可全天候使用Claude AI的员工,标志着Anthropic成功打入联邦政府核心部门。本文分析IRS引入AI的战略意义、税务场景应用前景及对行业的深远影响。
行业洞察IRS移动App引发热议:政府数字化转型中的信任危机
美国国税局IRS拟推出移动App引发公众激烈讨论。本文分析支持者与反对者的核心论点,探讨数据安全、隐私保护与政府服务便利性之间的平衡,以及对政府数字化转型的深层启示。