AI伪造创造力:当每间办公室的创意都在趋同

当AI在每间办公室"假装创意"
近日,一则名为《Google Caught AI Faking Creativity in Every Office in America》的视频在Hacker News上引发讨论。尽管讨论热度尚处早期(8个赞、1条评论),但其抛出的命题直指当下生成式AI应用最尖锐的矛盾:AI真的具备创造力,还是只是在批量制造"看起来有创意"的内容?
这个话题之所以值得深挖,是因为它触及了AI办公工具大规模落地后,无数职场人正在切身感受到的困惑——当每个人都在用同一批大模型生成邮件、方案、PPT和文案时,所谓的"创意产出"是否正在陷入一种高度同质化的幻觉。
![hackernews source: Google Caught AI Faking Creativity in Every Office in America [video]](/media/screenshots/source/18770_0.png)
"伪造创造力"到底指什么
所谓AI"伪造创造力"(Faking Creativity),并非说AI在欺骗用户,而是指其生成机制的本质决定了它的"创意"是一种统计意义上的重组,而非真正的原创突破。
大模型创意的底层逻辑
生成式大模型的工作方式是基于海量语料预测下一个最可能出现的token。这意味着:
- 它擅长的是模式匹配与重组,而非从0到1的概念创造;
- 它输出的"新颖表达",往往是训练数据中已有元素的高概率组合;
- 当大量用户使用相似的prompt时,模型会收敛到相似的"最优解",导致产出趋同。
从技术实现上看,大语言模型的核心工作原理是自回归式的next-token prediction——即给定一段上下文序列,模型计算词汇表中每个token出现的条件概率分布,然后从中采样或选取概率最高的token作为输出。这个过程由Transformer架构中的自注意力机制(Self-Attention)驱动,模型通过数十亿乃至数万亿参数学习到的是训练语料中词语共现的统计规律。
Transformer架构最早由Google研究团队在2017年的里程碑论文《Attention Is All You Need》中提出,彻底改变了自然语言处理的技术范式。该架构的核心创新在于完全抛弃了此前主流的循环神经网络(RNN)和长短期记忆网络(LSTM)结构,转而完全依赖注意力机制来建模序列中的依赖关系。自注意力的计算过程涉及将输入序列中的每个token映射为Query(查询)、Key(键)、Value(值)三个向量,通过Query与Key的点积计算注意力权重,再对Value进行加权求和。这种机制的计算复杂度为O(n²),其中n为序列长度,这也是为什么上下文窗口长度一直是大模型的关键限制因素之一——更长的上下文意味着计算量呈平方级增长。现代模型通过各种技术(如FlashAttention、稀疏注意力、滑动窗口注意力等)试图缓解这一瓶颈。
自注意力机制允许模型在生成每个token时"回看"整个上下文窗口,计算当前位置与所有先前位置之间的相关性权重,从而捕捉长距离的语义依赖关系。但本质上,这种依赖关系是从训练数据中归纳而来的。
Temperature参数可以调节输出的随机性:低温(如0.1-0.3)趋向确定性,倾向选择概率最高的token,输出更可预测但也更单调;高温(如0.8-1.2)则增加随机性,给低概率token更多被选中的机会,输出看起来更"有创意"。此外,Top-K采样和Top-P(nucleus)采样等解码策略也在控制着输出的多样性边界。Top-K采样在每一步只从概率最高的K个token中选取,而Top-P采样则动态地选取累积概率达到阈值P的最小token集合——后者的优势在于能自适应地调整候选集大小,在模型"确信"时收窄选择范围,在模型"犹豫"时扩大探索空间。
但即便在高温设置下,模型探索的仍然是训练分布所覆盖的语义空间,而非真正跳出已知边界。模型不会产生训练数据中从未以任何形式出现过的概念,它只是以更不常见的方式重新组合已有元素。这就解释了为什么AI生成的内容可以在措辞层面显得"新颖",但在概念层面往往难以超越训练语料中已经存在的思想框架。
换句话说,AI生成的创意看起来天马行空,实则是在一个被训练数据划定的边界内做排列组合。它模拟了创造力的外观,却未必拥有创造力的内核。
为什么"每间办公室"都中招
视频标题特意强调"in Every Office in America",点出了问题的普遍性。当企业统一采购AI办公套件(如Google Workspace中的Gemini、微软的Copilot),员工使用的是同一套底层模型、相似的模板化提示。结果就是:
- 不同公司的营销文案开始"撞脸";
- 会议纪要、项目提案呈现出相似的结构和措辞;
- 个体表达的独特性被平均化、模板化所稀释。
这种现象的规模不容小觑。Google在2023年将Gemini深度整合进Workspace全家桶,覆盖Gmail智能撰写、Docs自动生成、Sheets数据分析和Slides自动排版等功能,面向超过300万付费企业客户。Gemini在Workspace中的角色不仅是简单的文本补全,还包括跨应用的语义理解——它能读取用户的邮件历史、日历安排和文档内容,生成"个性化"的输出。但这种个性化仅限于上下文适配层面,底层的生成概率分布对所有用户是共享的。
微软则通过Microsoft 365 Copilot将GPT-4能力嵌入Word、Excel、PowerPoint、Outlook和Teams,定价每用户每月30美元,截至2024年已有数十万企业启用。微软的策略更为激进——Copilot不仅辅助内容生成,还深入到会议总结、邮件优先级排序、数据分析叙述等工作流程的核心环节。这意味着全球数以亿计的知识工作者每天在使用本质上相同或高度相似的底层模型来生成工作内容。
Google和微软的AI办公套件之争实际上反映了两种技术路线的正面碰撞。Google凭借自研的Gemini系列模型,强调原生多模态能力(同时理解文本、图像、音频和视频)和与Google生态系统(搜索、地图、YouTube)的深度整合优势。微软则通过对OpenAI累计超过130亿美元的投资获得GPT系列模型的优先商用权,并将其通过Azure云平台分发给企业客户。两家都采用了"嵌入式AI"策略——不是让用户切换到独立的AI应用,而是将AI能力无缝融入用户已有的工作流程中。这种设计极大降低了使用门槛和认知负担,但也意味着用户可能在无意识中大量依赖AI生成内容,甚至逐渐丧失了区分"AI写的"和"自己写的"的意识边界。
当一个营销团队用Gemini写广告文案,他们的竞争对手可能在用同一个模型完成同样的任务——底层权重一致,概率分布一致,输出的趋同几乎是数学上的必然。即便两家公司提供了不同的品牌信息作为上下文,模型生成的句式结构、论证逻辑和修辞策略仍然会高度相似,因为这些"元层面"的写作模式是由共享的模型权重决定的,而非由用户提供的上下文决定的。
这种"集体性的伪创意",正是AI创意同质化最直观的表现。
技术视角:AI创造力是缺陷还是特性
从工程角度看,AI"伪造创造力"既不完全是bug,也不完全是feature,而是当前技术范式的必然结果。
创造力的两种定义
认知科学中,创造力通常被分为两类:
- 组合式创造力(Combinational):将已知元素以新方式组合。这恰恰是大模型的强项。
- 变革式创造力(Transformational):突破现有概念空间,创造全新的思维框架。这是当前AI的明显短板。
这一分类来自认知科学家Margaret Boden在其经典著作《The Creative Mind: Myths and Mechanisms》(1990年初版,2004年修订)中提出的三分框架。Boden是英国苏塞克斯大学的认知科学与计算机科学教授,她的创造力理论在人工智能哲学领域具有里程碑意义。Boden的核心贡献在于将"创造力"这一看似神秘的人类能力进行了可操作化的分解——她引入了"概念空间"(conceptual space)这一关键概念,认为任何创造性活动都发生在特定的概念空间内,该空间由一组生成规则(generative rules)所定义。
除了组合式和变革式创造力外,Boden还定义了第三种——探索式创造力(Exploratory),即在现有概念空间的边界内进行系统性探索,发现该空间中尚未被发现的可能性。例如,在十四行诗的格律约束内找到前人未曾使用的意象组合,或在爵士乐的和声体系内发现新的即兴路径。探索式创造力不改变规则本身,而是在规则框定的可能性空间中找到前人未曾到达的位置。
大模型在探索式创造力上也有一定表现——它能在特定文体或风格的约束下找到人类未曾尝试的表达组合,因为它"见过"的该空间内的样本远超任何个体人类。但变革式创造力要求打破概念空间本身的规则——如毕加索发明立体主义打破了文艺复兴以来的线性透视法则,爱因斯坦的广义相对论颠覆了牛顿的绝对时空观,达尔文的自然选择理论推翻了物种不变的信条。这种跳出系统规则的能力,需要对规则本身有元认知(meta-cognition)层面的理解——不仅知道规则是什么,还要理解规则为什么存在,以及打破规则会带来什么后果。这恰恰是当前基于模式学习的AI所不具备的:模型学到的是规则的统计表征,而非规则的因果逻辑。
值得注意的是,Boden本人对AI创造力的态度较为开放——她认为如果一个系统能够以系统化的方式探索和变换概念空间,那么"创造力"这一概念在原则上可以适用于机器。但关键区别在于,当前的大模型并非在有意识地探索或变换概念空间,而仅仅是在概率分布上进行采样——它们不"知道"自己在哪个概念空间中操作,也不"知道"空间的边界在哪里。
大模型能够高效完成组合式创造力的任务,因此在头脑风暴、初稿撰写、灵感发散等场景确实有价值。但如果把它当作变革式创新的替代品,就会陷入"伪造"的陷阱。
同质化背后的隐性成本
更值得警惕的是长期影响。当AI生成的内容反过来成为下一代模型的训练数据时,可能出现所谓的"模型坍缩"(Model Collapse)——输出多样性持续下降,整个信息生态趋向单调。
模型坍缩这一概念最早由英国牛津大学和剑桥大学的研究团队在2023年的论文《The Curse of Recursion: Training on Generated Data Makes Models Forget》中系统阐述。研究者通过数学建模和实验验证发现,当AI生成的合成数据被用于训练下一代模型时,会出现分布尾部信息逐渐丢失的现象——这在统计学上被称为"尾部收缩"(tail shrinkage)。具体而言,少数群体的表达方式、罕见但有价值的创意模式、边缘但独特的观点会在每一代迭代训练中被进一步边缘化,最终完全消失。这类似于生物学中的"遗传漂变"——在有限种群中,稀有等位基因会因随机采样而逐代丢失。
从信息论角度来理解,模型坍缩本质上是一个熵减过程。原始人类数据具有高熵特征——包含丰富的变异性、噪声和长尾分布。当模型对这些数据进行学习并生成新数据时,生成过程本身就是一种信息压缩——模型倾向于保留高概率(高频)模式而丢弃低概率(低频)模式。每经过一代递归训练,这种压缩效应就会累积叠加,导致数据分布的熵持续下降,多样性不断流失。
经过多代递归训练后,模型的输出多样性急剧下降,最终收敛到一个越来越窄的高斯分布上,丧失了原始人类数据中丰富的长尾特征。研究团队在GPT-2等模型上的实验表明,仅经过5-9代递归训练,模型输出质量就会出现显著退化。
这个问题在当前互联网环境中尤为严峻:据多项研究估计,到2025-2026年互联网上将有超过90%的内容由AI生成或辅助生成。如果这些同质化内容成为未来模型训练的主要数据源,整个AI生态可能进入一个创造力递减的恶性循环——模型从同质化数据中学习,产出更同质化的内容,再被用于训练更同质化的下一代模型。
办公场景中海量的AI生成内容——邮件、报告、提案、文案——正通过各种数据管道回流到训练集中,悄然放大这一风险。目前业界对此的应对措施包括:在训练数据中标注AI生成内容(如C2PA水印标准)、开发合成数据检测工具、以及在数据筛选流程中优先保留经过验证的高质量人工创作内容。但这些措施的覆盖面和有效性仍存在巨大的执行缺口。
如何正确使用AI创意工具
面对这一现象,一味否定或盲目追捧都不可取。更务实的态度是理解工具的边界。
把AI当放大器而非替代品
- 用于加速,而非替代思考:让AI处理初稿、扩展思路,但关键的判断、取舍和原创构想仍需人来主导;
- 主动引入差异化:通过个性化的prompt、独特的领域知识和人工润色,打破模型的"平均态";
- 保留人的最终署名权:创意的价值不仅在于结果,更在于背后的意图和责任。
打破AI输出同质化的关键在于prompt设计的个性化深度。基础的prompt(如"帮我写一份营销方案")会导致模型回退到训练数据中最常见的模式——因为缺乏约束时,模型的最大似然输出就是最"平均"的回答。而高级prompt策略可以显著提升输出的独特性:
- Few-shot示例注入:提供自己过去作品的片段作为风格锚点,让模型在in-context learning中捕捉个人独特的表达习惯和思维节奏。In-context learning是大模型的一种涌现能力——模型无需更新参数,仅通过提示词中提供的示例就能临时"学会"特定的任务模式或风格要求,这使得用户可以在不进行任何训练的情况下实现一定程度的个性化定制;
- 角色设定与视角切换:让模型模拟特定思维方式(如"以一位深谙中国茶文化的品牌策略师视角")而非通用助手,从而激活训练数据中更窄但更有特色的语义子空间;
- 约束创意(Constrained Creativity):通过看似矛盾的限制条件(如"用科技公司的语言风格描述一家百年老字号")迫使模型探索非常规的语义路径。这一策略的理论基础来自创造力研究中的"有益约束"(beneficial constraints)理论——适度的限制不会扼杀创造力,反而会迫使思维离开最轻松的常规路径,探索更独特的解决方案;
- Chain-of-Thought引导:要求模型先展示推理过程再给出结论,从而产生更独特的逻辑链,避免直接跳到最高概率的"标准答案";
- RAG(检索增强生成)注入:将企业私有知识库、内部文档、行业独家数据通过检索系统注入模型上下文,使输出锚定在组织独特的知识资产上,而非公共训练数据的"公约数"。RAG的核心原理是在推理时将外部知识以文本形式注入提示词,让模型基于这些独有信息生成回答,从而绕过底层权重共享带来的同质化问题。RAG系统通常由三个组件构成:文档分块与索引(将知识库切分为语义完整的片段并建立向量索引)、检索器(根据用户查询在向量空间中找到最相关的文档片段)、以及生成器(将检索到的片段作为上下文注入大模型提示词中)。这种架构使得模型的输出能够锚定在组织特有的知识上,产生竞争对手无法复制的差异化内容。
对企业部署AI工具的启示
对于大规模部署AI办公工具的组织而言,需要意识到:效率提升与创意同质化是一枚硬币的两面。在享受生产力红利的同时,应鼓励员工在AI产出之上进行二次创造,避免整个团队的输出陷入"千篇一律的高效平庸"。
具体而言,企业可以考虑以下策略:
- 建立AI输出的"差异化审查"机制:要求团队成员对AI生成内容进行至少30%的个性化改写,并在评审流程中明确标注哪些部分是人工原创、哪些是AI辅助,逐步建立"人机协作透明度"的组织文化;
- 定期进行"无AI创意日":如同一些团队设立"无会议日"一样,定期让团队成员完全依靠自身思考完成创意任务,保持独立思考的肌肉记忆,避免对AI产生认知依赖(所谓的"认知外包综合征")。认知心理学研究表明,创造性思维能力如同肌肉一样需要定期锻炼才能保持——长期将思考任务外包给工具会导致相关认知能力的退化,这种现象在GPS导航普及后人们空间记忆能力下降的研究中已得到验证;
- 投资构建企业私有知识库与微调模型:通过在企业内部数据上进行领域微调(Domain Fine-tuning)或使用LoRA等参数高效微调技术,使AI输出能够反映组织独特的思维方式、品牌调性和行业洞察,而非生成行业通用的"最大公约数"内容。LoRA(Low-Rank Adaptation)是微软研究院在2021年提出的参数高效微调方法,其核心思想是在原始模型的权重矩阵旁边注入低秩分解矩阵(通常秩为4-64),只训练这些新增的少量参数。例如,一个70亿参数的模型使用LoRA可能只需训练几百万个参数就能实现特定领域的适配,大幅降低了企业构建定制化模型的计算成本和数据门槛;
- 建立创意基线对比机制:定期将团队的AI辅助产出与竞争对手的公开内容进行相似度分析(可使用语义嵌入相似度计算),一旦发现趋同度超过阈值,即触发创意差异化警报。语义嵌入相似度分析的原理是将文本通过预训练的编码器模型(如Sentence-BERT、OpenAI的text-embedding-ada-002等)映射为高维向量空间中的点,然后通过余弦相似度来量化两段文本在语义层面的接近程度。与传统的关键词匹配不同,这种方法能够捕捉到即使用词不同但语义相近的"隐性撞脸"现象——两篇文章可能没有一个相同的句子,但在向量空间中的距离却近到令人警觉。
结语
"Google Caught AI Faking Creativity"这个略带戏剧性的标题,实际上提出了一个严肃而及时的问题。AI并没有"欺骗"我们,它只是忠实地做着它被设计去做的事——高概率地重组已知信息。真正需要反思的,是使用者是否把这种统计性重组误当成了真正的创造力。
在AI深度渗透每一间办公室的今天,保持对"什么是真正创意"的清醒认知,或许才是人类在这场人机协作中不可被替代的核心竞争力。正如计算机科学先驱Alan Kay所言:"预测未来最好的方式是发明它。"(The best way to predict the future is to invent it.)这句话出自Kay在1971年的一次演讲,彼时他正在施乐帕洛阿尔托研究中心(Xerox PARC)发明图形用户界面和面向对象编程——这些都是典型的变革式创造力的产物,它们不是对现有技术的重组,而是对"计算机应该如何与人交互"这一根本问题的重新想象。Kay后来还发明了Smalltalk编程语言,提出了"面向对象"的核心范式,并参与了个人计算机概念的早期构想——这些贡献共同塑造了我们今天所使用的计算环境的基本形态。Kay的名言提醒我们,真正的创新不是从现有选项中选择最优解,而是创造出此前根本不存在的选项本身。
而发明——这种变革式的创造行为——至少在当前技术范式下,仍然是人类独有的特权。这并非意味着AI永远无法实现变革式创造力,但它确实意味着在可预见的未来,人类在使用AI工具时需要始终保持一种清醒的认知:我们是在驾驭一个强大的模式重组引擎,而非在与一个真正的创造性伙伴协作。认识到这一点,才是在AI时代保持创造力的第一步。
相关推荐

陷阱题实测:Gemini完胜Claude的深层原因分析
通过5道精心设计的语言陷阱题对比Gemini 3.7 Flash与Claude Sonnet 5的表现,深入分析AI模型过度模式匹配、批判性思维缺失等核心问题,揭示大语言模型在抗诱导能力上的本质差异。

DeepSeek V4 Pro前端编程实测:对比Grok 4.6与Kimi K3表现
实测对比DeepSeek V4 Pro、Grok 4.6和Kimi K3在前端编程场景的表现,包括粒子效果和3D场景开发能力,从性能和成本两个维度分析各模型的性价比优劣。

DeepSeek V4-Pro深度解读:Agent能力升级、跑分实测与API涨价全分析
DeepSeek V4-Pro正式上线,Agent能力大幅升级,推理力度三档可调,原生支持OpenAI Responses API。本文深度解读V4-Pro跑分数据、与V4-Flash对比、DS Bench内部榜单表现,以及8月17日API分时涨价策略详情。