AI产品为何总差口气?关键在"删"而非"造"

一位老兵的诊断:不是能力问题,是密度问题
Paul Bakaus 或许不是家喻户晓的名字,但他的作品几乎无处不在。作为 jQuery UI 的创造者,他写下的代码据称至今仍运行在约 6% 的互联网站点上。jQuery UI 是建立在 jQuery 库之上的一套用户界面交互组件集,包含拖放、日期选择器、对话框等常用 UI 元素,诞生于2007年前后 Web 2.0 时代网页交互需求爆发式增长的时期。即便在 React、Vue 等现代框架已成主流的今天,大量遗留系统和 WordPress 插件仍在使用它,这解释了其惊人的覆盖率。Bakaus 曾把一家游戏引擎创业公司卖给 Zynga,在 Google 度过近十年,如今作为独立创始人拿到了 a16z 的投资——a16z(Andreessen Horowitz)是硅谷最具影响力的风险投资机构之一,以押注平台级技术变革著称,其投资往往被视为某个方向获得行业认可的信号。Bakaus 正在打造一个名为 Impeccable 的开源"设计技能"项目,目标直指一个所有 AI 从业者都心知肚明的问题——阻止 AI 编程代理产出"slop"(低质量的敷衍产出)。

"Slop"一词在2024年成为科技社区的高频词汇,专指 AI 生成的低质量、缺乏个性的批量内容。它的危害不仅限于单个产品的品质下降,更在于它正在系统性地拉低整个互联网的内容质量基线——搜索引擎结果被 AI 生成的 SEO 内容淹没,开源代码仓库中出现大量 AI 生成的低质量提交,产品界面趋向千篇一律的"AI 风格"。这本质上是一个公地悲剧:每个个体使用 AI 降低成本是理性的,但集体效果是价值稀释。
在这段被广泛传播的采访片段里,Bakaus 抛出的核心观点耐人寻味:他谈的不是 AI 的能力边界,而是输出密度(output density)。这个概念可以类比为信息论中的信噪比——每单位产出中包含多少不可替代的有效信息或功能。在传统软件工程中,类似的理念早已存在:Robert C. Martin 在《Clean Code》中强调函数应当尽可能短小,每一行都有存在的理由;Dieter Rams 的设计十诫中"少即是多"也表达了同样的哲学。他的判断简洁而尖锐——大多数 AI 代理生成的代码,是"太多的代码";大多数 AI 写的文章,"太长";大多数 AI 生成的设计,"太杂乱、太啰嗦"。当输出密度低时,用户需要在大量冗余中自行提取价值,这本身就构成了认知负担和维护成本。
稀缺的不是生成能力,而是判断力
过去两年,整个行业的注意力几乎全部押注在"生成"这件事上——更快的模型、更长的上下文、更强的多模态。但 Bakaus 指出了一个被普遍忽视的真相:当前真正稀缺的人类技能,恰恰不是生成任何东西,而是判断力——知道究竟该删掉什么。
这是一个反直觉却极具穿透力的观察。当生成成本趋近于零,产出的"多"就不再是价值,而可能成为负担。大语言模型的训练机制决定了它的产出天然趋向冗余:基于 Transformer 架构的模型通过预测下一个 token 来生成内容,其本质是在训练数据的概率分布中寻找最可能的序列。RLHF(基于人类反馈的强化学习)进一步强化了模型"面面俱到"的倾向——因为在标注过程中,更完整、更安全的回答通常获得更高评分。这种训练范式使模型倾向于覆盖所有可能相关的信息,而非做出大胆的取舍。模型缺乏对具体使用场景的深度理解,无法判断"对这个特定用户、在这个特定时刻,哪些信息是多余的",只能给出统计学意义上的最优平均解。
因此,AI 可以轻松写出五百行代码来解决一个本该用五十行搞定的问题;可以铺陈两千字来表达一个段落就能讲清的意思;可以堆砌十几个交互元素来完成一个本应极简的界面。这些产出往往"技术上没错",却缺少了取舍的智慧。
"技术上正确"却平庸的陷阱
Bakaus 给出了一个极具实操价值的诊断标准:如果你正在用 AI 代理交付产品,一切读起来都"技术上没毛病",但整体却莫名地显得通用、平庸、没有灵魂,那么问题的根源就在这里。
他强调,这不是工具的缺陷(tooling gap),而是编辑的缺陷(editing gap)。这个区分至关重要,它实际上触及了软件工程和创意产业中一个长期存在的误区:人们倾向于用技术手段解决本质上是判断力的问题。在软件领域,这类似于 Fred Brooks 在《人月神话》中提出的"没有银弹"论断——本质复杂度无法通过工具消除。编辑(editing)在此的含义远超文字润色,它代表的是一种系统性的质量审视能力:在代码层面是重构与简化,在设计层面是信息层级的取舍,在产品层面是功能的优先级排序与勇敢砍需求。这种能力需要深厚的领域经验和对最终用户场景的共情理解。
很多团队在遇到 AI 产出质量不佳时,本能反应是换更好的模型、写更精巧的提示词、接入更强的框架。但 Bakaus 认为,真正缺失的环节是人类的编辑与删减——那种知道"少即是多"的审美判断。
连创造者本人也要推倒重来
最有说服力的证据来自他自己。Bakaus 坦承,在为自己的产品撰写发布公告时,AI 生成的初稿让他不得不从头重写。这个细节颇具讽刺意味:一个专门做工具来对抗 AI"slop"的人,也无法靠 AI 一次性得到满意的文案。
这呼应了文学与设计领域中"杀死你的宠儿"(Kill your darlings)的经典原则。海明威曾说"所有初稿都是垃圾",即便是人类写作也需要大幅修改。但 AI 产出的特殊问题在于:人类初稿虽然粗糙,通常包含作者独特的思维脉络和直觉判断;而 AI 初稿虽然表面流畅,却缺乏这种内在的思考骨架。这意味着对 AI 初稿的修改往往不是"打磨"而是"重建骨架"——你需要注入自己的叙事逻辑和价值判断,这本质上接近于重写。这也解释了为什么简单的"润色"类提示词往往无法解决 slop 问题。
这背后揭示的是创作的本质规律。AI 的第一版产出,本质上是一个"平均值"——它综合了训练数据中无数相似表达的中位数,因而天然趋向安全、完整、面面俱到,却也因此失去了棱角与观点。而好的产品、好的文章、好的设计,恰恰需要棱角。
设计是迭代过程,必须承载人类视角
Bakaus 的收尾观点将讨论提升到了更普遍的层面:设计是一个迭代过程,它必须承载一种人类的观点(human point of view)。无论是代码、设计还是写作,没有任何工具能够"一击即中"(one-shot)地完成这件事。
One-shot 在机器学习领域原指仅通过一个或极少样本完成学习的能力,Bakaus 在此将其引申为对 AI 工作流的批评。现代设计理论——无论是 IDEO 的设计思维(Design Thinking)、精益创业的 MVP 方法论,还是敏捷开发的迭代周期——都建立在同一个前提上:好的产出需要多轮反馈与修正。人类大脑处理复杂设计问题时也依赖"发散-收敛"的交替过程:先尽可能扩展可能性空间,再通过判断逐步收窄到最优解。AI 的 one-shot 产出跳过了这个认知过程,直接给出"看起来完整"的答案,但缺少了每一轮迭代中积累的对问题空间更深入的理解。真正有效的 AI 协作工作流应该模拟这种迭代节奏,而非追求一步到位。
所谓"人类视角",指的正是那些无法被平均值捕捉的东西——你为什么删掉这一段而保留那一段,你为什么选择这个交互而放弃那个,你的产品究竟想对谁说什么、不说什么。这些取舍构成了产品的个性,而个性恰恰是 AI 平均化产出最难复制的部分。
对 AI 时代创作者的启示
从行业视角看,Bakaus 的观察为当下的"AI 生产力焦虑"提供了一个冷静的坐标。
第一,生成不再是瓶颈,编辑才是。 当每个人都能用 AI 快速产出大量内容和代码时,差异化的护城河将从"能不能造出来"转移到"敢不敢删、懂不懂删"。这意味着团队应当重新分配人力——把更多精力放在评审、精简和取舍上,而非单纯追求产量。
第二,AI 的初稿应被视为原料而非成品。 无论是代码还是文案,把 AI 输出当作可以直接交付的终稿,几乎必然会带来 Bakaus 所说的"slop"。更健康的工作流是:AI 负责铺开可能性,人类负责收敛与打磨。
第三,审美与判断力将成为高价值技能。 在经济学框架下,当某种生产要素被彻底商品化时,互补性的稀缺要素就会获得超额价值——这被称为"互补品效应"。当 AI 使内容生成的边际成本趋近于零时,能够区分"好"与"平庸"的判断力就成了关键的互补稀缺资源。历史上类似的转变曾多次发生:印刷术的普及使编辑和出版人的品味成为核心价值;数码摄影的普及使策展与图片编辑的眼光变得更加重要;音乐制作工具的民主化使 A&R(艺人与曲目管理)的判断力溢价上升。AI 时代的"编辑力"溢价可能远超过往任何一次技术民主化浪潮,因为这一次生成能力的爆发速度和规模都是史无前例的。这对内容创作者、设计师和工程师都是一个明确的信号:培养删减的勇气与判断的敏锐,比学会更多的提示词技巧更为重要。
Bakaus 正在用 Impeccable 这个开源项目把这套哲学产品化——试图让 AI 编程代理学会"少写一点、写好一点"。无论这个具体产品最终成败如何,他指出的方向都值得每一个用 AI 交付产品的人认真思考:
让产品变好的,往往不是你加了什么,而是你敢删掉什么。
核心要点
相关推荐

Gutta:Mac菜单栏极简离线待办工具,键盘优先无需订阅
Gutta是一款常驻Mac菜单栏的轻量离线待办工具,支持键盘快捷唤起、自然语言输入任务、本地存储无需账户。无订阅费用、无数据追踪,适合追求极简高效的个人任务管理用户。

陷阱题实测:Gemini完胜Claude的深层原因分析
通过5道精心设计的语言陷阱题对比Gemini 3.7 Flash与Claude Sonnet 5的表现,深入分析AI模型过度模式匹配、批判性思维缺失等核心问题,揭示大语言模型在抗诱导能力上的本质差异。

DeepSeek V4 Pro前端编程实测:对比Grok 4.6与Kimi K3表现
实测对比DeepSeek V4 Pro、Grok 4.6和Kimi K3在前端编程场景的表现,包括粒子效果和3D场景开发能力,从性能和成本两个维度分析各模型的性价比优劣。