Zig作者批评Anthropic:AI宣传与技术现实的落差
Zig作者批评Anthropic:AI宣传与技术现实的落差
一场关于AI宣传的直言不讳
编程语言Zig的创造者Andrew Kelley(社区昵称"andrewrk")近日发表了一篇引发广泛讨论的文章,直言批评AI公司Anthropic在产品宣传中"放烟雾弹"(Blows Smoke),并以"实话实说"(Calls Spade a Spade)作为对照。文章在Hacker News上迅速获得关注,引爆了技术社区对AI营销话术与真实技术能力之间落差的深入探讨。
Hacker News是由Y Combinator运营的技术社区论坛,长期是硅谷工程师、创业者和投资人的信息聚合地。该社区以对技术细节的高要求和对营销话术的低容忍度著称,形成了独特的"工程师批评文化"。在这一社区中,针对AI公司宣传的质疑声音由来已久——从早期对GPT-3能力边界的争议,到对各类"AI Agent"实际落地效果的持续跟踪,社区成员普遍具备较强的独立验证意识。值得一提的是,Hacker News本身的排名算法也经过精心设计,会刻意压制单纯的营销内容,优先推送具有实质性技术讨论价值的帖子,这使其用户群体长期保持着对"过度包装"的高度警觉。Kelley的文章能在此引发讨论,恰恰说明这类批评击中了工程师群体的集体痛点:他们往往是AI产品的直接使用者,对宣传与现实之间的落差感受最为直接。
作为以务实、坦率著称的系统级编程语言设计者,Kelley的批评并非情绪化攻击,而是来自一线工程师视角的尖锐质疑:AI公司所宣称的能力,与实际交付给开发者的产品之间,究竟存在多大的鸿沟?
争议核心:营销叙事与技术现实的碰撞
什么是"放烟雾弹"?
Kelley所批评的"放烟雾弹",指的是AI公司通过精心设计的演示、模糊的性能描述和富有想象力的未来叙事来塑造产品形象,却刻意回避可验证的技术细节与明确的能力边界。
这一现象在行业中有专门的名称——"评测游戏"(Benchmark Gaming)。所谓评测游戏,是指AI公司通过选择性地使用特定基准测试来最大化模型表现分数的行为。典型手段包括:在训练数据中混入测试集相关内容(数据污染)、针对特定评测集进行过度优化,以及刻意选择对自身模型有利的评测维度进行横向比较。这一问题的结构性根源在于,AI领域目前尚缺乏类似软件工程中IEEE标准或网络协议中RFC规范那样被广泛接受的第三方能力认证体系,各公司在很大程度上可以自主决定发布哪些评测结果、隐藏哪些评测结果。
学界对此已有专门研究,Goodhart定律在此处体现得淋漓尽致。Goodhart定律最初由英国经济学家Charles Goodhart于1975年提出,其原始背景是货币政策领域——当英国央行将M3货币供应量作为政策调控目标时,金融机构便开始通过各种规避手段操控该指标,导致M3不再能真实反映货币状况。这一洞察后来被社会学家Marilyn Strathern进一步总结为:"当一个度量标准变成目标,它就不再是一个好的度量标准。" 这一定律在AI评测体系中的体现尤为突出:当MMLU、HumanEval、GSM8K等基准测试成为模型竞争的核心战场,各公司便开始系统性地针对这些测试进行优化,导致基准分数与模型在真实场景中的实际效用之间产生持续扩大的鸿沟。2023年,多项独立研究表明,部分顶级模型在标准数学推理测试中分数极高,但在等价的"重新表述版本"上成绩却大幅下滑,证明模型学习的是测试模式而非真正的推理能力——这一现象在学界被称为"评测集过拟合"(Benchmark Overfitting),已成为AI能力评估领域最核心的方法论挑战之一。当评测指标本身成为优化目标时,它就不再是真实能力的可靠度量。
自2022年ChatGPT引爆生成式AI浪潮以来,AI产品的发布叙事逐渐形成了若干固定模式:精心挑选的演示案例(Cherry-picking)、以最优条件测试的基准分数、以及大量使用"接近人类水平"等模糊比较表述。模型往往在特定标准测试上表现优异,但在真实工程场景中却频繁出现幻觉、逻辑断层或上下文理解失准。对于工程团队而言,基于此类宣传做出技术选型的代价是真实的:集成成本、提示工程投入、错误处理机制都可能因能力预期偏差而大幅超支。
对于深耕底层技术的工程师而言,这与工程界推崇的"精确性"和"可复现性"背道而驰。在系统编程领域,一个函数要么正确运行,要么不能;性能提升要么能被基准测试量化,要么就是空话。而AI产品的宣传却常常游走在"看起来很强"与"实际能做什么"之间的灰色地带。
Zig的工程哲学:所见即所得
Zig是一门创建于2015年前后的系统级编程语言,定位为C语言的现代替代品。其最核心的设计决策之一是**'comptime'(编译期计算)**机制,允许在编译阶段执行复杂逻辑,从而减少运行时的不确定性。与C的预处理器宏(本质上是文本替换,缺乏类型安全)或C++的模板元编程(语法复杂、错误信息晦涩)不同,comptime允许开发者在编译期执行完整的Zig代码逻辑,包括循环、条件判断和函数调用,且使用与运行时代码完全一致的语法。这意味着泛型编程、序列化/反序列化代码生成等通常需要运行时反射或代码生成工具的场景,在Zig中可以用普通代码完成——元编程从语言的特殊子系统变成了普通代码的自然延伸,极大降低了可审计性门槛。Zig没有预处理器、没有宏系统,也没有隐式类型转换,所有异常处理必须显式声明。从语言生态的角度看,Zig的定位与Rust有所不同:Rust通过所有权系统在编译期保证内存安全,而Zig更侧重于提供"没有魔法"的可控编程体验——它允许手动内存管理,但要求所有分配行为对程序员完全可见,这与Kelley对AI产品"隐藏能力边界"的批评形成镜像关系。
Zig在错误处理上的设计哲学是其透明度理念最具体的技术体现。 与Go语言的多返回值错误、Rust的Result类型或C++的异常机制不同,Zig要求所有可能失败的函数在类型签名中显式标注错误集合(Error Set),调用方必须通过try关键字传播或通过catch显式处理每一个错误路径。这意味着在编译期,代码审阅者就能从函数签名直接看出该函数可能产生哪些失败模式,无需深入实现细节。这种设计消除了"隐式异常"——即在调用栈深处抛出但调用方难以察觉的错误,这类隐式异常在大型C++项目中是常见的稳定性隐患。更重要的是,Zig的错误集合是可组合的类型系统元素,编译器会强制验证所有错误路径都得到了处理,这与大语言模型API中常见的"偶尔可能出现不准确"等宽泛免责声明形成了鲜明对比——前者在类型层面做出了可机器验证的承诺,后者则将不确定性完全推给了调用方。
其核心设计哲学极度强调可预测性与透明度——语言规范明确禁止隐藏的控制流(如运算符重载触发的异常)和隐藏的内存分配,开发者必须显式处理所有可能失败的操作。这种对可审计性的极致追求,使Zig代码在行为透明度上远超许多现代语言,也已被TigerBeetle数据库等高可靠性系统采用。
Kelley将这一设计原则延伸到对AI产品的批评:正如函数应该明确声明其错误边界,AI系统也应当明确声明其能力边界,而非将失败模式隐藏在"偶尔可能出现幻觉"等宽泛免责声明中。Zig语言本身就是Kelley技术价值观的集中体现——"没有隐藏的控制流、没有隐藏的内存分配",核心在于透明、可预测和可控。正是这种长期浸润于"所见即所得"工程训练中的思维方式,让他对AI宣传中充斥的模糊性和不可验证性尤为敏感,并与他对AI宣传的批评形成了直接呼应。
Kelley的立场可以归结为:技术产品应当清晰说明自己能做什么、不能做什么,而不是用宏大愿景掩盖当前的局限性。这种态度在浮躁的AI热潮中显得尤为难得。
为什么这一批评值得关注
AI行业的宣传通病
Kelley的批评之所以引发共鸣,是因为它触及了行业普遍现象。Anthropic成立于2021年,由前OpenAI核心成员Dario Amodei和Daniela Amodei创立,其创立本身源于创始团队离开OpenAI时对AI系统**对齐(Alignment)问题处理方式的核心分歧。该公司发展了宪法AI(Constitutional AI)**方法论——其核心创新在于用一套明确的"原则清单"(即"宪法")替代传统RLHF中大量的人工标注,让模型通过自我批评和修订来迭代输出。具体流程包括:首先让模型生成初始响应,然后要求同一模型对照宪法原则批评该响应并提出修改,最后基于修改版响应再进行强化学习微调。这一方法显著降低了人工标注成本,同时使"价值观植入"过程更加可审计。然而,其局限性同样明显:宪法本身由人类制定,其内容的合理性和完备性难以独立验证;此外,模型自我评估的准确性本身依赖于其已有的理解能力,形成了一定程度的循环依赖。值得注意的是,"宪法"这一术语本身就是一个精心选择的营销命名——它唤起了成文法律体系的权威感和系统性,但实际上这份"宪法"是一个可随时由Anthropic修订的内部文档,并不具备法律文件所暗示的稳定性和独立监督机制。这使得CAI在学术界既被视为重要技术进展,也常被讨论其作为品牌叙事的营销功能。
'AI对齐'和'AI安全'本身至今缺乏业界统一的可测量定义,导致这些术语极易被用作差异化营销标签而非可验证的技术承诺。Anthropic已累计融资超过70亿美元,其估值逻辑在相当程度上依赖于"负责任AI领导者"的品牌形象——而"安全AI"本身也构成一种强有力的营销叙事,它暗示竞争对手不够安全,同时又难以被独立量化验证。当"安全"、"对齐"、"负责任"等词汇被大量使用却缺乏可操作定义时,它们便从技术承诺滑向了品牌话术。
生成式AI爆发以来,几乎所有主流AI公司都在进行某种程度的"能力包装":从"接近人类水平"的模糊表述,到经过精心筛选的演示案例,营销叙事往往跑在技术实现的前面。
对开发者而言,这种落差带来的不只是失望,还有实际的工程风险。基于AI能力宣传做出技术选型的工程团队,面临的风险远比传统软件选型更为复杂——传统软件库的性能可以通过标准化基准精确测量,而大语言模型的能力边界往往是模糊的、场景依赖的。这导致企业在集成AI能力时常常遭遇"最后一公里"问题:模型在通用评测中表现优异,但在特定业务场景下却频繁产生幻觉或推理错误。
提示工程(Prompt Engineering)的出现本身就是对这一问题的应对机制,但其工程成本值得正视。 提示工程是指通过精心设计输入文本的结构、措辞和上下文,以引导大语言模型输出更符合预期结果的技术实践。常见技巧包括思维链提示(Chain-of-Thought,CoT)、少样本学习(Few-shot Learning)、角色设定(Role Prompting)以及结构化输出约束等。思维链提示由Google Brain团队于2022年正式提出,其核心发现揭示了一个深层问题:相同的模型,在不同提示策略下的表现差异可达数十个百分点,这意味着"模型能力"并非一个固定值,而是高度依赖提示设计的变量。在工程实践中,提示工程已演变为一项专业岗位,但其本质是对模型能力不确定性的"补偿性开发投入"——工程师需要投入大量时间寻找能稳定触发正确行为的提示模板,且这些模板在模型版本更新后往往需要重新调试。从软件工程的接口稳定性角度来看,这一现象尤为值得关注:一个设计良好的API应当在版本迭代中保持向后兼容性,而LLM的"接口"——即如何有效提示模型——却随每次模型更新而悄然漂移,这意味着围绕AI能力构建的工程系统天然具有较高的维护成本,而这一成本在营销宣传中几乎从不被提及。这与传统软件开发中函数接口的稳定性形成鲜明对比,也是Kelley等系统级工程师对AI产品可靠性持保留态度的重要技术原因之一。Kelley作为一线开发者,敏锐地捕捉到了这一潜在危害。
技术诚信的稀缺价值
这场争议的深层意义,在于它重新提出了"技术诚信"这一命题。在争抢融资、市场份额和媒体曝光的竞争环境中,AI公司是否还愿意坦诚面对产品的能力边界?
Kelley用行动给出了自己的答案:他选择做那个"指出皇帝没穿新衣"的人,即便这意味着与行业主流的宣传方式唱反调。这种坚持,本身就是一种稀缺的价值观表达。历史上,类似的"技术诚信"声音也曾在其他领域出现——从Dijkstra对"goto语句有害"的批评,到Ken Thompson在图灵奖演讲中对软件信任链的反思——这些声音往往在当时显得逆流而上,却在事后被证明具有持久的工程价值。
技术社区的反应与思考
尽管这篇文章在Hacker News上的讨论规模不算庞大(36个点赞、7条评论),但所引发的思考颇具分量。技术社区对"营销话术vs技术真相"的敏感度正在提升,越来越多的开发者开始要求AI公司提供更透明、更可验证的能力说明。近年来,这一趋势也催生了若干具体行动:独立研究团队建立了如**HELM(Holistic Evaluation of Language Models)**等更全面的评测框架——HELM由斯坦福大学CRFM(Center for Research on Foundation Models)于2022年发布,试图在同一框架下跨42个场景、7个核心指标(准确性、校准性、鲁棒性、公平性、偏见、毒性、效率)对模型进行综合评估。HELM的方法论创新在于引入了"校准性"(Calibration)评估——即模型对自身答案置信度的准确程度,这直接对应了Kelley批评的核心问题:模型是否能诚实地表达自己的不确定性,而非以过高置信度输出错误答案。部分开发者社区也开始自发整理"AI能力现实清单",记录各类模型在真实工程任务中的实际表现与宣传描述之间的差距。这些自下而上的努力,正在逐步形成对AI宣传叙事的反制力量。
值得强调的是,这类批评并非否定AI技术本身的进步,而是一种建设性呼吁:希望AI公司能以更务实、更诚实的方式,向用户和开发者传达产品的真实状态。技术的价值终究要靠实际交付来证明,而非依赖精心编织的叙事。
结语:给AI行业的一面镜子
Andrew Kelley的这次发声,本质上是为整个AI行业竖起一面镜子。它提醒我们,在AI能力快速迭代的当下,保持对技术宣传的批判性思考依然不可或缺。
对开发者而言,最务实的应对或许是:不被华丽演示迷惑,坚持通过实际测试验证产品能力。对AI公司而言,或许应当重新审视——真正赢得开发者长期信任的,从来不是营销话术,而是经得起检验的技术实力。
正如Zig语言"实话实说"的设计哲学,整个AI行业或许都需要少一点烟雾,多一点坦诚。
核心要点
核心要点
核心要点
核心要点
相关推荐

开源权重模型之争:安全与开放如何平衡
深入分析开源权重模型的核心争论:模型权重公开发布带来透明度与创新,但也引发安全滥用风险。本文探讨分级发布、红队测试等折中方案,解读开源AI背后的行业博弈与治理挑战。

抱怨如何侵蚀你的心智:注意力自我强化效应解析
习惯性抱怨正在训练大脑发现更多负面信息,形成恶性循环。本文从注意力自我强化机制出发,解析抱怨的心理侵蚀过程,并提供主动管理注意力、跳出负面循环的实用方法。

Steam恶意软件溯源:比特币、Cookie和外卖订单如何锁定攻击者
一起Steam恶意软件案件中,调查人员通过比特币交易链、Google Cookie和Uber Eats外卖订单三条线索交叉验证,成功溯源攻击者真实身份。深入解析数字取证技术与匿名幻觉。