把分类器逼成聊天机器人:Jev实验揭秘AI生成本质

开发者用七种手段逼迫"纯分类器"Jev写出完整句子,实验印证了生成本质上是连续分类选择。
本文记录了一位开发者对 AI 分类模型 Jev 的折腾实验:Jev 官方声明只做分类、不做生成,但开发者通过将每个字母/词语变成多选题、用完整候选结果而非单字符让模型做判断、引入温度扰动、精简词表、设置"词语锦标赛"等七种手段,最终逼出了连贯句子。核心规律是"猜测是绝望的,判断是有效的"——让模型看到完整候选结果再选择,比盲猜下一个字母有效得多。实验代价高昂:一句话最多需 90 次 API 调用、6 美分、30 秒,且早在 2019 年 BERT 类模型就走过同样的路。这场实验的价值不在工程实用性,而在于将"生成即分类"这一抽象命题具象化:生成式模型的每一步输出,本质上也是在庞大词表上做连续的分类选择,生成与分类之间的边界远比产品宣传语模糊。
一个主页上明确写着"我们不是聊天机器人"的 AI 模型 Jev,却被开发者用一堆巧妙的手段逼着说出了完整句子。这场看似荒诞的实验,其实揭开了一个被很多人忽略的技术真相:生成,本质上就是分类。本文基于一位开发者在 B 站/YouTube 上分享的 Jev 折腾实录,拆解其中的技术逻辑与启发。
Jev 是什么:一个"不许说话"的分类器
Jev 的文档写得很直白:它没有被训练来生成文本,如果你强行让它写字,效果会很差,而且会"慢得离谱"。它只做一件事——你给它一个问题和若干选项,它挑一个,并告诉你有多确定。
换句话说,Jev 是一个纯粹的分类器(classifier),而不是像 ChatGPT 那样的生成式语言模型。它的能力边界被设计得极窄:输入一组候选,输出一个带置信度的选择。
开发者的目标恰恰是反其道而行之——如果每个字母都变成一道多选题,是不是就能逼它"写字"?于是整场实验围绕一个核心问题展开:一个只会判断的模型,能不能被改造成一个会生成的模型?
分类器(classifier)与生成式语言模型(generative language model)在底层架构上的差异值得厘清。分类器的任务是将输入映射到有限的预定义类别之一,输出的是每个类别的概率分布,训练目标是让正确类别的概率尽可能高。生成式语言模型(如 GPT 系列)则在每一步从整个词表(通常数万乃至十万级别的 token)上预测下一个 token 的概率分布,并通过自回归(autoregressive)方式逐步构建完整输出。两者的根本区别在于:分类器的"候选空间"是固定且封闭的,而生成模型的候选空间在每一步都是开放的全词表。Jev 被设计为前者——它擅长在给定选项中做比较判断,而不是从零开始"发明"下一个词。这一设计边界,正是这场实验得以产生的前提。
第一次尝试:盲猜下一个字母几乎必然失败
最朴素的做法是:把当前已有文本喂给 Jev,让它从整个键盘里挑下一个字母,粘上去,再问一次。开发者让它输出"hello world",结果 H 的置信度 91%,E 是 81%,然后它开始无限输出 L,最终只憋出了类似"hell"的字符串。
问题出在哪?Jev 是在盲猜下一个字母,它看不到选择之后的完整结果,只能孤立地判断单个字符。而分类器的强项并不在"预测未来"。
转折点在于换了个思路:不再让它猜单个字母,而是把"加上每个可能按键之后的完整回复"都展示给它,让它在 HE、HF、HG 等整体结果之间做选择。结果 Jev 在 13 次调用内完美写出了"hello world"。
核心洞察:Jev 不擅长猜测接下来会出现什么,但非常擅长判断它已经看到的内容。
这正是整个实验反复验证的规律——猜测是绝望的,判断是有效的。

七种折腾方式:从温度调节到真实 token
当开发者跑到 Hacker News 吐槽时,发现同期至少有七个人做了几乎一模一样的东西,还有人写了论文。于是他干脆把这七个实现全测了一遍。
温度与随机性
第一个仓库在每次调用前打乱选项顺序,让 Jev 无法"赖在"某个偏好选项上,并像正常 LLM 一样对概率加入温度(temperature)扰动。温度调到最低时,这个"永不说话"的模型写出了"I am an artificial being"(7 次调用)。温度调高到 1 时它"像喝醉了",调到 2 时反而变成了胡言乱语的诗人。
温度(temperature)是控制语言模型输出随机性的一个超参数,作用于模型输出的 logits(原始概率得分)。具体来说,将每个类别的 logit 除以温度值 T,再经过 softmax 归一化得到最终概率分布。当 T < 1 时,概率分布变得更"尖锐",高概率选项的优势被放大,输出趋于确定和保守;当 T > 1 时,分布趋于"平坦",各选项概率差距缩小,输出变得更随机、多样,有时会产生意想不到乃至语义失连的结果——即文中描述的"喝醉"效果。温度参数本是为生成式模型设计的,将其引入分类器的推理过程,是这场实验的一个关键创意:通过干扰选项的概率偏好,避免模型一直"赖"在同一个高置信度字母上,从而使输出具有更自然的语言节奏。
给它一个真实键盘
第二个仓库给 Jev 配了完整键盘,包括退格键和发送键。它答对了"3×4=12",但深挖发现:在打字之前,它先跑了约 36 次调用,从八千多个词里办了一场"锦标赛"选出答案。拿掉这张"小抄",3×4 就变成了"3 4 equals 9"。
这里暴露了成本问题:一个答案约 40 次调用、半美分,而同样的回答用 Opus 模型会便宜 40 倍。那个被宣传为"快 200 倍"的模型,在随机胡说这件事上反而贵了 40 倍。
真实 token 与精简词表
第三个仓库给 Jev 真正的 GPT token,但有十万个之多,而 Jev 一次只能处理 255 个,于是只能先建候选短名单——正确 token 几乎从不出现在名单里。第四个仓库反其道而行,只给几百个最常用词,一次一个词,结果它"真的开始说话了",像一个靠冰箱贴学英语的人。

有意思的是,当开发者从词表里删掉 no、nope、not、never,问它地球是不是平的,它依然找到了被遗忘的否定词来表达反对;问它要不要买 meme coin,它回答"把钱放银行更好"——即便被动了手脚,它在财务上仍比不少"加密推特用户"更靠谱。
判断才是它的本职:生成即分类
第五个仓库把"判断"这条路走到了极致。Jev 从不猜任何东西,而是从上千个词里挑出几个可能合适的,拼成几百个短语,再从中选出"听起来不蠢"的那一个重复。
问它"人死后会怎样",它答"专家可能对此一无所知"——这恰好也是每个 AI 实验室被问到"你们的模型究竟怎么工作"时的标准答案。
更有说服力的是"判断自我"的测试:让 Jev 对比自己讲的烂笑话和一个经典笑话(关于稻草人获奖),它在两种顺序下都以 99% 的置信度选了经典笑话。它唯一真正被设计来做的事——判断——连对自己都毫不留情。

这不是新东西:2019 年就能做
最后一个带论文的仓库名字就叫《Generation is Classification》(生成即分类),它加了记忆和一个在发送前检查每条回复的"评论员"。这是第一个能真正对话的版本——但当被问到法国首都时它说"柏林",评论员标出语法错误却还是把它发了出去。
一半的评论都在说:这不是什么新东西,自 2019 年以来任何 transformer 都能这么干,甚至有篇论文叫《BERT has a Mouth, and It Must Speak》。开发者跑了一遍 2019 年的 BERT,结果同样糟糕——"三乘四等于五",草莓有"450 美元"。

这个证据很关键:把判别式模型改造成生成器并非魔法,而是一个早已被探索过的技术路径。 它慢、经常出错,而且对自己的错误异常自信。
BERT(Bidirectional Encoder Representations from Transformers)是 Google 于 2018 年发布的预训练语言模型,属于判别式(discriminative)而非生成式架构。它采用双向 Transformer 编码器,通过"掩码语言建模"(Masked Language Modeling,MLM)任务预训练——即随机遮盖输入中的若干 token,让模型预测被遮盖的内容。这一机制使 BERT 天然具备"填空"能力,理论上可以被用于逐词生成文本。论文《BERT has a Mouth, and It Must Speak》(2019)正是将这一思路系统化:通过迭代式掩码与填充,强行让 BERT 生成连贯文本。然而由于 BERT 的训练目标从未优化生成流畅序列,其生成质量普遍偏低,事实错误率高且对错误异常自信——这与本文实验中 Jev 的表现高度一致,说明"判别式模型勉强生成文本"是一类具有共性局限的技术路径。
实验的意义:成本、本质与边界
整场实验下来,一个正常句子要花 10 到 90 次调用、1 到 6 美分、5 到 30 秒。你得到的是一个慢、经常错、还很自信的"聊天机器人"。从工程角度看,这完全不实用。
但它的价值在于把一个抽象概念具象化了:生成式模型的输出,本质上也是在庞大词表上做连续的分类选择。Jev 这种纯分类器之所以勉强能"说话",正是因为生成和分类之间的界限远比产品宣传语想象的模糊。
最终,开发者把所有有效手段——用完整回复作为选项、词语锦标赛、末端加判断——缝合成一个"科学怪人"系统,问它"你是什么"。它先是答"I am AI",稍微调激进一点后,它爆出了一句:"我不是聊天机器人,我是个分类器。"
一个主页上写着"我不是聊天机器人"的模型,花了整场视频坚称自己就是——这或许是它能做出的最像聊天机器人的事。
需要提醒的是:以上内容来自单一来源(一位开发者的实验分享),关于 Jev 的具体技术细节和成本数据未经第三方交叉验证,读者宜当作一次有趣的技术探索而非严谨的 benchmark。
相关推荐

智能家居不是一款产品:Apple与LG合作背后的真相
Apple与LG合作打造支持Siri AI的智能家居设备引发关注,但智能家居的本质是逻辑编排而非单一硬件产品。本文剖析为何智能家居难以成为大众商品,以及AI可能带来的转机。

相信直觉:从UFC到Power Slap的创业决策哲学
商业领袖分享以直觉为核心的创业决策哲学:从UFC到Power Slap如何面对舆论质疑,如何理性评估失败成本,为什么真正的风险是从未尝试。附创业者决策启示。

Claude Code Skills 技能入门:把重复工作流一键自动化
Claude Code 的 Skills 技能让你把重复的多步骤工作流封装成 Markdown 文件,一键调用。本文详解 Skill 创建、加载机制、模型指定、调用控制、参数传递与动态上下文注入等核心用法。