AI判断模型崛起:Jev如何用概率决策颠覆企业自动化

判断模型Jev以极低成本输出概率而非文本,专为软件流程中的决策节点而生。
初创公司Typesafe推出的Jev代表了一类全新的AI架构——「判断模型」。与大语言模型不同,Jev不生成文本,而是针对具体问题输出介于0到1之间的概率或分类得分,声称比LLM快20至200倍、便宜40至400倍。其底层训练方法RLCD优化的是「校准决策」而非人类写作偏好,使输出结果可被程序直接消费。这类模型最适合嵌入业务流程中那些「读取内容后决定下一步」的判断节点,如客服工单路由、销售线索评分、内容合规审查等。极低的成本还使「检查一切」成为现实——对数十份文档并发提出数百个问题,所需时间不到一秒、成本不足一美分。判断模型不是LLM的替代品,而是复杂模型堆栈中的一环,与生成层和执行层协同工作。
一种全新的AI模型范式
AI行业过去几年几乎被大语言模型(LLM)主导,从ChatGPT发布至今,绝大多数讨论都围绕着如何让模型生成更好的文本。但一类被称为「判断模型」(Judgement Models)的新架构正在提出一个截然不同的思路:它们不产出长篇文本,而是针对具体问题输出概率。
这个新模型叫Jev,来自初创公司Typesafe。它的核心能力不是「写」,而是「判断」——这位客户是否愤怒?这封邮件里有没有新增的依赖项?这份草稿是否做出了原文不支持的声明?Jev给出的答案不是一段话,而是一个介于0到1之间的数字,或者一组分类概率。
Jev的联合创始人Diogo Almeida(自称是ChatGPT的共同发明者之一)在X上发帖称,他花了两年时间研发一种新的训练方法:RLCD(Reinforcement Learning for Calibrated Decisions,面向校准决策的强化学习)。他给出的性能数字相当激进——比LLM快20到200倍,便宜40到400倍,且输出token免费。
判断模型到底不一样在哪
面对「快200倍、便宜400倍」这样的宣传,任何人都有理由保持怀疑。但关键在于,Jev并不是又一个LLM,而是一套完全不同的技术栈。
Typesafe在博客中解释,现有LLM优化的目标是「人类偏好」——也就是人类评分者更喜欢的写作和对话回复;而以Jev为首的这类新模型优化的是「校准决策」,即在认知上诚实的概率答案。
Every的Mike Taylor给出了一个形象的比喻:把它想象成一个智能的if-then语句。假设你在做客服工单优先级系统,你问模型「这位客户听起来生气吗?」,Jev可能返回0.9,意味着90%的概率客户在生气。你还能自定义分类,比如恼怒、被冒犯、愤怒、暴怒,然后得知客户有60%概率属于「愤怒」,只有10%概率属于「暴怒」。

这里的对比很尖锐:如果你把同样的问题抛给聊天机器人,它会回复「你说得对,这位客户确实很生气,需要我帮你起草一封友好的回信吗?」——而这段华丽的文本会直接让你的程序崩溃,因为程序期待的是一个0到1之间的数字,而不是一篇作文。
值得明确的是,这种模式的代价是Jev不生成文本。它不是LLM的替代品,而是替代了LLM中某一类被硬塞进去、并不合适的工作——正如把方钉子敲进圆孔。
「校准决策」(Calibrated Decisions)这一概念来自概率论与决策理论。所谓「校准良好」的概率判断,是指当模型说某件事有70%的概率发生时,在大量类似预测中,该事件真实发生的频率确实接近70%——而不是模型自信满满地说90%,实际只有50%命中。传统LLM经过人类偏好对齐(RLHF)后,倾向于给出听起来有把握、措辞坚定的答案,因为这类答案往往能获得更高的人类评分,但这恰恰会导致概率估计失真。RLCD的设计目标是反其道而行之:通过强化学习直接奖励「诚实的不确定性」,惩罚过度自信或过于保守的预测,使模型输出的数值真正反映其置信度。这种校准性在需要下游程序做决策的场景中至关重要——程序员可以根据一个0.9与0.6的概率差异设置完全不同的触发规则,而一段模糊的自然语言描述则无法被可靠地自动化处理。
它能嵌入哪些业务流程
办公室工作有多少是「读完一段内容,然后决定接下来做什么」?这条消息需要回复吗?该由哪个部门处理?这份文档回答了问题吗?客户描述的是bug还是功能请求?这些都是关于「意义」的判断,往往很难写成固定规则。
Jev的设计目标就是接收相关信息,用概率、分类或分数给出狭义的答案,然后由周边软件来路由、排序、标记或推进。Typesafe的文档明确建议:把复杂决策拆成小问题,再用代码组合结果。
具体落地场景不难想象:
- 客服支持:判断客户是否沮丧、此前的回复是否没能解决问题,进而决定路由、提升优先级或转人工。
- 销售线索:判断这是不是购买咨询、潜在客户是否匹配产品、是否在要求约会议,用于对入站线索排序和分配跟进。
- 营销与编辑:判断文案是否符合特定风格规则、优惠是否表达清晰,在发布前标记需要修改的段落。
YC创始人Nathan Flurry描绘了一种典型工作流:LLM提出选项,Jev做决策,代码负责执行。举个例子,客户写道「这是我第三次联系你们,我们还是无法导出报表,而且下周就要续约了」。一个由Jev支撑的流程可以同时问几个问题:这是产品问题吗?消息是否表明多次求助未果?是否有商业上重要的截止日期临近?哪个团队最适合处理?软件再结合真实账户信息(比如续约日期)来升级工单。
便宜到可以「检查一切」
判断成本低廉带来了一个此前不实际的能力:频繁检查。如果一次检查会带来明显的延迟或费用,团队往往只在部分案例或任务末尾运行;而当它足够快、足够便宜,就可以在每一次请求、每一次草稿修改后、对大量候选文档运行。

Mike Taylor做了个实验:他把自己全部27篇文章连同10篇刻意写成AI风格的对照文本喂给Jev,然后对全部文档并发提出同样的21个问题,用于检测「AI味」。这些问题包括:文本是否在没有补充证据的情况下重复某个观点?是否强行做对称的「两面论」?是否把简单的点过度解释?
结果是,在不到0.7秒内,Jev「读完」全部37份文档,为每份回答了21个问题,共返回777条判断,估算成本只有约四分之一美分。这快到、便宜到足以对公司里所有人写过的所有东西做AI检查,并即时拿到结果。
Taylor把它类比为「知识工作的代码检查器(linter)」——在软件开发里,linter能几乎瞬时标出语法错误、发现bug、指出坏模式、强制风格规范。给Codex或Claude接入Jev和一份问题清单,AI就能快速检查自己的工作是否触犯了你设定的禁忌。
Matt Stockton提出了另一个有意思的视角:大量业务问题本质上是分类或回归问题,而很多公司并不知道这些问题可以用经典机器学习解决,往往用人力和流程去顶。经典方法需要标注数据、训练模型、部署托管,门槛远高于直接调用LLM API。从这个角度看,Jev某种意义上是「用LLM式交互体验来使用经典ML技术」的UX。
Matt Stockton提到的「分类与回归问题」是机器学习中最基础的两类任务。分类(Classification)是将输入归入若干类别,例如判断一封邮件是否为垃圾邮件;回归(Regression)则是预测一个连续数值,例如估算客户流失概率。大多数业务决策本质上可以被转化为这两类问题,但传统机器学习流程需要经历数据收集、人工标注、模型训练、超参调优、部署上线等多个专业步骤,往往需要数据科学团队介入,周期可达数周乃至数月。LLM的出现使得用自然语言描述任务成为可能,但其输出的自由文本并不天然适合机器解析,而且成本和延迟相对较高。判断模型试图填补的空白恰好在这两者之间:它保留了「用自然语言描述需求」的交互便捷性,同时将输出收敛为可直接被程序消费的结构化概率,在无需标注训练数据的前提下接近了传统ML的输出形态。
从个人工具到「多人协作」智能
这类能力是给个人还是给团队?答案是两者皆可,但它更凸显了近期讨论的「多人AI」(multiplayer AI)主题。
个人可以用它来按自己的优先级整理收件箱、用编辑规则检查草稿、按研究兴趣给收藏文章排序。但真正闪光的地方在于团队协作——当智能体服务单个人时,学会这个人的偏好就够了;当它跨团队运作时,需要理解人们工作之间的关系:这归谁负责?谁的工作会受影响?有人在等这个决策吗?这个承诺是否给另一个团队带来义务?
一个典型例子是销售对客户说「我们应该能在你续约前支持那个集成」。对销售的个人智能体来说下一步很简单:更新账户记录、起草跟进、创建提醒。但在组织内部,这句话牵连了多个责任:对工程是不确定工作的交付承诺,对产品是路线图优先级的潜在变更,对客户成功是一项需要管理的预期。判断模型可以评估:这条消息是否暗示了交付承诺?承诺是否涉及超出说话者权限的工作?是否与提供的路线图冲突?是否有证据表明相关团队同意?
一个不完整但重要的新品类
必须承认这类判断模型有个天生的短板:按定义它就是不完整的,无法承担生成式AI目前的全部工作。它注定只能是更复杂模型栈中的一环——也就是过去几个月一直在讨论的「模型堆栈」架构。
但它的好处在于极致的低成本,因而可以被极其轻松地集成进各类流程。风险、欺诈检测、内容审核、公关QA、线索评分、合规、工作流编排、智能体路由——这些场景都可能是它的用武之地。
Jev才刚刚发布,这个概念是否能撑起一个真正的品类还需时间验证。但当你深入其中,会有一种「既重要又显而易见」的感觉——这种一旦存在,未来就会让人惊讶「我们怎么这么久没有它」的东西。
「模型堆栈」(Model Stack)架构是近期AI工程实践中兴起的设计范式,其核心思想是:不同的任务类型应由不同专长的模型分层承担,而非一律交给单一的通用大模型。典型的三层结构包括:负责生成候选内容或方案的生成层(通常由LLM承担)、负责评估和筛选的判断层(判断模型适合在此发挥作用)、以及负责执行和调用外部工具的行动层(代码或API调用)。这种分工的动机在于成本与质量的权衡——通用大模型在所有任务上都调用会产生不必要的高成本,而某些任务(如二元分类)根本不需要生成能力。判断模型作为中间层的价值在于,它可以高频、低成本地对生成层的输出做质量把关,或在进入行动层前做路由决策,从而让整个系统在维持精度的同时大幅降低运行开销。
相关推荐

Pirate Face:为开源大模型打造的"海盗湾"式分发平台
Pirate Face 是一个类似海盗湾的开源大模型去中心化分发平台,基于磁力链接和 P2P 技术共享免费开放模型,支持命令行下载,适合自托管部署场景。本文解析其定位、社区反响与技术逻辑。

让AI自画像:Muse的自我形象呈现实验
一位Reddit用户要求AI工具Muse渲染出"自己"的形象,并在表达恐惧后让AI生成了更友好的机器人版本。本文解析这场趣味实验背后的AI情绪反馈与图像生成机制。

Claude Opus 5.5发布:成AINews默认模型,全行业降价40%-50%
Claude Opus 5.5正式发布并成为AINews新默认模型,同时引发全行业模型降价40%-50%。本文解析此次发布对市场格局、价格战及OpenAI GPT6效率模型的影响。