[控场AI]
· 10 分钟阅读· 5,044 字

语音AI为何比想象中更难:PolyAI温绍恩深度解析对话节奏

语音AI为何比想象中更难:PolyAI温绍恩深度解析对话节奏

PolyAI创始人揭示语音AI的真正难点:不在推理而在适应,端到端架构与IO契约是破局关键。

PolyAI的温绍恩在本次访谈中提出,语音AI的核心挑战不是推理能力,而是对时间、噪音和真实对话模式的适应能力。他批评了"拼接ASR+LLM+TTS"的级联架构在企业场景中的脆弱性,并解释了PolyAI为何押注端到端音频原生模型——该模型以音频为输入、文本为输出,将轮次切换信号作为首个预测token,兼顾了企业级可控性与对话自然度。他还指出,PolyAI的核心竞争力不在于模型本身,而在于IO契约设计和基于真实联络中心数据构建的数据护城河。延迟工程、噪音注入训练、自适应预算推理以及"认知负债"等议题共同构成了企业级语音AI在未来十年最重要的工程与组织挑战。

当ChatGPT横空出世时,很多人以为语音AI的问题即将被解决——只要把语音识别(ASR)、大语言模型和语音合成(TTS)拼接起来就行。但PolyAI的温绍恩(Shawn Wen)在这期访谈中给出了一个反直觉的判断:语音对话比大多数人想象的要难得多,而真正的难点不在于推理,而在于适应。

语音是通往物理世界的第一步

温绍恩提出了一个精彩的框架:当下绝大多数AI创新集中在文本和数字世界。解一道博士级物理题已经不是难事,因为有海量文档和论文可供模型学习。但语音场景引入了一个全新维度——时间。

"时间是一个非常关键的因素,而我们还没有训练出能真正理解这一概念的模型。"他把语音问题类比为机器人技术:对人类来说,在物理世界中收集数据是自然而然的,我们有视觉、有肢体动作、能伸手触碰物体。但计算机没有这些,它们掌握的只有如何使用电脑、如何处理文本。

他引用了著名的沃兹尼亚克咖啡杯挑战(让机器人给我泡杯咖啡),以及朋友创业做机器人的第一个目标——"让机器人给我倒杯啤酒",来说明物理世界任务的难度。语音之所以难,正是因为"机器从未真正观察过人类之间海量的真实对话"。这背后呼应了Rich Sutton的"苦涩教训":真实对话中失败模式的组合是指数级的,手写规则无法穷尽,只有端到端训练的神经网络才能覆盖。

Rich Sutton的"苦涩教训"(The Bitter Lesson)发表于2019年,是机器学习领域的重要反思文章。Sutton通过回顾70年AI研究史指出:每当研究者试图将人类先验知识(hand-crafted rules)编入系统时,短期有效但长期都被"暴力"的计算规模与通用学习方法所超越。国际象棋、围棋、语音识别、计算机视觉无一例外。这一教训对语音对话尤为刺耳——真实对话的失败模式(用户方言、背景噪音、话语中断、语义歧义等)的组合是指数级的,任何试图手写规则覆盖"所有例外"的工程努力都注定徒劳。Sutton的结论是:搜索与学习是两种通用方法,给它们足够的计算资源,它们会胜过任何领域专家知识的堆砌。这正是PolyAI押注端到端训练而非模块化规则系统的理论底气。

企业要的是一个矛盾体

谈到企业客户究竟想要什么,温绍恩总结出一个核心矛盾:

"他们想要智能体像人类一样强大,又想要它像机器人一样可控。这其实是一个非常矛盾的诉求。"

除此之外,企业还要求品牌化的声音——智能体要能准确念出品牌名、以品牌期望的方式表达身份。这种"既要人类能力又要机器可控"的期望,构成了AI在企业部署中的根本难点。用户对AI的预期是"至少要和团队里最优秀的人一样好",这让采纳曲线变得陡峭。只有找到明确的效率提升场景,企业才会逐步接受并发现"智能体其实比想象中更好"。

温绍恩特别指出消费级和企业级的分野:"消费场景下,语音智能体现在已经可以构建了。但企业级有额外的治理要求、合规要求需要满足。"

为什么要自建端到端模型

大约一年前,PolyAI做出了一个判断:级联式(Cascaded)架构终将过时,端到端模型才是未来。他们因此停止了对自有语音识别模型的投入。

市面上最新的语音到语音(speech-to-speech)模型确实演示效果惊艳,但一旦部署到联络中心就会在各种地方崩溃。温绍恩举了一个生动的例子:一位第一次和机器人通话的老太太反复困惑、停顿,而智能体却不断抢话、覆盖她的发言——这种挫败感是致命的。

"前沿实验室并没有在优化我们所关心的东西,也就是B2B业务场景下真实的对话轮次切换(turn-taking)。"

传统级联系统由语音识别器、大语言模型和独立的轮次检测三部分组成,这三个模块彼此配合不佳,需要手动调参。而把它们"坍缩"成一个端到端模型后,大语言模型可以直接感知音频——无论是语速放慢、背景噪音还是交叉说话,模型都能从数据中学会适应。

端到端语音模型的流式输出架构

级联式(Cascaded)架构是当前语音AI产品的主流实现路径,通常由三个独立模块串联组成:语音识别(ASR)负责将音频转为文字,大语言模型(LLM)负责理解文字并生成回复,文字转语音(TTS)负责将回复读出。每个模块都有自己的延迟、错误率和调参空间,模块间的"接缝"是故障高发地带。例如ASR将"我想cancel我的订单"误识别为"我想cancel我的订单s",LLM便在错误输入上生成回复,TTS再将其念出——错误逐级放大。轮次切换(turn-taking)在级联架构中尤为棘手,通常依赖端点检测(VAD,Voice Activity Detection)模块,该模块只能感知静音时长,无法理解"我停顿是因为在思考,而不是说完了"这类语义信号。端到端模型将上述所有模块"坍缩"进一个统一的神经网络,使模型能同时从音频信号和语义上下文中联合判断轮次状态,从根本上解决了模块间配合不佳的问题。

巧妙的IO契约:音频原生模型架构

温绍恩详细拆解了他们的高层架构,核心是一个音频原生(audio-native)的大语言模型,但输出的是文本而非语音。原因很实际:文本更容易施加护栏(guardrail),而语音处理起来太棘手——这正是企业级场景对可控性的需求。

模型的工作流程颇具巧思:

  • 第一个token预测轮次信号:判断用户是刚开始说、还在说、还是说完了。这个token生成成本极低。
  • 音频预处理前置:在预测首token时音频已被编码进嵌入空间,无需从头编码整句。
  • 流式输出响应或工具调用:像ChatGPT一样流式返回。
  • 生成引用(citation):标明回答基于知识库中的哪些事实,供企业审计。
  • 最后才输出转写文本:顺序被刻意"倒置",因为转写只用于审计和调试,不需要等它完成就能回应用户。

温绍恩反复强调:"我们的创新不在模型本身,而在IO契约。"也就是如何准备数据、如何设计输入输出的机制。由于开源模型每月甚至每周都在更新,PolyAI维护的是自己的数据护城河和训练脚本——新模型一出来就能在上面训练,择优选用。"底层模型其实没那么重要。"

PolyAI自托管模型以降低网络延迟

护栏(Guardrail)在AI工程中指一系列用于约束模型输出的机制,目的是防止模型产生有害、不准确或不符合企业策略的内容。典型的护栏措施包括:关键词过滤、输出分类器(检测仇恨言论或PII泄露)、事实一致性校验(对比知识库)以及格式强制约束。对语音输出施加护栏远比对文本困难——文本是离散的、可解析的字符序列,而语音波形是连续信号,修改某个词意味着重新合成整段音频,延迟代价高昂。PolyAI选择"音频输入、文本输出"的混合架构,本质上是在感知层保留音频的信息丰富度(语速、情绪、停顿),在生成层退回到文本的可控性,再由下游TTS合成最终语音,从而在企业合规要求与模型能力之间找到工程平衡点。引用(Citation)机制则进一步强化了可审计性,每条回复都附带"出处",使企业法务和合规团队能追溯智能体的决策依据。

数据、噪音与延迟工程

语音数据比文本数据难收集得多。PolyAI的优势在于其平台本身就在银行、公用事业、物流、餐饮、酒店等企业联络中心运行,天然产生大量真实对话数据。通过脱敏(redact)所有个人身份信息(PII)并生成假PII数据,模型学到的是"对话的机制"而非真实用户数据。

在噪音处理上,他们采取了反直觉的做法:刻意加入各种噪音。甚至用生成模型在训练数据上叠加背景噪音(比如让机器人念名字时加入婴儿哭声)。有趣的是,上一代技术中的降噪、净化流程反而让新模型表现更差——"因为环境太干净了,是它从未见过的。"

延迟工程方面,温绍恩指出历史上级联系统最大的瓶颈是"判断用户何时说完"的粗糙参数:调得太激进就老抢话,调得太长用户又没耐心。端到端模型因为能同时感知语速和语义,"如果我在句子中间停顿、语义还没完成,智能体就知道要继续等。"

他们还在探索自适应预算推理(auto reasoning):训练模型自己判断"如果现在停止思考,能给出好答案的概率有多大",像倒计时竞赛一样在延迟预算内完成思考。配合填充语句、打字声、甚至等待音乐等产品技巧,来维持用户信任——因为"用户被自动化系统坑过太多次,AI在电话里沉默三五秒就会让人恐慌"。

自适应预算推理(Adaptive Budget Reasoning,文中也称auto reasoning)是近期在推理模型领域兴起的一个研究方向,核心思路是让模型动态决定"在当前问题上花多少计算(即思考步骤)是合算的"。传统推理模型(如OpenAI o1/o3)会固定生成一定长度的思维链(Chain-of-Thought)再给出答案,但这在延迟敏感场景下不可行——电话里等待5秒已是极限。自适应预算推理让模型在每个推理步骤后评估"继续想下去的边际收益",一旦置信度超过阈值便提前停止并输出答案。这与人类专家的决策方式类似:简单问题脱口而出,复杂问题才深思熟虑。结合填充语(filler words)、打字音效等产品技巧,目的是在模型"思考"期间维持用户感知到的流畅性,掩盖必要的计算延迟,避免沉默导致的信任崩塌。

声音的个性化悖论与基准测试难题

关于声音是否应该有个性,温绍恩的观察很务实:大多数企业倾向保守,不愿给智能体附加过多人格,目标是"先把问题解决"。但通用声音(generic voice)反而表现更差——消费者一听就知道是机器人,立刻失去信任。

最成功的声音往往带有地域特色:英国联络中心偏爱纽卡斯尔口音,因为用户听到就知道是真人。一个令人莞尔的发现是,早期英语声音都不够自然,最自然的竟是"带点法国口音的英语"——正是那份不完美让声音显得真实。

基准测试则是另一大难题。温绍恩批评现有公开基准无法衡量语音智能体:它们要么是模块化的(只测ASR或LLM),要么因语音隐私性而大量使用合成数据。更关键的是,"不考虑延迟的语音智能体基准不是真基准——用户没法在电话上等你60秒。"PolyAI基于真实对话数据构建了内部基准,综合评估响应时间、理解准确度、工具调用和引用质量,并计划在未来一两个月将其开源,推动整个行业进步。

认知负债与语音AI的未来十年

访谈最深刻的部分涉及"认知负债(cognitive debt)":瓶颈已经从生产内容转移到验证和审计内容。温绍恩坦言,团队内部也深受其扰——人们开始互相发送冗长的AI生成文本(AI slop),迫使对方又用AI来总结,"人类沟通现在竟然需要AI在中间帮我们筛选有用信息,这有点像在绕圈子。"

为应用构建适配智能体的工具

他给出了对slop的精辟定义——"没有能力支撑的生成"。而是否算slop本质上是主观的:在他自己的上下文工程下不算slop,但在不了解背景的同事眼中可能就是。企业客户对自动合并PR、代码自动审查仍不放心,坚持两周的审查周期和可审计性。因此PolyAI在平台中构建了大量可视化组件,让企业能追踪智能体的每一步流程、工具集边界和引用链路。

展望未来十年,温绍恩的预测清晰:

  • 轮次切换必须端到端,坍缩进整个流程,这是工程上最难也最烦人的部分;
  • 语音模态将分化:消费娱乐(Alexa、Google Assistant式)追求趣味,企业客服追求专业、合规、可审计;
  • IoT硬件第二波浪潮:语音是IoT设备的天然交互模态。

他也坦诚地指出一个尚未解决的深层问题:当让智能体吸收公司文化价值观时,它常常"过度聚焦某一点",因为这些价值观背后的原因并未被写入上下文。要达到技术"隐形"、像教孩子一样教系统并自然融入组织的理想状态,仍需在共享上下文、共享组织身份上做大量工作。

正如温绍恩所言,语音AI的真正智能"不在于推理,而在于适应"——这或许是理解下一代对话式AI最重要的一把钥匙。

分享:

相关推荐