共 2 篇相关文章
OpenAI发布GPT-Live语音模型家族,全双工交互技术让AI能同时听说、自然打断,结合任务委托机制调用GPT-5.5完成复杂推理。GPQA基准从45%跃升至80%,支持实时翻译、图像分析与时间感知,语音正成为人机交互核心界面。
AI语音合成技术虽然在音色和情感表达上不断进步,但缺少背景环境音和空间混响仍是最大短板。本文分析环境音对语音真实感的关键作用,以及技术突破的可能方向。