[控场AI]

#语音AI

共 14 篇相关文章

阿里通义Qwen-Audio-3.1发布:五模型音频全栈,ASR降价95%
·5 分钟

阿里通义Qwen-Audio-3.1发布:五模型音频全栈,ASR降价95%

阿里通义发布Qwen-Audio-3.1,包含ASR、TTS、Realtime及新增TTS-Next、ASR-Next共五个模型,构成完整音频技术栈,并全线降价:TTS降70%、Realtime降85%、ASR最高降95%。

阅读全文 →
Gemini Live API重磅更新:原生音频首次支持前沿级推理
·4 分钟

Gemini Live API重磅更新:原生音频首次支持前沿级推理

Gemini Live API迎来重磅更新:主动式音频、上下文注入、异步函数调用四大功能落地,更首次将前沿级高阶推理引入原生音频体验,为语音AI应用带来突破。

阅读全文 →
语音AI在真实呼叫中心场景下真的靠谱吗?
·4 分钟

语音AI在真实呼叫中心场景下真的靠谱吗?

语音AI真的能应对真实呼叫中心的抢话、改口和噪音吗?本文从技术边界、演示陷阱和人机协同角度,分析Voice AI在真实压力场景下的可靠性与评估方法。

阅读全文 →
NovaSynth:用模拟来电者压测语音AI助手
·5 分钟

NovaSynth:用模拟来电者压测语音AI助手

NovaSynth 是 Noveum 团队推出的语音 AI 测试工具,可大规模模拟带口音、打断、噪声、弱网等真实来电者场景,从 30+ 维度对语音代理进行音频与文本评分,并给出可行动的修复建议。

阅读全文 →
冰岛Treble获1800万美元融资,押注语音仿真平台
·3 分钟

冰岛Treble获1800万美元融资,押注语音仿真平台

冰岛语音仿真公司Treble完成1800万美元融资,其平台服务于语音AI模型开发者、AI可穿戴设备及机器人公司。本文解析语音仿真技术价值与融资背后的行业信号。

阅读全文 →
Gemini 3.8 Live 与 Extended Thinking:谷歌最强语音对话模型
·4 分钟

Gemini 3.8 Live 与 Extended Thinking:谷歌最强语音对话模型

谷歌推出 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,官方称为迄今最先进的 Gemini 音频模型,主打自然实时语音对话,并引入延展思考能力应对复杂问题。本文解析两款模型定位、语音对话竞争与市场反馈。

阅读全文 →
GPT-Live-1 登陆 API:全双工语音对话模型详解
·4 分钟

GPT-Live-1 登陆 API:全双工语音对话模型详解

OpenAI 将全双工语音模型 GPT-Live-1 引入 API,支持自然打断、抗背景噪音,采用前端对话+后端推理架构,前端定价每分钟 0.05 美元,面向规模化对话式语音应用。

阅读全文 →
Gemini 3.8 Live 上手:谷歌语音对语音模型实测
·5 分钟

Gemini 3.8 Live 上手:谷歌语音对语音模型实测

谷歌发布 Gemini 3.8 Live 与 Extended Thinking 两款语音对语音模型,形态类似 OpenAI GPT-Live。本文实测其浏览器语音对话体验,并解析基于 WebSocket 与 Web Audio API 的零依赖技术实现。

阅读全文 →
谷歌发布 Gemini 3.8 Live:语音 AI 迈向实时推理时代
·7 分钟

谷歌发布 Gemini 3.8 Live:语音 AI 迈向实时推理时代

谷歌发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 两款实时语音对话模型,支持并行推理、后台任务执行、97 种语言实时切换与视觉理解,并在语音质量与智能体任务基准中领先。本文解析其核心能力与生态布局。

阅读全文 →
OpenAI语音黑客马拉松:6小时极限开发4个实时语音AI项目
科技前沿
·5 分钟

OpenAI语音黑客马拉松:6小时极限开发4个实时语音AI项目

OpenAI举办Voice Hack Night黑客马拉松,参赛团队6小时内构建实时语音代理项目,4个项目进入决赛。深度解析实时语音AI的技术挑战、落地场景与开发者生态趋势。

阅读全文 →
Inworld Realtime TTS-2:全栈实时语音AI基础设施深度解析
产品体验
·5 分钟

Inworld Realtime TTS-2:全栈实时语音AI基础设施深度解析

深度解析Inworld发布的Realtime TTS-2全栈语音AI平台,涵盖排名第一的TTS引擎、语音到语音处理、LLM路由等核心能力,以及其在语音代理、AI伴侣等场景的应用价值。

阅读全文 →
Dogra:开源自托管语音AI平台,告别VAPI天价账单
产品体验
·6 分钟

Dogra:开源自托管语音AI平台,告别VAPI天价账单

Dogra是一款开源自托管语音AI平台,提供可视化工作流构建器、多服务商自由切换和完整调用追踪能力。对比VAPI、Bland等托管平台,Dogra帮助开发者大幅降低语音Agent成本,摆脱供应商锁定,实现完全可控的语音AI部署。

阅读全文 →