语音转文字(Speech-to-Text,STT),又称自动语音识别(ASR),是一种将人类口语音频信号自动转换为可读文本的技术。其核心依赖声学模型、语言模型和解码算法,能够识别连续自然语音、多语言及不同口音。广泛应用于语音助手、实时字幕、语音输入、电话客服分析等场景,是人机交互领域的基础技术之一。
End-to-end latency in voice AI typically involves three stages: speech-to-text (STT) recognition, large language model inference, and text-to-speech (TTS) synthesis
一次完整的语音AI交互涉及STT、LLM推理、TTS三个串行处理阶段