待验证85% 置信事件时间未知
小米正式发布自研语音合成大模型MIMO VR-PTS,基于自研Audio Tokenizer和多码本语音文本联合建模架构,经过上亿小时语音数据预训练
1
来源数
85%
置信度
中期 (~90 天)
时效性
2026/6/1
首次发现
有效期至:2026/8/30
来源
Meta关停元宇宙核心项目,800亿美元换来的教训
bilibili初芽Sprout
涉及实体
相关事实
待验证小米MIMO开放了MIMO 2.5 ASR语音识别模型API,支持中英等多语言实时语音转文字,按音频时长计费75% 相似待验证MiMo VL TTS在预训练阶段采用了上亿小时的语音数据,支持同一句话内完成语气转折和情感递变72% 相似已验证Whisper是OpenAI于2022年开源的自动语音识别模型,采用Transformer架构,在68万小时多语言音频数据上训练而成71% 相似待验证当前旗舰级语音产品普遍采用大规模预训练语言模型与专用语音解码器联合训练的方案68% 相似待验证语音编码器 + LLM 解码器的组合是 2023 年以来语音大模型的主流范式,Qwen-Audio、Gemini Audio、Phi-4-audio 等均采用类似设计66% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/22810API
curl https://kongchang.com/api/v1/knowledge/claims/22810MCP
get_claim(id=22810)