待验证50% 置信事实精确时间
语音Agent典型端到端延迟预算约为STT finalization 100-300ms + LLM TTFT 200-500ms + TTS TTFA 150-250ms + 网络开销50-100ms,总计500-1150ms
1
来源数
50%
置信度
长期有效
时效性
2026/8/12
首次发现
来源
相关事实
待验证GPT-4级别模型的首Token延迟(TTFT)可达500-2000ms,而Llama 3.1 8B等小模型TTFT可低至100-300ms74% 相似待验证GPT-OSS 20B在RTX 3090上可达约40 Token/s的生成速度,在RTX 5090上能达到200 Token/s67% 相似待验证原生 PCIe 版本的 16G V100 TDP 约为 250W,而 SXM 版本的 TDP 为 300W65% 相似待验证WiFi6面板AP实际单频吞吐通常500-800Mbps,标称的1800M/3000M是双频理论叠加值,单设备连接享受不到叠加速率65% 相似待验证RTX 4090的功耗约为300W65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/735048API
curl https://kongchang.com/api/v1/knowledge/claims/735048MCP
get_claim(id=735048)