待验证50% 置信事实精确时间
P/D 分离(Prefill/Decode Disaggregation)将 Prefill 和 Decode 两阶段部署在不同节点,以针对各自计算特性独立扩容,同时优化吞吐量和首 token 延迟(TTFT)
1
来源数
50%
置信度
长期有效
时效性
2026/9/11
首次发现
来源
涉及实体
相关事实
已验证Prefill阶段是计算密集型操作,Decode阶段是显存带宽密集型操作79% 相似待验证Disaggregated Inference架构将Prefill和Decode两个阶段分配到不同的硬件实例上执行77% 相似待验证输入Token可以在prefill阶段并行处理,而输出Token必须在decode阶段逐个串行生成74% 相似待验证Decode阶段属于访存密集型操作,整体吞吐受制于显存带宽而非算力73% 相似待验证LLM 推理请求分为 Prefill(输入)和 Decode(输出)两个阶段,Prefill 可并行读取吞吐极高,Decode 需逐字串行推理占用 GPU 时间显著更长73% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/908699API
curl https://kongchang.com/api/v1/knowledge/claims/908699MCP
get_claim(id=908699)