[控场AI]
概念Tensor Parallelism

张量并行

多设备推理的核心切分策略之一,将单层模型的张量计算切分到多张GPU上并行执行,实现层内并行加速

时间轴 (近 90 天)

7月20日

大模型每生成一个Token需要在GPU上执行大量矩阵乘法运算,这是Transformer架构注意力机制的核心计算步骤

待验证50%

全部知识事实 (1)

来源文章