待验证50% 置信事实精确时间
张量并行是将单个层的计算(如矩阵乘法)拆分到多个GPU上并行执行,通信频率高,通常要求GPU之间有高带宽互联如NVLink
1
来源数
50%
置信度
长期有效
时效性
2026/8/26
首次发现
来源
涉及实体
相关事实
待验证Kubernetes 默认将 GPU 视为不可分割的扩展资源,一个 Pod 请求 1 块 GPU 即独占其全部算力和显存70% 相似待验证GPU的线程组织是grid、block、thread三层结构,block内的线程可以通过共享内存进行快速通信和同步,而block之间没有直接的同步机制69% 相似待验证CPU+GPU混合推理采用层级卸载机制,通过n_gpu_layers参数控制卸载层数,主要瓶颈是PCIe带宽延迟,通常使生成速度降至纯GPU推理的1/3到1/269% 相似待验证NVIDIA提供三种GPU共享方案:时间切片(Time-slicing)、MPS(Multi-Process Service)和MIG(Multi-Instance GPU)69% 相似待验证语义分割模型通常采用轻量级架构(如MobileNetV3或EfficientNet变体),在现代GPU上可达60fps以上的实时处理能力69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/802215API
curl https://kongchang.com/api/v1/knowledge/claims/802215MCP
get_claim(id=802215)