共 1 篇相关文章
DiffusionBlocks将神经网络拆分为独立块逐块训练,将训练内存需求从与网络深度线性相关降低为仅与单块大小相关。该方法在ViT、DiT、自回归Transformer等五种架构上验证有效,性能媲美端到端训练。