[控场AI]
模型Diffusion Transformer

DiT

由Meta AI于2023年提出的扩散模型架构,以Vision Transformer替代传统U-Net作为扩散模型的主干网络,具有优秀的大规模参数扩展性,被Sora等前沿视频生成模型采用

时间轴 (近 90 天)

8月26日

2024年以来随着DiT(Diffusion Transformer)架构在视频生成中的广泛应用,开源模型质量开始大幅追赶闭源产品

待验证50%
8月24日

扩散模型的反向过程通常使用U-Net或DiT(Diffusion Transformer)架构来预测每一步应去除的噪声量

待验证50%
8月4日

Transformer架构被引入视觉生成(如Vision Transformer、DiT架构),使模型能更好理解图像不同区域间的全局关系,适用于多模态场景中文本token和图像token的统一处理

待验证88%
7月15日

DiT架构成为Sora、Kling、Wan等主流视频生成模型的共同技术选择

待验证50%

全部知识事实 (4)

来源文章