[控场AI]
· 5 分钟阅读· 2,552 字

Supra2-IMG:100M参数开源文生图模型,H100单卡10小时训练完成

Supra2-IMG:100M参数开源文生图模型,H100单卡10小时训练完成

SupraLabs 开源仅 100M 参数的 DiT 文生图模型,单卡 10 小时可训练,CPU 也能 20 秒出图。

SupraLabs 发布的 Supra2-IMG 是一个以「极致轻量」为核心卖点的开源文生图模型,参数量仅 100M,基于 DiT(Diffusion Transformer)架构从零训练,在单张 H100 上不到 10 小时即可完成完整训练流程。模型输出 256×256 分辨率图像,发布者以统一参数(seed 0、50 步采样、CFG 3.0)展示非精选样本,保证了结果的可信度。推理门槛同样极低,CPU 环境下约 20 秒、GPU 下约 2 秒即可生成一张图,模型已完整开源于 Hugging Face,部署仅需数行命令。它的定位并非取代大模型,而是为研究、教学、快速原型和边缘部署等场景提供一个可复现、低成本的参考实现。

SupraLabs 团队发布了一款轻量级文生图模型 Supra2-IMG。它以仅 1 亿(100M)参数的体量、单张 H100 训练不到 10 小时的成本,实现了 256×256 分辨率下的高质量图像生成,并以完全开源的方式放出。对于关注低成本、可复现 AI 生成模型的开发者来说,这是一个值得研究的样本。

Supra2-IMG 发布

一个反常识的规模:100M 参数能做什么

主流文生图模型的参数规模动辄数十亿,Stable Diffusion 系列、FLUX 等模型的体积让本地部署门槛居高不下。Supra2-IMG 反其道而行,把参数压缩到 100M 级别,采用 DiT(Diffusion Transformer)架构,从零开始完整训练。

据发布者描述,整个训练过程在 Runpod 平台的单张 H100 上完成,耗时不到 10 小时。这一数字的意义在于:它把训练一个可用文生图模型的成本拉到了个人和小团队可以承受的区间。相比动辄需要数百 GPU 天的大模型,这种「小而快」的路线为快速实验和迭代提供了新思路。

DiT(Diffusion Transformer)是将 Transformer 架构引入扩散模型的一种设计范式,由 Peebles 和 Xie 于 2022 年提出。传统扩散模型多采用 U-Net 作为去噪网络骨干,而 DiT 用标准 Vision Transformer 替换了这一组件,将图像 patch 序列化后送入 Transformer 块处理。这一替换带来两个优势:一是 Transformer 的规模律(scaling law)更为成熟,模型容量与性能之间的关系更可预测;二是架构更简洁统一,便于复用 NLP 领域积累的训练技巧。FLUX、Stable Diffusion 3 等新一代主流文生图模型均采用了 DiT 或其变体,因此 Supra2-IMG 选择 DiT 作为 100M 参数量下的验证架构,具有一定的代表性——它相当于在极小规模上测试了当前主流架构的下限能力。

性能表现与生成质量

模型输出分辨率为 256×256 像素。发布者强调,公布的样本图像并非精心挑选(not cherry-picked),而是在统一参数下生成——seed 0、50 步采样、CFG 3.0,所有图片使用相同设置。这种透明的展示方式在开源模型社区值得肯定,因为「精选样本」往往会夸大模型的实际能力。

发布者用 SOTA(state-of-the-art)来形容其质量表现,不过这一说法应放在「100M 参数级别」的语境下理解,而非与十亿参数级别的大模型直接对标。在同等极小规模的模型中取得优秀效果,才是它的核心卖点。

CFG(Classifier-Free Guidance,无分类器引导)是文生图模型中控制「提示词遵循程度」的核心参数。其原理是在推理时同时运行有条件和无条件两次前向传播,然后按 CFG 系数对两者的差值进行放大,从而增强模型对提示词的响应强度。CFG 值越高,生成结果越贴近提示词描述,但同时也可能牺牲图像的多样性和自然度;CFG 值过低则会让模型「忽视」提示词,输出趋于随机。Supra2-IMG 采用 CFG 3.0 作为展示默认值,相较于 Stable Diffusion 常用的 7.0–9.0 偏低,说明该模型在较弱的引导强度下即能维持语义对齐,也暗示更高 CFG 值下可能出现饱和失真。采样步数 50 步则是扩散模型推理质量与速度的常见折中点。

本地运行:CPU 也能跑

Supra2-IMG 最实用的特性之一是极低的推理门槛。根据官方数据:

  • CPU 推理:生成一张图约 20 秒
  • GPU 推理:生成一张图约 2 秒

能在纯 CPU 环境下以 20 秒的速度出图,意味着没有独立显卡的用户也能在本地体验完整的文生图流程。这对教学、原型验证和资源受限的场景相当友好。

部署流程也非常简洁,只需几行命令:

# 创建项目目录
mkdir Supra2-IMG
cd Supra2-IMG

# 下载推理脚本
wget https://huggingface.co/SupraLabs/Supra2-IMG/resolve/main/inference.py

随后即可通过命令行生成图像:

python inference.py --prompt "a sea jellyfish floating in the pitch-black ocean depths" --seed 0 --cfg 3.0 --steps 50 --n 1 --out jellyfish.png

参数支持自定义提示词、随机种子、CFG 引导强度、采样步数和输出数量,覆盖了基本的调参需求。

开源意义与适用场景

模型已托管在 Hugging Face(SupraLabs/Supra2-IMG),完全开放下载和使用。发布者也主动表示愿意分享样本对应的提示词,并欢迎社区反馈。

这类小型开源模型的价值不在于取代大模型,而在于填补生态空缺:

  • 研究与教学:低成本训练和推理让 DiT 架构的学习门槛大幅降低
  • 快速原型:秒级 GPU 出图适合需要快速迭代的场景
  • 边缘部署:极小体积为在弱算力设备上运行提供可能

256×256 的分辨率和 100M 的容量决定了它无法胜任高精度商业出图,但作为一个可完全复现、可本地运行、训练成本极低的开源项目,它展示了「小模型也能出好图」的可行性,为后续的轻量化生成模型研究提供了参考。

小结

Supra2-IMG 用一组鲜明的数字讲述了一个关于「效率」的故事:100M 参数、单卡 10 小时训练、CPU 20 秒出图。它不追求与巨型模型正面竞争,而是在极致轻量的赛道上证明了可用性。对于希望低成本入门文生图、或研究 DiT 架构的开发者,这是一个值得动手尝试的开源项目。

分享:

相关推荐