Stable Diffusion是由Stability AI主导开发并开源的文本到图像生成模型,基于潜在扩散模型(Latent Diffusion Model)架构。该模型能够根据文本提示词生成高质量图像,支持图生图、图像修复等多种任务,具有可本地部署、资源占用相对较低的特点,是目前社区生态最为活跃的开源图像生成模型之一。
ComfyUI 最初以 Stable Diffusion 的节点式工作流界面闻名,生态已扩展至视频生成、3D 资产生成和音乐模型训练
FLUX凭借出色的图像质量和相对开放的授权策略成为Stable Diffusion之后开源社区的重要选择
Civitai是专注于Stable Diffusion等图像生成模型及其LoRA、微调权重分发的社区平台
AI 图片生成在 PPT 工具中的集成通常依赖扩散模型或多模态大模型接口,例如 Stable Diffusion、DALL·E 或 Flux
独立 AI 工具能集成 Stable Diffusion、Flux、Midjourney API 等多家前沿模型,但缺乏与原有软件的深度互通
在使用Stable Diffusion配合LoRA训练角色时,部分创作者遇到角色面部渲染近乎完美但四肢和身体皮肤上出现规律网格状纹理的问题
LoRA已成为Stable Diffusion、Flux乃至Krea等图像生成生态中最主流的微调方式
Unsloth Desktop 支持图像/视频扩散模型,覆盖Stable Diffusion等生成式模型
借助Midjourney、Stable Diffusion、Flux等主流图像生成模型,创作者可以在几分钟内根据社区反馈生成角色的不同形态
许多图像编辑模型是在预训练图像生成模型(如Stable Diffusion架构)基础上通过指令微调叠加编辑能力
还有 40 条时间轴事件
Midjourney、Stable Diffusion、DALL-E属于当前主流AI图像生成工具
90%已验证Stable Diffusion基于潜在扩散模型(Latent Diffusion Model),通过在压缩的潜在空间中进行去噪过程来生成高质量图像
90%已验证Stability AI因开源图像生成模型Stable Diffusion而声名鹊起
90%已验证Stable Diffusion是开源模型,可以本地部署,支持LoRA微调、ControlNet精确控制等高级功能
80%已验证DDPM(Denoising Diffusion Probabilistic Models)在2020年奠定了扩散模型的理论基础
80%已验证Latent Diffusion通过VAE将图像从512×512×3的像素空间压缩到64×64×4的潜空间表示,数据量缩减约48倍
80%已验证Stable Diffusion于2022年开源
80%已验证ComfyUI是一个基于节点式工作流的Stable Diffusion图形界面工具,用户可以通过拖拽和连接不同功能节点来构建自定义的图像处理流程
80%已验证扩散模型通过在海量图像数据上训练,学会了从随机噪声中逐步去噪生成图像的能力
80%已验证潜在扩散模型通过在低维潜在空间而非像素空间执行扩散过程,大幅降低了计算成本
75%已验证Stable Diffusion将扩散过程从像素空间压缩至潜在空间,由变分自编码器(VAE)实现
75%已验证生成式AI模型基于Transformer架构,在代码理解和生成方面展现出显著能力
75%已验证扩散模型成为Stable Diffusion、DALL-E 3等主流工具的底层架构
70%已验证Stable Diffusion的Checkpoint模型通常为2-7GB,LoRA模型通常只有几十到几百MB
70%已验证ComfyUI是开源图形化工作流工具,其核心设计理念是将生成管线拆解为可视化的节点图
65%已验证扩散模型以 DALL-E 2、Stable Diffusion、Midjourney 为代表,重新定义了图像生成任务
65%已验证图像生成模型的输出随机性本质上来源于扩散过程的初始噪声采样,Seed(随机数种子)控制初始噪声
65%已验证ComfyUI是由稳定扩散社区开发的开源图形化工作流工具,其设计源自数据流编程范式
65%已验证扩散模型通过逐步添加高斯噪声再训练模型学习逆向去噪的马尔可夫链机制,规避了对抗训练的不稳定性
65%已验证主流扩散模型(Diffusion Model)代表性产品包括Stable Diffusion、DALL-E 2早期版本、Midjourney,其工作原理是在训练阶段向图像逐步添加高斯噪声,再训练神经网络学习去噪的逆过程
65%