跳到主要内容
Vantaige
Stable Diffusion screenshot
Stable Diffusion logo

Stable Diffusion

免费增值

Stable Diffusion 是 Stability AI 推出的开放权重图像生成标准。支持免费自托管、在自定义数据集上进行微调,并可使用 ControlNet 实现精确的构图控制。它是目前最大的开源图像模型生态系统。

使用场景:图像与艺术
功能:APIOpen Source

Stable Diffusion 是由 Stability AI Ltd. 构建并于 2022 年 8 月首次发布的用于文本到图像生成的开放权重潜在扩散模型。与 Midjourney 或 DALL-E 等封闭平台不同,Stable Diffusion 在社区许可下发布其模型权重,这意味着任何人都可以下载、运行并在自己的硬件上微调模型,而无需按图像付费。目前的旗舰版本 Stable Diffusion 3.5(2024 年 10 月发布)提供三种变体:拥有 81 亿参数的 SD3.5 Large、只需四步即可生成的蒸馏版 SD3.5 Large Turbo,以及拥有 25 亿参数、对消费者友好的 SD3.5 Medium。它不仅仅是一个单一的工具;它是一个模型家族,为第三方界面、社区训练的检查点(checkpoints)和商业应用的生态系统提供动力。

Stable Diffusion 支持文生图、图生图、内补绘制(inpainting)和外补绘制(outpainting)。其最深层的功能来自两个集成层:ControlNet(允许用户使用参考图像来引导构图和姿势,而不仅仅依赖提示词)和 LoRA(低秩微调适配器,这是一种小型的微调文件,无需进行完整的训练即可将特定的风格、角色或主题应用于任何基础模型)。社区在 Civitai 和 Hugging Face 等平台上制作了数十万个 LoRA 和自定义检查点。该模型可以通过 ComfyUI 或 AUTOMATIC1111 在本地访问,也可以通过 Stability AI API 访问,根据模型变体的不同,每张图像的价格为 $0.035-$0.065。

Stable Diffusion 在 2026 年 4 月的生成能力

SD3.5 Large 模型使用带有 QK 归一化的多模态扩散 Transformer (MMDiT) 架构,输出分辨率高达 100 万像素,这是对 SD 1.5 到 SDXL 中使用的 U-Net 设计的一次重大架构转变。Large Turbo 变体以微小的质量损失换取了四步生成,在快速迭代构图时非常有用。SD3.5 Medium 支持 0.25-2 百万像素的分辨率,并在具有 9.9GB VRAM 的消费级硬件上运行,使其成为没有专业级 GPU 的用户的实用选择。

SDXL 在社区中仍然被广泛使用,因为它的 LoRA 和检查点库比仍在成熟中的 SD3.5 更深厚。SD3.5 改善了 SD3 Medium 提示词遵循能力弱以及困扰早期版本的解剖学问题,Stability AI 表示其具有更好的文本渲染、更准确的多对象场景以及更广泛的风格范围。该模型支持照片写实、插画、概念艺术、3D 渲染和绘画美学,无需单独切换模式。三个文本编码器(OpenCLIP-ViT/G、CLIP-ViT/L 和 T5-xxl)处理提示词解析,这使得 SD3.5 比早期的 SD 版本更能掌握复杂、结构化的提示词。

Stable Diffusion 与 FLUX 和 Midjourney 的对比定位

FLUX (Black Forest Labs) 是开放权重领域最直接的竞争对手。FLUX 由 Robin Rombach 及其同事构建,他们最初在 Stability AI 开发了 Stable Diffusion,随后于 2024 年初离开并创立了 Black Forest Labs。FLUX.1 模型运行 120 亿参数的混合多模态和并行扩散 Transformer 架构,使用修正流匹配(rectified flow matching)而不是早期 SD 模型的概率去噪方法。在实际应用中,FLUX 需要更少的推理步骤即可达到同等质量,并且能更可靠地处理冗长、多元素的提示词。截至 2025 年底,r/StableDiffusion 上的社区基准测试始终将 FLUX 在照片写实、图像内文本渲染和复杂场景构图方面排在前面。一位 subreddit 版主直言不讳地说:“Flux 赢得了质量之战。SD 仍然在生态系统、LoRA 库和社区资源方面获胜。”这种生态系统差距是真实存在的。SD3.5 和 SDXL 在社区微调、ControlNet 模型和工作流方面拥有数年的领先优势。FLUX 的 LoRA 库正在增长,但尚未赶上。

Midjourney 是一个完全专有、闭源的云服务。它的模型权重不公开,没有等效的 ControlNet,没有 LoRA 系统,也无法自托管或微调。Midjourney V6 及更高版本在简单提示词的美学和艺术连贯性方面被评为当前的质量领导者,可通过 Discord 或其 Web 应用程序在几秒钟内提供精美的输出。代价是完全丧失了可配置性:你无法在自己的数据集上训练 Midjourney,无法通过编程控制姿势或构图,也无法将其构建到你自己的应用程序中。截至 2026 年,Midjourney 订阅费用为每月 $10-$120,没有免费层。Stable Diffusion 在定制化、高频用户的自托管经济性以及 API 集成方面取得了决定性的胜利。Midjourney 则在开箱即用的图像质量和非技术创意人员的易用性方面获胜。

“Stable Diffusion 相比 Midjourney 等工具的最大优势在于,你可以通过 ControlNet 和 LoRA 等对图像进行大量的控制。” - r/StableDiffusion 用户,2025 年

运行 Stable Diffusion 的真实成本

在硬件投资之后,通过 ComfyUI 或 AUTOMATIC1111 进行自托管是免费的。SDXL 可以在具有 12GB VRAM 的 GPU 上轻松运行;SD3.5 Medium 需要 9.9GB;SD3.5 Large 需要 18GB(通过 NVIDIA TensorRT 进行 FP8 量化可降至约 11GB)。消费级 RTX 4070 Ti 足以应对 SDXL 和 SD3.5 Medium。SD3.5 Large 需要更高端的显卡,例如 RTX 3090、4090 或 4080 Super。一旦硬件到位,无论生成量多大,本地生成都没有单张图像成本。

Stability AI 社区许可证对年收入低于 100 万美元的个人和组织免费,涵盖商业和非商业用途。用户完全拥有所有生成的输出。年收入超过 100 万美元的组织需要定制价格的企业许可证。对于希望获得 API 访问权限而无需管理硬件的开发人员,Stability AI 的平台根据模型层级每张图像收取 3.5-8 个积分(每张图像 $0.035-$0.08)。每月 $20 的商业会员资格提供基于订阅的 API 关系,而不是按需付费的积分。API 定价于 2025 年 8 月更新,部分层级费率有所提高。注册时赠送的 25 个免费积分足以在最高质量层级生成六到七张试用图像。

“如果你是新手,请从 A1111 开始;当你想要更高的性能或开始使用 Flux 时,请切换到 ComfyUI。” - r/StableDiffusion 社区共识,2026 年

Stable Diffusion 的常见缺陷

SD 历史上最臭名昭著的发布发生在 2024 年 6 月,当时 Stability AI 发布了 Stable Diffusion 3 Medium。社区在经历了数月的炒作后,却看到 subreddit 上充斥着人体解剖结构扭曲的例子:融合的四肢、多余的手指、相互塌陷的躯干、看起来像融化蜡的手。Slashdot 和 Futurism 甚至在头条新闻中称其为一种倒退。根本原因是 Stability AI 在训练期间进行了激进的 NSFW 过滤,无意中从训练集中剥离了解剖学数据。全球最大的社区 SD 模型库 CivitAI 对此做出回应,宣布暂时禁止所有与 SD3 相关的内容,以保护用户免受因 SD3 最初严格的许可条款争议而产生的许可责任。Stability AI 修改了许可证,随后发布了修正了解剖学处理的 SD3.5,但 SD3 的发布破坏了社区的信任,这反而让两个月后到来的 FLUX 受益。

除了该特定事件之外,跨 SD 版本的持续失败模式包括:即使在 SD3.5 中手和手指仍然扭曲(比 SD3 Medium 好,但未解决),如果没有特定的专注于文本的 LoRA,很难在图像内渲染清晰的文本,以及在复杂的多对象场景中出现提示词漂移,导致某些描述的元素被丢弃或合并。设置负担是另一个持续存在的抱怨。在 Windows 或 Linux 上安装和维护一个可用的 ComfyUI 或 A1111 环境需要管理 Python 环境、CUDA 版本、模型路径和扩展依赖项。首次设置通常需要一个下午的时间,而且更新可能会破坏正常工作的配置。对于那些希望在 30 秒内从文本框中获得结果的用户来说,这种阻力是巨大的。

Stable Diffusion 适合谁,谁又该选择其他工具

对于需要超越提示词工程的构图控制、用于姿势和深度参考的 ControlNet 工作流以及包含数千种风格或角色 LoRA 库的数字艺术家来说,Stable Diffusion 是正确的选择。对于通过 API 或直接嵌入模型将图像生成构建到自己产品中的开发人员来说,它是明智之选。高频生成者,特别是那些每月创建数百或数千张图像的人,一旦硬件成本摊销,将从本地自托管中获益匪浅。从事微调、模型蒸馏或自定义训练管道的研究人员和机器学习从业者需要访问开放权重,而 SD 仍然是目前被研究和记录最充分的模型家族之一。

如果你是一名营销人员、社交媒体经理或创意专业人士,需要通过简短的提示词获得高质量的结果,且无需设置或维护,请跳过 Stable Diffusion。配置开销是真实的成本,不会随着经验的增加而消失,而且对于日常用例,Midjourney 始终能产生更直接、更精美的结果。如果照片写实和复杂的提示词遵循是首要任务,并且你乐于使用另一个开放权重模型,那么 FLUX.1 Dev 目前在社区的正面交锋测试中击败了 SD3.5 Large。如果你使用的是 8GB 或更少 VRAM 的预算型 GPU,你将只能使用经过优化的 SDXL 或 SD 1.5,这两者都落后于当前一代的质量基准。

用户评价

暂无评价,快来分享你的第一条体验吧!

登录 后即可撰写评价。

收录于精选合集

包含 Stable Diffusion 的精选合集。

相关文章

与 Stable Diffusion 相关的指南和文章。