

FLUX 是由 Stable Diffusion 幕后团队 Black Forest Labs 推出的一款开放权重文本生成图像模型。该模型于 2024 年 8 月发布,包含三个版本,在基准测试排行榜上击败了 Stable Diffusion 3 和 Midjourney v6,并构筑了 AI 图像生成领域最大的 LoRA 生态系统之一。
FLUX 是由 Black Forest Labs (BFL) 开发的一系列文本生成图像和图像编辑模型。BFL 成立于 2024 年,总部位于德国弗赖堡。BFL 由 Robin Rombach、Andreas Blattmann 和 Patrick Esser 创立,这些研究人员曾在慕尼黑大学 Bjorn Ommer 的指导下开发了 Stable Diffusion,随后在 Stability AI 领导图像生成研究。该公司从 Andreessen Horowitz 等机构筹集了 3100 万美元,专门用于构建新一代开放权重图像模型。FLUX 于 2024 年 8 月 1 日发布,包含三个版本:schnell(Apache 2.0 协议,完全开源)、dev(非商业用途开放权重)和 pro(闭源,仅提供 API)。在发布首日结束时,FLUX.1 [dev] 和 [pro] 就占据了 Artificial Analysis Text to Image Arena 排行榜的前两名,超越了 Stable Diffusion 3 Ultra 和 Midjourney v6.0。
FLUX.1 的核心架构是扩展至 120 亿参数的修正流 Transformer (rectified flow transformer),结合了多模态和并行扩散 Transformer 模块。与早期的潜在扩散模型相比,该架构在提示词遵循度上表现出显著优势,并且在处理生成图像中的文本渲染、手部解剖结构以及复杂多元素场景时,比 Stable Diffusion XL 可靠得多。截至 2026 年 4 月,该模型系列已扩展至包含 FLUX.1.1 [pro](2024 年 10 月)、用于受控编辑的 FLUX.1 Tools(2024 年 11 月)、用于上下文感知图像编辑的 FLUX.1 Kontext(2025 年 5 月),以及配备 320 亿参数开放权重 dev 模型的 FLUX.2(2025 年 11 月)。FLUX 可通过 Hugging Face 进行本地自托管,或通过 Fal.ai、Replicate、Together.ai 以及 BFL 官方 API 进行托管推理。Civitai 上提供了数以千计的社区 LoRA,可用于自定义风格微调。
2026 年 4 月的 FLUX 生成能力
FLUX 跨越了两代模型,具备不同的能力。FLUX.1 系列以 120 亿参数的修正流 Transformer 为核心。FLUX.1 [schnell] (Apache 2.0) 仅需 3-6 个推理步骤,在现代硬件上生成图像不到两秒,速度足以在性能强劲的游戏 GPU 上进行实时原型设计。FLUX.1 [dev] 使用相同的 120 亿参数基础模型并结合引导蒸馏技术,以更多步骤为代价生成更高质量的结果;在全精度下大约需要 16GB 显存,而量化版本则可适配 8GB 显卡。FLUX.1 [pro] 是闭源的纯 API 版本,提供该系列中最佳的单图生成质量。
FLUX.1 Tools 套件增加了四种受控生成模式:fill(局部重绘)、canny(边缘引导生成)、depth(深度图条件生成)和 redux(基于参考图像的风格迁移)。2025 年 5 月推出的 FLUX.1 Kontext 引入了上下文感知编辑功能:上传一张照片,输入“change the jacket to red”(把夹克换成红色),模型就会进行精准的局部编辑,而不会改变画面中的其他任何内容。Kontext 还支持角色一致性,允许同一个人或物体在不同场景中保持连贯,这对于构建一致的视觉叙事或产品营销活动非常有用。BFL 声称 Kontext 在编辑任务上的运行速度比 GPT-Image 快 8 倍。
FLUX.2 [dev] 于 2025 年 11 月 25 日发布,将架构扩展至 320 亿参数,并在 Hugging Face 上提供开放权重。BFL 将其描述为“目前最强大的开放权重图像生成与编辑模型”。FLUX.2 [klein] 于 2026 年 1 月 15 日在 Apache 2.0 协议下发布,这是一个经过尺寸蒸馏的版本,可在消费级 GPU 上实现亚秒级图像生成,提供 40 亿和 90 亿参数两种变体。所有 FLUX 世代的大多数版本均支持高达 100 万像素 (1MP) 的标准分辨率输出,而通过 Fal.ai 提供的 FLUX.2 [pro] Ultra 则支持 400 万像素 (4MP) 输出。
FLUX 与 Stable Diffusion 3.5 和 Midjourney 的对比定位
FLUX 最自然的两个比较对象是 Stable Diffusion 3.5(另一个主要的开放权重选项)和 Midjourney(占据主导地位的商业闭源模型)。它们在机制上存在显著差异。
FLUX 对比 Stable Diffusion 3.5 Large:SD3.5 Large 采用 MMDiT(多模态扩散 Transformer)架构,配备三重文本编码器堆栈:CLIP-L、CLIP-G 和 T5 XXL。其 large-turbo 变体拥有 81 亿参数,采用固定的 20 步推理调度,而 FLUX schnell 仅需 3-6 步。FLUX 在提示词遵循度、生成图像内的文本渲染以及解剖学上正确的手部生成方面轻松获胜,而这些仍是 SD3 难以克服的痛点。2025 年 2 月 r/StableDiffusion 上的一个帖子进一步指出,SD3.5 的 medium 和 large 变体在 LoRA 微调方面“无法训练”,这让微调创作者感到沮丧,并促使社区的大量创作精力转向 FLUX。目前 Civitai 上的 FLUX LoRA 目录已达数千个。SD3.5 在某些工作流兼容性(旧版 ComfyUI 节点和 AUTOMATIC1111 工作流)方面仍保持优势,并且可以在显存较低的硬件上以较小尺寸运行。
FLUX 对比 Midjourney:Midjourney 在绘画感和高度风格化的美学方面依然是风格质量的领导者,但其结构性限制与 FLUX 截然相反。Midjourney 是闭源的,对大多数用户不提供公共 API,不支持本地部署,不支持 LoRA 微调,且访问仅限于 Discord 或其 Web 界面。你无法将 Midjourney 集成到自己的应用程序工作流中。而 FLUX 的开放权重和 BFL API 允许完全的编程访问、自定义微调和自托管部署,这些都是 Midjourney 所不支持的。在基准测试排行榜 (Artificial Analysis Arena) 上,FLUX [pro] 和 Midjourney 根据评估类别的不同互有胜负;FLUX 在提示词保真度和文本渲染方面获胜,而 Midjourney 在某些精选的艺术风格上仍保持优势。
“提示词遵循度非常好,能够很好地追踪场景中的多个部分,在技术上令人印象深刻。然而,它似乎没有接受过纯艺术方面的训练。”—— vessenes,Hacker News,2024 年 10 月
“FLUX.1 拥有最先进的提示词遵循度,能够生成文本,而且是开源的。该模型的整体美学广受好评。它可以生成逼真或艺术风格的图像,并且对色彩和光线有很好的理解。”—— Stablecog 博客评测,2024 年
运行 FLUX 的真实成本
对于自托管用户来说,FLUX.1 [schnell] 采用 Apache 2.0 协议,是真正免费的。没有许可费用;你只需支付电费和硬件折旧费。通过 Hugging Face 发布的开放权重版本,FLUX.1 [dev] 也可免费用于非商业个人用途。这两个版本让任何拥有高性能 GPU 的人都能使用 FLUX:与纯商业模型相比,这是一个意义重大的优势。
使用 BFL 的托管 API 时,定价基于积分:1 积分 = $0.01 USD。截至 2026 年初的主要费率如下:
FLUX.2 [pro]:约 $0.03/张
FLUX.1 [pro] / FLUX.1.1 [pro]:$0.04/张(4 积分)
FLUX.1 Kontext [pro]:$0.08/张(因编辑复杂度较高而更贵)
Fal.ai FLUX1.1 [pro] Ultra (4MP):$0.06/张
BFL 不提供固定月费订阅;纯粹按图像生成量消耗积分。第三方托管平台(Replicate、Fal.ai、Together.ai)有各自的定价结构,可能会有几美分的差异。对于每月生成数千张图像的生产工作负载,单张图像的成本会迅速累积;处理高并发量的团队应将实际生成数量与在竞价云实例上自托管 Stable Diffusion 等替代方案进行基准测试对比。API 使用的最低成本门槛在轻量级版本上约为 $0.014/张,这使得 FLUX 非常适合小规模测试,而无需大量的前期投入。
FLUX 的常见局限性
在社区讨论中,FLUX 表现出一些一致的明显局限性。最显著的是古典艺术和绘画风格。当提示词要求“oil painting, thick brushstrokes, Impressionist light”(油画、厚涂笔触、印象派光影),或要求生成类似 Degas 或 Monet 风格的作品时,FLUX 往往会返回受动漫影响或过度数字化的结果,而不是绘画感的结果。HN 上的社区猜测将其归因于刻意的训练数据筛选:在 Stable Diffusion 遭遇强烈抵制后,BFL 避免了大量抓取在世艺术家的作品。结果造就了一个具有卓越照片级真实感,但艺术范围比旧版 Stable Diffusion SDXL 生态系统更窄的模型。
人像皮肤纹理在 r/StableDiffusion 的讨论帖中一直受到批评:面部特写中存在一种“塑料感”或过度光滑的质感,看起来很假。使用专门针对人像的 LoRA 进行微调可以缓解这一问题,但基础模型在无引导生成中会暴露出这个缺陷。
复杂的空间构图和否定提示词仍未得到解决。要求多个主体处于特定空间关系(“三个人物,一个坐在另外两个后面”)或否定(“一个没有窗户的房间”)的提示词仍然会产生错误。这并非 FLUX 独有;这是当前流匹配 (flow-matching) 模型的架构级限制,但对于需要精确构图控制的工作流来说,这一点值得注意。
显存门槛是一个实际的阻碍。全精度下的 FLUX.1 [dev] 需要 16GB 显存;适配 8GB 显卡的量化版本会在复杂场景中牺牲质量。320 亿参数的 FLUX.2 [dev] 要求更高。使用中端游戏硬件 (RTX 3060, 12GB) 的普通本地用户会遇到瓶颈,在实际应用中,使用全精度的 schnell 可能会比使用严重量化设置的 dev 获得更好的结果。
FLUX.1 [dev] 的非商业许可制造了一个微妙的陷阱:如果不切换到付费 API,最高质量的开放权重模型在法律上无法用于商业产品。使用 dev 进行原型设计并希望发布产品的用户,必须迁移到 schnell(质量较低)或为 API 付费。
FLUX 适合谁,谁又该选择其他工具
对于将图像生成功能构建到应用程序中的开发者、需要可自托管开放权重的研究人员、运行本地 ComfyUI 工作流的 AI 艺术家,以及任何希望在当前 SOTA(最先进)基础模型上自由使用 LoRA 进行微调的人来说,FLUX 是正确的选择。Civitai 上的 FLUX LoRA 生态系统现已成熟:存在数以千计由社区训练的适配器,涵盖人像风格、特定美学、产品摄影等。如果你想在图像生成的基础上构建自定义内容,FLUX 是截至 2026 年 4 月最强大的开放权重基础模型。
对于需要通过 API 访问生产级图像生成功能、按图计费,且不想被锁定在 Midjourney 专有封闭生态中的企业来说,FLUX 同样是明智之选。
如果你是一个只想偶尔生成图像、需要简单消费者 Web 应用的普通用户,请跳过 FLUX:FLUX 没有自己完善的消费者产品。你需要使用第三方 UI(Fal.ai、Replicate 的 Web 界面或本地 ComfyUI 设置)。如果你的核心用例是复刻古典绘画美学,也请跳过它;该模型在这方面存在已知的不足,经过深度微调的 SDXL 检查点可能会更好。如果显存受限于 8GB,请在决定使用前仔细测试 schnell:它快速且免费,但在复杂场景中生成的细节不如 [dev] 丰富。
用户评价
暂无评价,快来分享你的第一条体验吧!
登录 后即可撰写评价。
收录于精选合集
包含 FLUX 的精选合集。
相关文章
与 FLUX 相关的指南和文章。

AI Fashion Prompts That Stay Consistent: The Working Formula (2026)

Freepik AI Is Now Magnific: What Changed, What It Costs, and Whether to Stay (2026)

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

AI Video Generator Prompting: The Filmmaker's Real Workflow

Replit Pricing Explained (2026): Core vs Pro and Effort-Based Agent Billing
