跳到主要内容
Vantaige
DALL-E 3 screenshot
DALL-E 3 logo

DALL-E 3

免费增值

OpenAI 的图像生成技术已从 DALL-E 3 经由 GPT-4o 演进至 GPT Image 2,目前是所有图像模型中文字渲染最准确的,并在 ChatGPT 中内置了对话式编辑功能。可通过 Bing Image Creator 免费使用;高频使用需订阅 $20/mo 的 ChatGPT Plus。视觉风格不如 Midjourney 那般具有标志性;但对于需要清晰可读文本或客户可迭代反馈循环的工作而言,更具落地部署价值。

功能:GPT-4o native image genGPT Image 2Conversational EditingText RenderingInpaintingC2PA CredentialsAPI AccessBing Image Creator integrationMicrosoft Designer

提示词:“photorealistic product shot of a matte black ceramic coffee mug on a white marble surface, soft studio lighting from the left, steam rising, the mug has the text 'Monday' printed on it in clean white sans-serif”(白色大理石表面上哑光黑色陶瓷咖啡杯的逼真产品图,左侧柔和的演播室灯光,升起的蒸汽,杯子上用干净的白色无衬线字体印着“Monday”字样)。“Monday”这个词出现在了杯子上,拼写正确,使用了清晰的无衬线字体,并且在杯子表面呈现出正确的比例和曲率。蒸汽有着令人信服的缕缕细节。大理石纹理逼真。阴影落下的角度也完全正确。这一个结果比任何基准测试图表都能更好地说明 OpenAI 当前的图像生成能力:这是有史以来第一次,在生成的图像中包含准确的文本成为了一种你可以信赖的工作流,而不再是需要你碰运气的赌博。

本词条归档在 DALL-E 3(旧版标识)下,但如今的 ChatGPT 用户运行的是 2026 年 4 月 21 日发布的 GPT Image 2。了解这一演进脉络非常重要:过去对 DALL-E 3 能力的评价(文本较弱、速度较慢、基于扩散模型)已不再适用于当前的模型。

2026 年 4 月 DALL-E 的视觉特征

该模型的历史是一部架构重塑史。DALL-E 3(2023 年 10 月)是一个扩散模型,拥有独立的图像生成管道,接收文本提示并生成图像。由于理解语言的模型与绘制字母的模型并非同一个,因此文本渲染并不可靠。GPT-4o 原生图像生成(2025 年 3 月 25 日)统一了这两个系统:处理对话的同一个自回归模型现在也负责生成图像,这就是文本渲染能力大幅提升的原因。GPT Image 2(2026 年 4 月 21 日)是目前的旗舰模型,在拉丁语、中日韩文字(CJK)、印地语和孟加拉语脚本中具有约 99% 的文本渲染准确率,支持批量生成多达 8 张风格一致的图像、2K 分辨率,并具备在返回输出前应用原生推理的“思考模式”(Thinking Mode)。发布不到 12 小时,GPT Image 2 就占据了 Image Arena 排行榜的榜首。

通过与 Midjourney 对比,可以最好地理解其视觉特征。Midjourney 会极具表现力地诠释提示词,添加提示词中并未明确要求的电影级景深和氛围纹理。而 GPT Image 2 则是精准执行提示词:输出结果与描述高度一致,而非对其进行夸张的艺术加工。印有“Monday”的马克杯看起来就像是一张产品摄影图。废弃的东京街机厅看起来像是一张真实发现的照片,而不是某种记忆画面。更具落地部署价值;但标志性艺术感较弱。这种区别几乎推动了社区中每一次“DALL-E vs. Midjourney”的讨论,这并非缺陷,而是一种设计选择。

真正有效的提示词(及其特性)

提示词 1:带有嵌入文本的产品图。“白色大理石表面上哑光黑色陶瓷咖啡杯的逼真产品图,左侧柔和的演播室灯光,升起的蒸汽,杯子上用干净的白色无衬线字体印着‘Monday’字样。” GPT Image 2 清晰地渲染了“Monday”,曲率与杯子表面完美贴合,阴影几何形状准确,蒸汽效果逼真。这类提示词(电子商务、产品包装、品牌样机)正是 GPT Image 2 架构优势占据绝对统治力的领域。Midjourney 的同类生成结果会呈现出精美的产品图美感,但“Monday”只会是装饰性的近似字母形状,而无法保证清晰可读。

提示词 2:氛围环境(以及差距显现之处)。“凌晨 3 点废弃的东京街机厅的电影级照片,潮湿路面上的霓虹灯倒影,35mm 胶片颗粒感。” GPT Image 2 的渲染结果更接近提示词的字面描述:几何上准确的倒影、合理的机台细节、保持在 35mm 胶片实际色彩范围内的色调。它看起来就像是一张真实拍摄的照片。而 Midjourney 的版本则会生成青色-洋红色-琥珀色的霓虹灯效果,其色调深度超越了任何真实照片。对于客户演示而言,GPT Image 2 的版本更具部署价值。但如果你需要它带来一种记忆般的氛围感,Midjourney 则是赢家。

对话式微调是其他平台在规模上无法匹敌的工作流优势。生成任何一张图像后,你可以继续对话:“让灯光更暖一些”、“添加第二个印有‘Tuesday’字样的杯子”。局部重绘(inpainting)画笔支持蒙版编辑,但其机制是重新生成整张图像,未触及区域出现意外变化(纹理漂移、颜色偏移)是一个已知的副作用。

DALL-E 的短板:手部、文本、一致性

内容审核是记录最多的摩擦点,在消费者层面,它的审核力度比任何竞争模型都要激进。来自 OpenAI 开发者论坛(2025 年)记录的被屏蔽提示词包括:为奇幻女妖“让她的皮肤更苍白一点”;标有房间名称的平面图;带有角色首字母缩写的超级英雄卡通;公有领域的童话场景。同一个提示词有时在一个新会话中能成功,在另一个会话中却会失败。有用户记录称,在触发过滤器后经历了长达 29 分钟的冷却期。

“周三它生成了我想要的每一张图片。然后到了周四,一切都变了,根本没法用。”—— OpenAI 社区论坛用户,摘自主题“对新图像生成系统的反馈——限制太多且破坏了创意工作流”,community.openai.com,2025 年

拒绝生成在世艺术家风格是另一个摩擦层。OpenAI 屏蔽了“在世艺术家风格”的请求,同时允许更广泛的工作室或艺术运动风格,但这种区分的执行并不一致。同一个请求可能在一个新会话中成功,在另一个会话中失败。对于将艺术家名字作为专业速记方式来参考风格的艺术总监来说,这是一种不可预测的阻碍。

生成速度约为每张图像 60–180 秒,比 DALL-E 3(通过 API 为 20–45 秒)慢,因为自回归生成的计算量比扩散模型更大。在美国高峰时段,Plus 用户报告单次生成时间超过 2 分钟。生成后的审核扫描偶尔会在图像处理完成后将其拒绝,白白消耗一个速率限制名额却没有任何结果。社区验证的 Plus 限制约为每 3 小时滚动窗口 50 张图像,官方未公开,是用户触及上限后发现的,且达到上限后没有“放松模式”(Relax Mode)作为后备选项。

商业用途:许可、版权与安全过滤器

OpenAI 将其在输出内容中拥有的任何权利转让给客户。API 和 ChatGPT 订阅者均适用。2025 年 1 月美国版权局的一份报告澄清,在现行法律下,简单的文本提示并不能赋予用户对输出内容的版权。OpenAI 声明不提供任何不侵权保证;训练数据的权利负担问题仍未解决。《纽约时报》诉 OpenAI 案(The New York Times v. OpenAI)这一具有行业定义意义的版权诉讼,于 2026 年 4 月 2 日进入简易判决阶段,OpenAI 被勒令移交 2000 万份匿名 ChatGPT 日志。目前尚未确定审判日期。

通过 ChatGPT 网页端和 API 生成的所有图像都包含不可见的 C2PA 元数据,将其标记为 OpenAI 生成。可在 contentcredentials.org 上进行验证;可通过截图或格式转换去除。可见水印已于 2024 年移除。

2025 年 3 月 25 日的“吉卜力工作室时刻”成为了文化辩论的焦点。当 GPT-4o 发布时,社交平台在几小时内就被吉卜力风格的肖像画淹没。Sam Altman 报告称在一个小时内增加了一百万用户,并形容 OpenAI 的 GPU 基础设施“正在熔化”。宫崎骏在 2016 年纪录片中关于 AI 动画是“对生命本身的侮辱”的言论再次浮出水面,成为一种反叙事。截至 2026 年 4 月,吉卜力工作室尚未提起诉讼,但这一事件成为了随后每一次 AI 风格模仿版权争论的决定性时刻。

来自 Reddit 和 Discord 的社区工作流

2025–2026 年间产品设计社区中反复出现的专业工作流:生成带有嵌入可读文本的 UI 和营销样机。产品团队和小型机构使用 ChatGPT 图像生成来制作 UI 样机截图、落地页线框视觉图和产品包装,在打开任何设计工具之前的构思阶段就使用 ChatGPT。像“创建一个移动应用引导页的样机,标题为‘Start your journey’,干净的白色背景,San Francisco 字体,iOS 风格”这样的提示词,就能生成一个可用的客户演示工件。初稿不需要 Figma,也不需要占用设计师的时间。

“我一直在使用 ChatGPT 为客户迭代品牌视觉效果。我只需说‘让它感觉更高级一点’,它就能从上下文中理解,没有其他工具能做到这一点。”—— r/ChatGPT 中的 Reddit 用户,引自 digidop.com 的对比文章,2025 年

2025 年 4 月迎来了第二波病毒式传播:用户提示 ChatGPT 将他们的照片渲染成吸塑包装中的塑料可动人偶。这一趋势作为一种个人品牌塑造活动从社交媒体蔓延到了 LinkedIn,政客和名人也纷纷参与其中。除了新奇之外,它还展示了该模型处理参考照片并进行主体一致的图像转换的能力,这一能力随后成为了各大产品社区中生成头像和用户画像的成熟工作流。

“GPT-4o 的图像生成对工作来说是真正有用的,而 Midjourney 对我来说从未做到这一点。我可以生成带有实际可读文本的产品样机。这就是它的杀手锏。”—— OpenAI 社区论坛用户,community.openai.com,2025 年

DALL-E vs. Midjourney vs. Adobe Firefly

Midjourney(V7 / V8.1 Alpha)是直接的创意竞争对手。在 Tom's Guide(2025 年)进行的一项七个提示词的对比中,Midjourney 在电影级和编辑类提示词的视觉丰富度上获胜。一致的结论是:对于注重氛围感、艺术导向的输出,Midjourney 依然占据主导地位。而对于在 ChatGPT 工作流中需要准确、包含文本、可对话编辑的图像,GPT Image 2 则是赢家。Midjourney 起价为 $10/mo,没有免费层;对于已经订阅 ChatGPT Plus 的团队来说,图像生成不需要额外成本,单凭这种定价上的不对称就足以让许多用户转向 OpenAI。

Adobe Firefly 解决的是另一个问题:IP 来源的确定性。Firefly 3 专门使用获得许可的 Adobe Stock 和公有领域内容进行训练,不存在因训练数据引发的版权风险,并原生嵌入在 Photoshop、Lightroom 和 Premiere 中。图像质量合格,但缺乏 OpenAI 或 Midjourney 那种独特的美感。对于广播、广告或高责任风险的客户工作而言,当来源的合法性比美感更重要时,Firefly 是理性的选择。而对于需要图像中包含准确文本或对话式编辑循环的工作,GPT Image 2 则是更强大的选择。

积分经济学:一个真实项目的成本

免费层对于评估来说非常实用:在 ChatGPT Free 中,每 24 小时窗口大约可生成 3 张图像。Bing Image Creator 提供了一个更慷慨的免费入口,每天 15 次快速加速生成,之后可无限次较慢生成,拥有任何 Microsoft 帐户即可免费使用。无需信用卡。

每月 $20/mo 的 ChatGPT Plus 是一个关键转折点。社区共识认为,其实际限制约为每 3 小时滚动窗口 50 张图像,在实践中每天约 200 张。GPT Image 2 的思考模式(批量生成 8 张一致的图像、自我验证)包含在 Plus 订阅中。没有单独的图像积分系统。

GPT Image 2 的 API 定价(2026 年 4 月):低质量 / 即时(Low / Instant)约为每张图像 $0.006;中等质量(Medium)为 $0.053;高质量 / 思考模式(High / Thinking)为 $0.211。对于非实时工作负载,Batch API 可降低 50% 的成本。通过 API 仍可使用 DALL-E 3,价格为 $0.04–$0.12,速度更快但质量明显较低。

对于一个真实项目,生成 200 张带有准确文本标签的 API 中等质量产品图像,成本约为 $10.60。同样的 200 张图像在 ChatGPT Plus 中实际上已包含在 $20/mo 的订阅费中。在 Pro 计划($200/mo)下,生成几乎是无限的。对于运行大批量工作流的团队来说,带有批处理折扣的 API 比订阅更划算。

用户评价

暂无评价,快来分享你的第一条体验吧!

登录 后即可撰写评价。

DALL-E 3 的对比表现

与其他工具的并排对比。

收录于精选合集

包含 DALL-E 3 的精选合集。

相关文章

与 DALL-E 3 相关的指南和文章。