2026 年 6 月 3 日,Ideogram 开源了 4.0 版本的模型权重。
这是一家由前 Google Brain 研究员创立的公司,在文生图领域一直主打「文字渲染」这个细分能力。Ideogram 4.0 把这个能力推到了一个新高度:英文文字渲染准确率 0.97——接近完美。
但更值得注意的是,Ideogram 4.0 不只是「文字写得好看」。它引入了两个新机制:边界框版面控制和JSON 提示词系统,把文生图从「写一句描述等结果」推进到「精确指定每个元素的位置和内容」。
本文拆解 Ideogram 4.0 的技术架构、显存需求、ComfyUI 部署方案,以及它和竞品的真实对比。
核心规格一览
以下数据来自 Ideogram 官方公告和 HuggingFace 模型卡:
| 维度 | Ideogram 4.0 |
|---|---|
| 发布者 | Ideogram(前 Google Brain 团队) |
| 参数量 | 9.3B |
| 开源日期 | 2026 年 6 月 3 日 |
| 许可证 | 开放权重(允许本地运行和微调) |
| 英文文字渲染准确率 | 0.97 |
| 多语言文字支持 | 中日韩等多语言 |
| 最大输出分辨率 | 2048 × 2048(原生 2K) |
| 透明背景 | 支持生成透明背景图像 |
| 可编辑文字图层 | 支持二次修改 |
| 边界框版面控制 | 首创 Bounding Box + 结构化 JSON 提示词 |
| Text Encoder | Qwen 3VL 8B(约 10G) |
| ComfyUI 支持 | Day-0,需 v0.24.0+ |
关键信息:9.3B 参数 + 开放权重,这意味着本地部署和微调都是合法的。 和闭源文生图模型(如 GPT Images 2)相比,Ideogram 4.0 在可控性和透明度上有本质优势。
文字渲染:为什么 0.97 这么重要?
文生图模型的文字渲染一直是最大短板。DALL-E 3、Midjourney V7、Stable Diffusion 3.5——所有主流模型在生成包含文字的图像时,都存在拼写错误、字体变形、字符缺失等问题。
Ideogram 4.0 的 0.97 英文文字渲染准确率意味着什么?
| 模型 | 英文文字渲染准确率(估算) |
|---|---|
| Ideogram 4.0 | 0.97 |
| DALL-E 3 | 约 0.85-0.90 |
| Midjourney V7 | 约 0.80-0.85 |
| Stable Diffusion 3.5 | 约 0.70-0.80 |
| FLUX.1 | 约 0.75-0.85 |
0.97 接近人类排版水平。 在一个需要精确文字的图像(比如海报、名片、UI mockup)中,Ideogram 4.0 几乎不会出现拼写错误,而其他模型可能每 10 个词就有 1-2 个错误。
更重要的是,Ideogram 4.0 支持中日韩多语言文字渲染。这对中文用户尤其有意义——过去几乎所有文生图模型在中文文字渲染上都很差,Ideogram 4.0 是第一个在这方面有实质性突破的模型。
边界框版面控制:从「写描述」到「画蓝图」
Ideogram 4.0 最具创新性的功能是边界框版面控制(Bounding Box Layout Control)。
传统的文生图工作流是:你写一句描述,模型生成一张图,你看看不满意再改描述再生成。整个过程中,你对图像版面的控制非常间接——你只能描述「左边有文字,右边有人」,但具体文字多大、放在哪个位置,你几乎无法精确控制。
边界框版面控制改变了这个流程。你可以:
- 指定每个元素的位置。 用 Bounding Box 精确定义文字、图形、图像在画面中的坐标。
- 指定每个元素的内容。 用结构化 JSON 提示词为每个 Bounding Box 定义具体内容。
- 指定每个元素的尺寸。 控制文字大小、图形比例、图像区域。
JSON 提示词系统示例
{
"prompt": "A professional business card",
"bounding_boxes": [
{
"content": "ACME Corp",
"bbox": [0.1, 0.15, 0.9, 0.35],
"type": "text"
},
{
"content": "John Smith\nCEO\njohn@acme.com",
"bbox": [0.1, 0.5, 0.9, 0.85],
"type": "text"
},
{
"content": "logo",
"bbox": [0.05, 0.02, 0.3, 0.12],
"type": "image"
}
]
}
注意:bbox 坐标格式为 [y_min, x_min, y_max, x_max]。 之前的模板有 bug,用的是 [x_min, y_min, x_max, y_max],需要修正。
这个 JSON 提示词系统需要配合一个 LLM 来生成——Ideogram 官方推荐用 Gemini Flash 来生成结构化 JSON 提示词。流程是:
- 你用自然语言描述你想要的版面
- Gemini Flash 把自然语言转换成结构化 JSON
- Ideogram 4.0 根据 JSON + Bounding Box 生成图像
这增加了一步中间环节,但换来了对版面的精确控制。对于 UI 设计师、海报制作、品牌物料生成等需要精确排版的工作,这个能力是其他模型目前做不到的。
显存需求与本地部署方案
Ideogram 4.0 的本地部署门槛比看起来要高。原因是它需要两个 UNet(正面条件 + 负面条件),加上 Qwen 3VL 8B 作为 Text Encoder。
| 配置方案 | 显存需求 | 说明 |
|---|---|---|
| 双 UNet nvfp4 + GGUF Clip | 约 13G | 推荐最低配置 |
| 双 UNet fp8 + fp8 Clip | 约 16-18G | 更好质量 |
| 双 UNet fp16 + fp16 Clip | 约 25-30G | 推荐专业显卡 |
| 单 UNet(实验性) | 约 8-10G | 可能影响质量 |
关键信息:即使使用 nvfp4 量化,也需要约 13G 显存。 这意味着一张 RTX 4070(12GB)勉强不够,一张 RTX 4080(16GB)可以跑 nvfp4 版本,一张 RTX 4090(24GB)可以跑 fp8 版本。
ComfyUI 部署步骤
ComfyUI 是目前唯一在发布当天就支持 Ideogram 4.0 的工具(Day-0 支持)。
- 更新 ComfyUI 到 v0.24.0+。旧版本不支持双 UNet 工作流。
- 下载模型权重。从 HuggingFace 下载 UNet(正面和负面各一个)和 Text Encoder(Qwen 3VL 8B)。
- 加载工作流模板。Ideogram 官方提供了 ComfyUI 工作流 JSON,直接导入即可。
- 修正 bbox 坐标格式。官方模板的 bbox 坐标有 bug,需要改为
[y_min, x_min, y_max, x_max]格式。
与 Sora Legacy 的对比
Sora Legacy 是 OpenAI 的视频生成模型,和 Ideogram 4.0 是不同领域(视频 vs 图像)。但两者在本地部署门槛上有类似的问题——都需要专业级硬件才能完整运行。如果你只做图像生成,Ideogram 4.0 的 13G 门槛比 Sora 的需求低很多;如果你需要视频,Sora 是唯一选项。
原生 2K 输出与透明背景
Ideogram 4.0 的两个辅助能力也值得单独说明:
原生 2K 分辨率
| 模型 | 最大输出分辨率 |
|---|---|
| Ideogram 4.0 | 2048 × 2048(原生) |
| DALL-E 3 | 1024 × 1024(可扩展到 1792) |
| Midjourney V7 | 约 2048(需 upscale) |
| FLUX.1 | 1024 × 1024 |
Ideogram 4.0 的 2K 输出是原生生成,不是后期 upscale。 这意味着高分辨率下文字和线条的质量不会因为放大而模糊——这对需要印刷级输出的设计工作很重要。
透明背景
Ideogram 4.0 支持直接生成透明背景图像,不需要后期抠图。这在 logo 设计、UI 元素生成、电商产品图等场景中非常实用——过去需要专门用 rembg 等工具做背景去除,现在一步完成。
Artificial Analysis Image Arena 盲测排名
Ideogram 4.0 在 Artificial Analysis Image Arena 盲测中排名顶尖。盲测的规则是:用户看到两张图,不知道是哪个模型生成的,选择更好看的那张。
| 排名 | 模型 | ELO 分数(估算) |
|---|---|---|
| 顶尖 | Ideogram 4.0 | 最高档 |
| 高档 | Midjourney V7 | — |
| 中高档 | DALL-E 3 / FLUX.1 | — |
| 中档 | Stable Diffusion 3.5 | — |
盲测排名说明 Ideogram 4.0 在整体视觉质量上也是顶级水平,不只是文字渲染好。 这是一个重要的信号——过去很多「文字渲染好」的模型在整体美感上会有妥协,但 Ideogram 4.0 似乎同时做到了两者。
与竞品的核心对比
| 维度 | Ideogram 4.0 | DALL-E 3 | FLUX.1 | Midjourney V7 |
|---|---|---|---|---|
| 开源 | ✅ 开放权重 | ❌ 闭源 | ✅ 部分开源 | ❌ 闭源 |
| 参数量 | 9.3B | 未公布 | 12B | 未公布 |
| 文字渲染 | 0.97 | ~0.85-0.90 | ~0.75-0.85 | ~0.80-0.85 |
| 中文渲染 | 支持 | 较差 | 较差 | 较差 |
| 版面控制 | Bounding Box + JSON | 无 | 无 | 区域提示 |
| 透明背景 | ✅ | ❌ | ❌ | ❌ |
| 最大分辨率 | 2048(原生) | 1792 | 1024 | 2048(upscale) |
| 本地运行 | ✅(13G 显存) | ❌ | ✅(8-12G) | ❌ |
| 可编辑文字图层 | ✅ | ❌ | ❌ | ❌ |
| 定价 | 免费本地 / API 待定 | API 定价 | 免费本地 / API | 订阅制 |
Ideogram 4.0 的差异化优势非常清晰:开源 + 文字渲染天花板 + 版面精确控制 + 透明背景 + 可编辑文字图层。 这五个能力组合在其他模型中不存在。
实际使用中的局限
尽管 Ideogram 4.0 在很多维度上是当前最强,但有几个实际局限需要承认:
1. JSON 提示词需要额外 LLM
Ideogram 4.0 的 JSON 提示词系统不是给普通用户直接用的——你需要一个 LLM(如 Gemini Flash)来生成结构化 JSON。这意味着实际使用流程是:自然语言 → LLM → JSON → Ideogram → 图像。多了一步中间环节,增加了成本和延迟。
2. 显存门槛偏高
13G 的最低显存需求对很多用户来说是个门槛。RTX 4060(8GB)和 RTX 4070(12GB)都跑不了完整版。只有 RTX 4080(16GB)及以上才能顺畅运行。这比 FLUX.1 的 8-12G 门槛要高。
3. 双 UNet 设计增加复杂度
需要正面和负面两个 UNet 是 Ideogram 4.0 的架构特点,但也增加了部署和推理的复杂度。ComfyUI 工作流需要额外配置两个 UNet 的加载和协调,对新手来说不是一键体验。
4. bbox 坐标 bug
官方模板的 Bounding Box 坐标格式有 bug,应该是 [y_min, x_min, y_max, x_max] 而不是 [x_min, y_min, x_max, y_max]。这个问题虽然容易修正,但说明文档和模板还没有经过充分验证。
和 Seedance 2 一样,Ideogram 4.0 是一个技术很强但用户体验还在打磨的产品——能力天花板很高,但上手门槛也不低。
总结:该不该用 Ideogram 4.0?
如果你做设计工作(海报、名片、品牌物料、UI mockup),Ideogram 4.0 目前是最强选择。 0.97 的文字渲染准确率 + Bounding Box 版面控制 + 透明背景 + 可编辑文字图层——这些能力组合在设计场景中几乎完美。
如果你只是随手生成一些有趣的图像,FLUX.1 或 Midjourney 可能更方便。 Ideogram 4.0 的 JSON 提示词系统和双 UNet 配置增加了上手难度,对于不需要精确版面控制的用户来说,简单模型可能更合适。
如果你关心开源和本地可控性,Ideogram 4.0 是一个里程碑。 9.3B 参数开放权重 + 允许微调,这在文生图领域是不常见的组合。过去开源文生图模型(如 Stable Diffusion 系列)在文字渲染上一直很差,Ideogram 4.0 第一次把开源模型的文字渲染推到了接近完美水平。
但显存门槛是现实约束。 13G 最低配置意味着你需要一张 RTX 4080 或更好的显卡。如果你只有 RTX 4060/4070,目前跑不了完整版——可以等社区优化量化方案,或者用 Ideogram 的 API(定价待公布)。
Ideogram 官网:ideogram.ai HuggingFace 模型权重:huggingface.co/ideogram/ideogram-4.0 ComfyUI 工作流:Ideogram 官方 GitHub 仓库