跳转到主要内容
Beehive
导航
Home 前沿动态 最后修订:2026.06.03 · 11 min

Ideogram 4.0 开源:文字渲染准确率 0.97,9.3B 参数的文生图天花板

前 Google Brain 团队发布 Ideogram 4.0:9.3B 参数开源权重文生图模型,英文文字渲染准确率 0.97,首创边界框版面控制+JSON提示词,原生 2K 输出+透明背景。ComfyUI Day-0 支持,13G显存可跑。

前沿动态

2026 年 6 月 3 日,Ideogram 开源了 4.0 版本的模型权重。

这是一家由前 Google Brain 研究员创立的公司,在文生图领域一直主打「文字渲染」这个细分能力。Ideogram 4.0 把这个能力推到了一个新高度:英文文字渲染准确率 0.97——接近完美。

但更值得注意的是,Ideogram 4.0 不只是「文字写得好看」。它引入了两个新机制:边界框版面控制JSON 提示词系统,把文生图从「写一句描述等结果」推进到「精确指定每个元素的位置和内容」。

本文拆解 Ideogram 4.0 的技术架构、显存需求、ComfyUI 部署方案,以及它和竞品的真实对比。

核心规格一览

以下数据来自 Ideogram 官方公告和 HuggingFace 模型卡

维度 Ideogram 4.0
发布者 Ideogram(前 Google Brain 团队)
参数量 9.3B
开源日期 2026 年 6 月 3 日
许可证 开放权重(允许本地运行和微调)
英文文字渲染准确率 0.97
多语言文字支持 中日韩等多语言
最大输出分辨率 2048 × 2048(原生 2K)
透明背景 支持生成透明背景图像
可编辑文字图层 支持二次修改
边界框版面控制 首创 Bounding Box + 结构化 JSON 提示词
Text Encoder Qwen 3VL 8B(约 10G)
ComfyUI 支持 Day-0,需 v0.24.0+

关键信息:9.3B 参数 + 开放权重,这意味着本地部署和微调都是合法的。 和闭源文生图模型(如 GPT Images 2)相比,Ideogram 4.0 在可控性和透明度上有本质优势。

文字渲染:为什么 0.97 这么重要?

文生图模型的文字渲染一直是最大短板。DALL-E 3、Midjourney V7、Stable Diffusion 3.5——所有主流模型在生成包含文字的图像时,都存在拼写错误、字体变形、字符缺失等问题。

Ideogram 4.0 的 0.97 英文文字渲染准确率意味着什么?

模型 英文文字渲染准确率(估算)
Ideogram 4.0 0.97
DALL-E 3 约 0.85-0.90
Midjourney V7 约 0.80-0.85
Stable Diffusion 3.5 约 0.70-0.80
FLUX.1 约 0.75-0.85

0.97 接近人类排版水平。 在一个需要精确文字的图像(比如海报、名片、UI mockup)中,Ideogram 4.0 几乎不会出现拼写错误,而其他模型可能每 10 个词就有 1-2 个错误。

更重要的是,Ideogram 4.0 支持中日韩多语言文字渲染。这对中文用户尤其有意义——过去几乎所有文生图模型在中文文字渲染上都很差,Ideogram 4.0 是第一个在这方面有实质性突破的模型。

边界框版面控制:从「写描述」到「画蓝图」

Ideogram 4.0 最具创新性的功能是边界框版面控制(Bounding Box Layout Control)。

传统的文生图工作流是:你写一句描述,模型生成一张图,你看看不满意再改描述再生成。整个过程中,你对图像版面的控制非常间接——你只能描述「左边有文字,右边有人」,但具体文字多大、放在哪个位置,你几乎无法精确控制。

边界框版面控制改变了这个流程。你可以:

  1. 指定每个元素的位置。 用 Bounding Box 精确定义文字、图形、图像在画面中的坐标。
  2. 指定每个元素的内容。 用结构化 JSON 提示词为每个 Bounding Box 定义具体内容。
  3. 指定每个元素的尺寸。 控制文字大小、图形比例、图像区域。

JSON 提示词系统示例

{
  "prompt": "A professional business card",
  "bounding_boxes": [
    {
      "content": "ACME Corp",
      "bbox": [0.1, 0.15, 0.9, 0.35],
      "type": "text"
    },
    {
      "content": "John Smith\nCEO\njohn@acme.com",
      "bbox": [0.1, 0.5, 0.9, 0.85],
      "type": "text"
    },
    {
      "content": "logo",
      "bbox": [0.05, 0.02, 0.3, 0.12],
      "type": "image"
    }
  ]
}

注意:bbox 坐标格式为 [y_min, x_min, y_max, x_max] 之前的模板有 bug,用的是 [x_min, y_min, x_max, y_max],需要修正。

这个 JSON 提示词系统需要配合一个 LLM 来生成——Ideogram 官方推荐用 Gemini Flash 来生成结构化 JSON 提示词。流程是:

  1. 你用自然语言描述你想要的版面
  2. Gemini Flash 把自然语言转换成结构化 JSON
  3. Ideogram 4.0 根据 JSON + Bounding Box 生成图像

这增加了一步中间环节,但换来了对版面的精确控制。对于 UI 设计师、海报制作、品牌物料生成等需要精确排版的工作,这个能力是其他模型目前做不到的。

显存需求与本地部署方案

Ideogram 4.0 的本地部署门槛比看起来要高。原因是它需要两个 UNet(正面条件 + 负面条件),加上 Qwen 3VL 8B 作为 Text Encoder。

配置方案 显存需求 说明
双 UNet nvfp4 + GGUF Clip 约 13G 推荐最低配置
双 UNet fp8 + fp8 Clip 约 16-18G 更好质量
双 UNet fp16 + fp16 Clip 约 25-30G 推荐专业显卡
单 UNet(实验性) 约 8-10G 可能影响质量

关键信息:即使使用 nvfp4 量化,也需要约 13G 显存。 这意味着一张 RTX 4070(12GB)勉强不够,一张 RTX 4080(16GB)可以跑 nvfp4 版本,一张 RTX 4090(24GB)可以跑 fp8 版本。

ComfyUI 部署步骤

ComfyUI 是目前唯一在发布当天就支持 Ideogram 4.0 的工具(Day-0 支持)。

  1. 更新 ComfyUI 到 v0.24.0+。旧版本不支持双 UNet 工作流。
  2. 下载模型权重。从 HuggingFace 下载 UNet(正面和负面各一个)和 Text Encoder(Qwen 3VL 8B)。
  3. 加载工作流模板。Ideogram 官方提供了 ComfyUI 工作流 JSON,直接导入即可。
  4. 修正 bbox 坐标格式。官方模板的 bbox 坐标有 bug,需要改为 [y_min, x_min, y_max, x_max] 格式。

Sora Legacy 的对比

Sora Legacy 是 OpenAI 的视频生成模型,和 Ideogram 4.0 是不同领域(视频 vs 图像)。但两者在本地部署门槛上有类似的问题——都需要专业级硬件才能完整运行。如果你只做图像生成,Ideogram 4.0 的 13G 门槛比 Sora 的需求低很多;如果你需要视频,Sora 是唯一选项。

原生 2K 输出与透明背景

Ideogram 4.0 的两个辅助能力也值得单独说明:

原生 2K 分辨率

模型 最大输出分辨率
Ideogram 4.0 2048 × 2048(原生)
DALL-E 3 1024 × 1024(可扩展到 1792)
Midjourney V7 约 2048(需 upscale)
FLUX.1 1024 × 1024

Ideogram 4.0 的 2K 输出是原生生成,不是后期 upscale。 这意味着高分辨率下文字和线条的质量不会因为放大而模糊——这对需要印刷级输出的设计工作很重要。

透明背景

Ideogram 4.0 支持直接生成透明背景图像,不需要后期抠图。这在 logo 设计、UI 元素生成、电商产品图等场景中非常实用——过去需要专门用 rembg 等工具做背景去除,现在一步完成。

Artificial Analysis Image Arena 盲测排名

Ideogram 4.0 在 Artificial Analysis Image Arena 盲测中排名顶尖。盲测的规则是:用户看到两张图,不知道是哪个模型生成的,选择更好看的那张。

排名 模型 ELO 分数(估算)
顶尖 Ideogram 4.0 最高档
高档 Midjourney V7
中高档 DALL-E 3 / FLUX.1
中档 Stable Diffusion 3.5

盲测排名说明 Ideogram 4.0 在整体视觉质量上也是顶级水平,不只是文字渲染好。 这是一个重要的信号——过去很多「文字渲染好」的模型在整体美感上会有妥协,但 Ideogram 4.0 似乎同时做到了两者。

与竞品的核心对比

维度 Ideogram 4.0 DALL-E 3 FLUX.1 Midjourney V7
开源 ✅ 开放权重 ❌ 闭源 ✅ 部分开源 ❌ 闭源
参数量 9.3B 未公布 12B 未公布
文字渲染 0.97 ~0.85-0.90 ~0.75-0.85 ~0.80-0.85
中文渲染 支持 较差 较差 较差
版面控制 Bounding Box + JSON 区域提示
透明背景
最大分辨率 2048(原生) 1792 1024 2048(upscale)
本地运行 ✅(13G 显存) ✅(8-12G)
可编辑文字图层
定价 免费本地 / API 待定 API 定价 免费本地 / API 订阅制

Ideogram 4.0 的差异化优势非常清晰:开源 + 文字渲染天花板 + 版面精确控制 + 透明背景 + 可编辑文字图层。 这五个能力组合在其他模型中不存在。

实际使用中的局限

尽管 Ideogram 4.0 在很多维度上是当前最强,但有几个实际局限需要承认:

1. JSON 提示词需要额外 LLM

Ideogram 4.0 的 JSON 提示词系统不是给普通用户直接用的——你需要一个 LLM(如 Gemini Flash)来生成结构化 JSON。这意味着实际使用流程是:自然语言 → LLM → JSON → Ideogram → 图像。多了一步中间环节,增加了成本和延迟。

2. 显存门槛偏高

13G 的最低显存需求对很多用户来说是个门槛。RTX 4060(8GB)和 RTX 4070(12GB)都跑不了完整版。只有 RTX 4080(16GB)及以上才能顺畅运行。这比 FLUX.1 的 8-12G 门槛要高。

3. 双 UNet 设计增加复杂度

需要正面和负面两个 UNet 是 Ideogram 4.0 的架构特点,但也增加了部署和推理的复杂度。ComfyUI 工作流需要额外配置两个 UNet 的加载和协调,对新手来说不是一键体验。

4. bbox 坐标 bug

官方模板的 Bounding Box 坐标格式有 bug,应该是 [y_min, x_min, y_max, x_max] 而不是 [x_min, y_min, x_max, y_max]。这个问题虽然容易修正,但说明文档和模板还没有经过充分验证。

Seedance 2 一样,Ideogram 4.0 是一个技术很强但用户体验还在打磨的产品——能力天花板很高,但上手门槛也不低。

总结:该不该用 Ideogram 4.0?

如果你做设计工作(海报、名片、品牌物料、UI mockup),Ideogram 4.0 目前是最强选择。 0.97 的文字渲染准确率 + Bounding Box 版面控制 + 透明背景 + 可编辑文字图层——这些能力组合在设计场景中几乎完美。

如果你只是随手生成一些有趣的图像,FLUX.1 或 Midjourney 可能更方便。 Ideogram 4.0 的 JSON 提示词系统和双 UNet 配置增加了上手难度,对于不需要精确版面控制的用户来说,简单模型可能更合适。

如果你关心开源和本地可控性,Ideogram 4.0 是一个里程碑。 9.3B 参数开放权重 + 允许微调,这在文生图领域是不常见的组合。过去开源文生图模型(如 Stable Diffusion 系列)在文字渲染上一直很差,Ideogram 4.0 第一次把开源模型的文字渲染推到了接近完美水平。

但显存门槛是现实约束。 13G 最低配置意味着你需要一张 RTX 4080 或更好的显卡。如果你只有 RTX 4060/4070,目前跑不了完整版——可以等社区优化量化方案,或者用 Ideogram 的 API(定价待公布)。

Ideogram 官网:ideogram.ai HuggingFace 模型权重:huggingface.co/ideogram/ideogram-4.0 ComfyUI 工作流:Ideogram 官方 GitHub 仓库

Beehive · 蜂巢

ORIGINAL

采用 CC BY 4.0 许可协议 · 转载请注明出处

前沿动态
文章链接已复制到剪贴板