Ideogram 4 正式开源:不输 GPT-Image 与 Midjourney 的 9.3B 图像模型,支持本地部署!

Ideogram 4 正式开源:不输 GPT-Image 与 Midjourney 的 9.3B 图像模型,支持本地部署!

开源图像生成的「GPT 时刻」

2026 年 6 月 3 日,AI 图像生成公司 Ideogram 悄悄做了一个大动作:将旗下旗舰模型 Ideogram 4 的权重全面开源

这不是一次常规的社区炒作。这是当前开源图像生成领域实力最强的模型——在多个第三方评测中,它不仅是所有开源模型中的第一名,而且在实际盲测中仅次于闭源的 GPT Image 2,把 Flux、Stable Diffusion、Hunyuan 等当红开源模型远远甩在身后。

简而言之:你用本地 GPU 跑出来的图,质量已经和顶级闭源服务不相上下了


Ideogram 4 是什么

Ideogram 是一家由前 Google Brain 研究员创立的 AI 图像公司,此前以精准的文字渲染(Text-in-Image)能力在设计师群体中积累了口碑。Ideogram 4 是他们的 首个开放权重模型——从头训练的基础模型,而非任何现有模型的微调。

几个关键数字:

指标数值
参数量9.3B
架构流匹配 Diffusion Transformer(DiT)
文本编码器Qwen3-VL-8B-Instruct
最大原生分辨率2048 × 2048
宽高比范围最高 6:1
量化版本nf4(CUDA)、fp8(全平台)
许可证非商业许可(商业需联系授权)
推理代码许可Apache 2.0

六大核心能力拆解

1. 原生 2K 分辨率生成

大多数开源图像模型(如 SDXL、Flux)原生只能生成 1024×1024,要上 2K 必须依赖超分辨率后处理。Ideogram 4 直接原生支持 256–2048 的任意分辨率(16 的倍数),宽高比最高支持 6:1。

这意味着从方形缩略图到超宽横幅,一套权重全搞定——噪声调度会根据分辨率自动调整。

2. JSON 结构化提示词

这是 Ideogram 4 最独特的创新。模型完全在结构化 JSON 标注上训练,你可以用 JSON 精确控制:

  • 调色板:通过 colour_palette 数组指定十六进制颜色,每张图最多 16 个颜色
  • 边界框布局:通过 bbox 坐标(y_min, x_min, y_max, x_max)精确放置主体和文字
  • 空间组合:通过 compositional_deconstruction 逐元素描述每个对象的位置、大小、外观

这对于 UI 原型设计、海报排版、数据可视化等需要精确控制的场景,价值巨大——AI 生图从「抽卡」变成了「编程」。

不想手写 JSON?Ideogram 提供了 Magic Prompt API(免费),自动将自然语言提示词转换为结构化 JSON。

3. 最强文字渲染

AI 生图中的「文字」一直是老大难问题。Ideogram 4 在这方面做到了开源最强:

  • 在 X-Omni OCR 英文准确率评测中,取得 0.97 的高分
  • 以 9.3B 参数,领先 Qwen-Image(20B)、FLUX.2 dev(32B)、HunyuanImage 3.0(80B MoE)等参数量大得多的模型
  • 支持多行文字、Logo、标语、水印的高保真生成

在 ContraLabs 由 10 位专业设计师进行的盲测中,Ideogram 4 的排版能力以 47.9% 的第一名胜率大幅领先 Nano Banana 2(30.0%)、FLUX.2 [max](15.5%)和 Grok Imagine 1.0(15.0%)。

4. 极致参数效率

9.3B 的参数,在如今动辄 30B、80B 的图像模型里不算大。但 Ideogram 4 的评测结果表明——架构设计比堆参数重要得多。它在文本渲染、布局控制等核心维度上超越了参数量数倍于它的对手。

5. 全面可控性

除了 JSON 提示词,Ideogram 4 还支持:

  • 色彩调色板条件控制:直接指定主色调
  • 非对称分类器自由引导:条件分支和无条件分支可独立优化,分别控制提示词遵循度和图像质量
  • 多采样预设:V4_QUALITY_48(最高质量 48 步)、V4_DEFAULT_20、V4_TURBO_12

6. 安全审核集成

内置 Hive 文本和视觉内容审核,支持在推理时自动过滤不安全内容。


技术架构:为什么 DiT + VLM 是正确答案

Ideogram 4 的架构有三个值得关注的设计决策:

全单流 DiT

文本和图像 token 拼接为统一序列,通过同一个 34 层 Transformer 处理——没有独立的文本分支或图像分支。这意味着每一层都能进行跨模态交互,而非在某个融合层才「见面」。

视觉语言模型做文本编码器

大多数图像模型用 CLIP 或 T5 做文本编码器,Ideogram 4 用的是 Qwen3-VL-8B-Instruct——一个完整的视觉语言模型。

更关键的是,它不从最后一层取隐藏状态,而是从 13 个中间层分别提取并拼接。这给了 DiT 多尺度的语义特征:浅层提供表面级 token 信息,深层提供组合性理解。

流匹配范式

使用 Flow Matching 替代传统扩散过程,用 Euler 采样器在 logit-normal 噪声调度上积分。相比 DDPM/DDIM,训练效率更高,推理质量也更好。


横向对比:Ideogram 4 到底有多强

Design Arena(设计竞技场)

Design Arena 整体排行榜中:

  • 开源模型第一,以显著优势领先第二名
  • 仅落后于 GPT 和 Gemini 两个闭源模型
  • 在开源模型中以「断崖式」领先

ContraLabs 专业设计师盲测

10 位顶级设计师盲测排版能力,Ideogram 4 在两项核心指标上全部第一:

模型第一名胜率实际可用性(/5)
Ideogram 447.9%3.55
Gemini 3.1 Flash30.0%2.84
FLUX.2 [max]15.5%2.49
Grok Imagine 1.015.0%2.61

Ideogram 内部评测

由专业平面设计师盲测,Bradley-Terry 评分:

  • 总排名第二,仅次于 GPT Image 2 medium
  • 开源模型排名第一

开源基准测试

基准测试能力Ideogram 4 表现
7Bench布局控制显著优于所有闭源模型
SpatialGenEval空间推理接近领先闭源模型
X-Omni OCR文字渲染最佳开源模型(0.97)
Prism提示词对齐接近领先闭源模型

一句话总结

如果说之前的开源图像模型是在「追赶」,Ideogram 4 就是在「并跑」。尤其是在设计和排版场景下,它几乎追平了闭源最强模型。


本地部署指南

硬件要求

量化版本所需显存支持平台
nf4~13GB(双 UNet + CLIP GGUF)仅 CUDA(NVIDIA GPU)
fp8更高全平台

最低配置推荐:16GB 显存的 NVIDIA GPU(如 RTX 4080、RTX 5070)。

步骤一:获取模型权重

模型权重在 Hugging Face 上设有访问门控,需要两步:

  1. 访问模型页面,点击 「Agree and access repository」 接受许可协议

  2. 创建 Hugging Face 访问令牌并登录:

hf auth login
# 或直接导出
export HF_TOKEN="hf_..."

步骤二:安装推理代码

git clone https://github.com/ideogram-oss/ideogram4
cd ideogram4
pip install .

步骤三:获取 Magic Prompt API Key(免费)

Magic Prompt 自动将自然语言转换为 JSON 提示词,注册即用: https://developer.ideogram.ai/

export IDEOGRAM_API_KEY="your_key_here"

步骤四:运行推理

python run_inference.py \
  --prompt "a ginger cat wearing a tiny wizard hat reading a spellbook" \
  --output out.png \
  --quantization "nf4" \
  --magic-prompt-key "$IDEOGRAM_API_KEY"

最高质量模式(原生 2K):

python run_inference.py \
  --prompt "..." \
  --output out.png \
  --quantization "nf4" \
  --height 2048 \
  --width 2048 \
  --sampler-preset V4_QUALITY_48

ComfyUI 集成(社区方案)

ComfyUI 已实现 Day 0 支持,需要升级到 v0.24.0+。

安装配置

  1. 在 ComfyUI 模板库中,找到 「Ideogram v4(滑滑板图标)」的本地运行模板(注意:还有一个是调用在线 API 的,不要选错)

  2. 模型下载地址:modelscope.cn/models/Comfy-Org/Ideogram-4

社区踩坑经验

来自知乎用户的实际测试反馈:

  • 双 UNet 结构:正面条件和负面条件各需要一个 UNet,即使用 nf4 量化也要 ~11GB
  • CLIP 编码器很大:Qwen3-VL-8B 又是一个 ~11GB,建议用 GGUF 量化版本(unsloth/Qwen3-VL-8B-Instruct-GGUF
  • CFG 参数注意:CFG Override 的 start_percent 应设为 0.7,K Sampler 用 euler
  • 最省显存方案:两个 UNet 都用 nf4,CLIP 用 GGUF,峰值显存约 13GB+
  • bbox 坐标格式:注意是 [y_min, x_min, y_max, x_max],而非常见的 [x, y, w, h]

16GB 显存用户的一个痛点是每次改提示词都要重新加载 CLIP,机械硬盘用户出 1M 图要一分钟以上。强烈建议上 SSD。


JSON 提示词实战

不想手写 JSON?用大模型生成。以下是社区验证有效的提示词模板(将最后一句替换为你的需求):

Please act as a scene composition assistant. Given my request for an image,
you must output a single JSON document that describes the scene in a
structured, render-ready form. Output JSON only — no prose, no markdown
fences, no commentary.

Your response MUST be a single valid JSON object matching exactly this shape:

{
  "high_level_description": "...",
  "style_description": {
    "aesthetics": "...",
    "lighting": "...",
    "photo": "...",
    "medium": "...",
    "color_palette": ["#XXXXXX", "#XXXXXX"]
  },
  "compositional_deconstruction": {
    "background": "...",
    "elements": [
      {
        "type": "obj",
        "bbox": [y_min, x_min, y_max, x_max],
        "desc": "...",
        "color_palette": ["#XXXXXX"]
      }
    ]
  }
}

Hard constraints:
- bbox coordinates: [y_min, x_min, y_max, x_max] on a 1000×1000 canvas
- All keys are required. Output valid JSON and nothing else.

Now, generate the JSON based on my image request: [你的绘画需求]

用 Gemini Flash 或 GPT-4o 来生成 JSON 提示词,效果最好。


写在最后:开源图像模型的转折点

Ideogram 4 的开源有几个信号值得关注:

  1. 开源不再等于「够用就行」。它在设计和排版场景下已经逼近甚至超越闭源最强模型,这对 Midjourney、DALL·E 构成真实压力。

  2. 架构创新比参数量重要。9.3B 的模型在多个维度上碾压 30B、80B 的对手——单流 DiT + VLM 编码器 + JSON 结构化训练的组合拳,可能是下一代图像模型的标配。

  3. 本地部署的体验门槛在降低。nf4 量化 + GGUF CLIP 编码器已经能在 16GB 消费级显卡上跑,虽然速度不如云端服务,但对于追求隐私和可控性的用户,这是一个真正的选择。

  4. 「可编程生图」是新方向。JSON 提示词看似增加了使用门槛,但它将 AI 生图从「描述性」推向了「精确控制」,打开了 UI 原型、排版设计、数据可视化等严肃应用场景的大门。

最后也说一句实话:如果你只是偶尔生成几张图玩,直接用 ideogram.ai 的在线服务就够了。但如果你需要精确控制、本地隐私、批量生成,或者你想在自己的产品中集成图像生成能力——Ideogram 4 可能是当下最好的开源选择。