Showing Posts From
开源
-
Brody - 2026/06/26
Ideogram 4 正式开源:不输 GPT-Image 与 Midjourney 的 9.3B 图像模型,支持本地部署!
开源图像生成的「GPT 时刻」 2026 年 6 月 3 日,AI 图像生成公司 Ideogram 悄悄做了一个大动作:将旗下旗舰模型 Ideogram 4 的权重全面开源。 这不是一次常规的社区炒作。这是当前开源图像生成领域实力最强的模型——在多个第三方评测中,它不仅是所有开源模型中的第一名,而且在实际盲测中仅次于闭源的 GPT Image 2,把 Flux、Stable Diffusion、Hunyuan 等当红开源模型远远甩在身后。 简而言之:你用本地 GPU 跑出来的图,质量已经和顶级闭源服务不相上下了。Ideogram 4 是什么 Ideogram 是一家由前 Google Brain 研究员创立的 AI 图像公司,此前以精准的文字渲染(Text-in-Image)能力在设计师群体中积累了口碑。Ideogram 4 是他们的 首个开放权重模型——从头训练的基础模型,而非任何现有模型的微调。 几个关键数字:指标 数值参数量 9.3B架构 流匹配 Diffusion Transformer(DiT)文本编码器 Qwen3-VL-8B-Instruct最大原生分辨率 2048 × 2048宽高比范围 最高 6:1量化版本 nf4(CUDA)、fp8(全平台)许可证 非商业许可(商业需联系授权)推理代码许可 Apache 2.0六大核心能力拆解 1. 原生 2K 分辨率生成 大多数开源图像模型(如 SDXL、Flux)原生只能生成 1024×1024,要上 2K 必须依赖超分辨率后处理。Ideogram 4 直接原生支持 256–2048 的任意分辨率(16 的倍数),宽高比最高支持 6:1。 这意味着从方形缩略图到超宽横幅,一套权重全搞定——噪声调度会根据分辨率自动调整。 2. JSON 结构化提示词 这是 Ideogram 4 最独特的创新。模型完全在结构化 JSON 标注上训练,你可以用 JSON 精确控制:调色板:通过 colour_palette 数组指定十六进制颜色,每张图最多 16 个颜色 边界框布局:通过 bbox 坐标(y_min, x_min, y_max, x_max)精确放置主体和文字 空间组合:通过 compositional_deconstruction 逐元素描述每个对象的位置、大小、外观这对于 UI 原型设计、海报排版、数据可视化等需要精确控制的场景,价值巨大——AI 生图从「抽卡」变成了「编程」。 不想手写 JSON?Ideogram 提供了 Magic Prompt API(免费),自动将自然语言提示词转换为结构化 JSON。 3. 最强文字渲染 AI 生图中的「文字」一直是老大难问题。Ideogram 4 在这方面做到了开源最强:在 X-Omni OCR 英文准确率评测中,取得 0.97 的高分 以 9.3B 参数,领先 Qwen-Image(20B)、FLUX.2 dev(32B)、HunyuanImage 3.0(80B MoE)等参数量大得多的模型 支持多行文字、Logo、标语、水印的高保真生成在 ContraLabs 由 10 位专业设计师进行的盲测中,Ideogram 4 的排版能力以 47.9% 的第一名胜率大幅领先 Nano Banana 2(30.0%)、FLUX.2 [max](15.5%)和 Grok Imagine 1.0(15.0%)。 4. 极致参数效率 9.3B 的参数,在如今动辄 30B、80B 的图像模型里不算大。但 Ideogram 4 的评测结果表明——架构设计比堆参数重要得多。它在文本渲染、布局控制等核心维度上超越了参数量数倍于它的对手。 5. 全面可控性 除了 JSON 提示词,Ideogram 4 还支持:色彩调色板条件控制:直接指定主色调 非对称分类器自由引导:条件分支和无条件分支可独立优化,分别控制提示词遵循度和图像质量 多采样预设:V4_QUALITY_48(最高质量 48 步)、V4_DEFAULT_20、V4_TURBO_126. 安全审核集成 内置 Hive 文本和视觉内容审核,支持在推理时自动过滤不安全内容。技术架构:为什么 DiT + VLM 是正确答案 Ideogram 4 的架构有三个值得关注的设计决策: 全单流 DiT 文本和图像 token 拼接为统一序列,通过同一个 34 层 Transformer 处理——没有独立的文本分支或图像分支。这意味着每一层都能进行跨模态交互,而非在某个融合层才「见面」。 视觉语言模型做文本编码器 大多数图像模型用 CLIP 或 T5 做文本编码器,Ideogram 4 用的是 Qwen3-VL-8B-Instruct——一个完整的视觉语言模型。 更关键的是,它不从最后一层取隐藏状态,而是从 13 个中间层分别提取并拼接。这给了 DiT 多尺度的语义特征:浅层提供表面级 token 信息,深层提供组合性理解。 流匹配范式 使用 Flow Matching 替代传统扩散过程,用 Euler 采样器在 logit-normal 噪声调度上积分。相比 DDPM/DDIM,训练效率更高,推理质量也更好。横向对比:Ideogram 4 到底有多强 Design Arena(设计竞技场) 在 Design Arena 整体排行榜中:开源模型第一,以显著优势领先第二名 仅落后于 GPT 和 Gemini 两个闭源模型 在开源模型中以「断崖式」领先ContraLabs 专业设计师盲测 10 位顶级设计师盲测排版能力,Ideogram 4 在两项核心指标上全部第一:模型 第一名胜率 实际可用性(/5)Ideogram 4 47.9% 3.55Gemini 3.1 Flash 30.0% 2.84FLUX.2 [max] 15.5% 2.49Grok Imagine 1.0 15.0% 2.61Ideogram 内部评测 由专业平面设计师盲测,Bradley-Terry 评分:总排名第二,仅次于 GPT Image 2 medium 开源模型排名第一开源基准测试基准 测试能力 Ideogram 4 表现7Bench 布局控制 显著优于所有闭源模型SpatialGenEval 空间推理 接近领先闭源模型X-Omni OCR 文字渲染 最佳开源模型(0.97)Prism 提示词对齐 接近领先闭源模型一句话总结 如果说之前的开源图像模型是在「追赶」,Ideogram 4 就是在「并跑」。尤其是在设计和排版场景下,它几乎追平了闭源最强模型。本地部署指南 硬件要求量化版本 所需显存 支持平台nf4 ~13GB(双 UNet + CLIP GGUF) 仅 CUDA(NVIDIA GPU)fp8 更高 全平台最低配置推荐:16GB 显存的 NVIDIA GPU(如 RTX 4080、RTX 5070)。 步骤一:获取模型权重 模型权重在 Hugging Face 上设有访问门控,需要两步:访问模型页面,点击 「Agree and access repository」 接受许可协议nf4 版本:ideogram-ai/ideogram-4-nf4 fp8 版本:ideogram-ai/ideogram-4-fp8创建 Hugging Face 访问令牌并登录:hf auth login # 或直接导出 export HF_TOKEN="hf_..."步骤二:安装推理代码 git clone https://github.com/ideogram-oss/ideogram4 cd ideogram4 pip install .步骤三:获取 Magic Prompt API Key(免费) Magic Prompt 自动将自然语言转换为 JSON 提示词,注册即用: https://developer.ideogram.ai/ export IDEOGRAM_API_KEY="your_key_here"步骤四:运行推理 python run_inference.py \ --prompt "a ginger cat wearing a tiny wizard hat reading a spellbook" \ --output out.png \ --quantization "nf4" \ --magic-prompt-key "$IDEOGRAM_API_KEY"最高质量模式(原生 2K): python run_inference.py \ --prompt "..." \ --output out.png \ --quantization "nf4" \ --height 2048 \ --width 2048 \ --sampler-preset V4_QUALITY_48ComfyUI 集成(社区方案) ComfyUI 已实现 Day 0 支持,需要升级到 v0.24.0+。 安装配置在 ComfyUI 模板库中,找到 「Ideogram v4(滑滑板图标)」的本地运行模板(注意:还有一个是调用在线 API 的,不要选错)模型下载地址:modelscope.cn/models/Comfy-Org/Ideogram-4社区踩坑经验 来自知乎用户的实际测试反馈:双 UNet 结构:正面条件和负面条件各需要一个 UNet,即使用 nf4 量化也要 ~11GB CLIP 编码器很大:Qwen3-VL-8B 又是一个 ~11GB,建议用 GGUF 量化版本(unsloth/Qwen3-VL-8B-Instruct-GGUF) CFG 参数注意:CFG Override 的 start_percent 应设为 0.7,K Sampler 用 euler 最省显存方案:两个 UNet 都用 nf4,CLIP 用 GGUF,峰值显存约 13GB+ bbox 坐标格式:注意是 [y_min, x_min, y_max, x_max],而非常见的 [x, y, w, h]16GB 显存用户的一个痛点是每次改提示词都要重新加载 CLIP,机械硬盘用户出 1M 图要一分钟以上。强烈建议上 SSD。JSON 提示词实战 不想手写 JSON?用大模型生成。以下是社区验证有效的提示词模板(将最后一句替换为你的需求): Please act as a scene composition assistant. Given my request for an image, you must output a single JSON document that describes the scene in a structured, render-ready form. Output JSON only — no prose, no markdown fences, no commentary.Your response MUST be a single valid JSON object matching exactly this shape:{ "high_level_description": "...", "style_description": { "aesthetics": "...", "lighting": "...", "photo": "...", "medium": "...", "color_palette": ["#XXXXXX", "#XXXXXX"] }, "compositional_deconstruction": { "background": "...", "elements": [ { "type": "obj", "bbox": [y_min, x_min, y_max, x_max], "desc": "...", "color_palette": ["#XXXXXX"] } ] } }Hard constraints: - bbox coordinates: [y_min, x_min, y_max, x_max] on a 1000×1000 canvas - All keys are required. Output valid JSON and nothing else.Now, generate the JSON based on my image request: [你的绘画需求]用 Gemini Flash 或 GPT-4o 来生成 JSON 提示词,效果最好。写在最后:开源图像模型的转折点 Ideogram 4 的开源有几个信号值得关注:开源不再等于「够用就行」。它在设计和排版场景下已经逼近甚至超越闭源最强模型,这对 Midjourney、DALL·E 构成真实压力。架构创新比参数量重要。9.3B 的模型在多个维度上碾压 30B、80B 的对手——单流 DiT + VLM 编码器 + JSON 结构化训练的组合拳,可能是下一代图像模型的标配。本地部署的体验门槛在降低。nf4 量化 + GGUF CLIP 编码器已经能在 16GB 消费级显卡上跑,虽然速度不如云端服务,但对于追求隐私和可控性的用户,这是一个真正的选择。「可编程生图」是新方向。JSON 提示词看似增加了使用门槛,但它将 AI 生图从「描述性」推向了「精确控制」,打开了 UI 原型、排版设计、数据可视化等严肃应用场景的大门。最后也说一句实话:如果你只是偶尔生成几张图玩,直接用 ideogram.ai 的在线服务就够了。但如果你需要精确控制、本地隐私、批量生成,或者你想在自己的产品中集成图像生成能力——Ideogram 4 可能是当下最好的开源选择。
-
Brody - 2026/05/25
Hermes Agent vs OpenClaw:2026 年两个最火开源 AI Agent 的终极对比
2026 年的开源 AI Agent 圈子,有两个项目你必须知道。 一个是 OpenClaw——2026 年 3 月超越 React 成为 GitHub 最高星标项目,目前 350k+ Stars,从一个个人副项目变成了现象级开源基础设施。 另一个是 Hermes Agent——Nous Research 出品,167k Stars,自称「唯一内置学习循环的 Agent」,核心卖点是越用越聪明。 如果你正在犹豫该用哪个(或者两个都想试试),这篇文章帮你把核心差异讲清楚。一句话定位 它们不是竞品,而是两条完全不同的路线:OpenClaw Hermes Agent一句话 让你定义规则,让 AI 执行 让 AI 自己学会做事代表路线 广度连接——接入最多的平台 深度进化——越用越懂你核心角色 执行者(Doer) 学习者(Learner)比喻 万能遥控器 会成长的徒弟五大维度深度对比 1. 架构与安全:CVE 教会了我们什么? 这是两个项目最根本的设计分歧。 OpenClaw 采用单进程架构——工具、集成、平台适配器全部运行在同一个地址空间。这种设计带来的好处是启动快、部署简单、资源占用低。但代价也在 2026 年 2 月暴露了:CVE-2026-25253:未认证的远程代码执行(RCE),CVSS 评分 8.8(高危),数万个未打补丁的实例被入侵。之后 OpenClaw 引入了 AgentWard(eBPF 探针监控)、SkillFortify(技能形式化验证)、Raypher(硬件身份认证)等安全组件,但本质上是在修补一个默认不隔离的架构。 Hermes Agent 从第一天起就是分层隔离架构: 平台适配器 → 网关进程 → Agent 运行时(受控接口)→ 工具执行(沙盒)平台网关无法直接访问 Agent 运行时,工具执行默认在沙盒内。截至 2026 年 5 月,Hermes Agent 没有已知的 CVE。💡 安全总结:OpenClaw 靠补丁堆砌安全,Hermes Agent 靠架构从源头限制爆炸半径。2. 记忆系统:谁记得更牢? 记忆系统是 AI Agent 的「大脑」。 OpenClaw 的记忆以 Markdown 文件为基础载体(SOUL.md、AGENTS.md 等),通过 Dinobase 提供生产级持久化存储。高级记忆功能(向量检索、知识图谱)需要额外安装插件。整体来说,手动可控,但需要深度定制。 Hermes Agent 的记忆是架构级原生设计:会话历史存储在 SQLite,支持 FTS5 全文检索 每次对话前自动加载相关记忆和技能 内置用户建模系统(集成 Honcho),持续积累你的沟通风格和偏好 零人工维护,全自动沉淀💡 记忆总结:Hermes 是懒人友好型——你什么都不用做,它自己记;OpenClaw 是控制狂友好型——你想让它记什么,它就记什么。3. 技能机制:最核心的差异 这是两者最本质的区别。 OpenClaw 的技能是人工编写 + 社区下载的。你需要去 ClawHub 技能市场搜索、安装、管理插件。生态成熟,技能数量丰富,但每次执行相同任务,Agent 都需要重新规划。 Hermes Agent 的技能是自动生成 + 自我进化的: 解决任务 → 记录技能文档 → 下次遇到类似任务 → 直接调用缓存技能 → 跳过规划阶段完成一个复杂任务后,Agent 会自动调用 skill_manage 工具生成一份标准技能文档,记录解决方法、遇到的陷阱、边界情况。使用过程中发现问题,还会通过 patch 动作精准优化。 Nous Research 内部基准测试显示,经过数周技能积累后,研究任务完成速度提升约 40%。💡 技能总结:OpenClaw 是「用现成技能」,Hermes 是「自己造技能」。短期 OpenClaw 更快(生态成熟),长期 Hermes 的复利效应更明显。4. 平台覆盖:25+ vs 7 这是 OpenClaw 的绝对主场。 OpenClaw 覆盖 25+ 消息平台:WhatsApp、Telegram、Slack、Discord、Signal、Email、iMessage、Microsoft Teams、Google Chat、Matrix、飞书、微信、LINE、IRC、Twitch……而且所有渠道共享同一个 Agent 和本地记忆。 Hermes Agent 目前支持 7 个平台:Telegram、Discord、Slack、WhatsApp、Signal、Email、CLI。能力 OpenClaw Hermes Agent消息平台 25+ 7语音模式 支持 不支持伴侣 App macOS + iOS + Android 无浏览器控制 支持 通过 MCPiMessage 独占 不支持💡 覆盖总结:如果你需要接入微信、飞书、iMessage 等平台,OpenClaw 目前没有对手。5. 成本与部署 两者的软件本身都免费开源。 主要成本在 LLM API 调用。如果你搭配 Ollama + 本地开源模型,两者都可以实现零 API 成本。维度 OpenClaw Hermes Agent安装 npm install -g openclaw 一键脚本(curl | bash)配置复杂度 简单上手,深度配置需学习 稍复杂,但后续自进化降低长期成本运行环境 Node.js(轻量) Python(稍重)Serverless 支持 无 Modal / Daytona(空闲时近乎零成本)💡 成本总结:两者都可以用最低 5$/月的 VPS 跑起来。Hermes 的 Serverless 后端是一个额外优势——不干活时不花钱。综合评分对比维度 OpenClaw Hermes Agent 胜出渠道覆盖 25+ 平台 7 平台 OpenClaw设备集成 语音/App/设备控制 CLI 为主 OpenClaw安全架构 补丁堆砌 分层隔离,零 CVE Hermes自我进化 不支持 闭环学习,+40% 效率 Hermes跨会话记忆 插件依赖,手动维护 FTS5 原生,全自动 Hermes技能生态 成熟丰富,即装即用 自动生成,复利增长 平手数据主权 本地优先,完全可控 未特别强调 OpenClaw安装便捷 一行 npm 命令 一键脚本 平手你该怎么选? 选 OpenClaw 的场景你是个人用户,需要接入微信、飞书、iMessage 等平台 你需要语音交互或 macOS/iOS/Android 伴侣 App 你重视数据主权,所有数据留在本地 你已经有成熟的技能工作流,不需要 Agent 自己学选 Hermes Agent 的场景你希望 Agent 越用越聪明,自动积累经验 你处理高重复度工作流(定期报告、代码审查、数据清洗) 你运行敏感工作流,需要默认沙盒保护 你是开发者或研究者,需要技能的复利效应组合方案 两者并非对立,可以搭配使用:Hermes Agent 做指挥中心(记忆沉淀、技能生成、任务规划),OpenClaw 做执行端(利用多平台能力完成具体操作),实现自动成长 + 高效执行的能力互补。迁移指南 如果你已经在用 OpenClaw 想迁移到 Hermes Agent,好消息是 Hermes 内置了专用迁移工具: # 预览将迁移的内容 hermes claw migrate --dry-run# 执行迁移 hermes claw migrate迁移内容包括人格文件(SOUL.md)、记忆、技能、消息设置、API 密钥等。⚠️ 注意:OpenClaw 的 25+ 渠道中只有 7 个能迁移到 Hermes。如果依赖 iMessage、飞书、微信等独占渠道,建议两者并存。写在最后 2026 年的 AI Agent 赛道,OpenClaw 和 Hermes Agent 代表了两种截然不同的设计哲学:OpenClaw 相信「人是决策中心」——你定义规则,AI 执行 Hermes Agent 相信「AI 可以自己进化」——你给机会,AI 成长没有绝对的对错,只有是否匹配你的需求。但有一点是确定的:AI Agent 的未来,一定是这两条路线的融合——既要有 OpenClaw 的广度连接能力,也要有 Hermes 的深度进化能力。 现在,你想让 AI 做你的遥控器,还是做你的学徒?参考来源:Nous Research GitHub、OpenClaw 官方文档及社区对比分析