每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

xAI发布图像生成模型Imagine 2.0,在Arena基准测试中位列第二,仅次于GPT-Image-2

新版本配备编辑工具和模板,Elo得分略逊于OpenAI模型

파란 소파와 붉은 의자가 있는 모던한 거실 인테리어

이미지: The Decoder

摘要

  • xAI在Grok中以"质量模式"推出了新图像生成模型Imagine Image 2.0
  • 在Arena基准测试的图像编辑和文本生成图像两个类别中均排名第二,仅次于OpenAI的GPT-Image-2
  • 配套提供Magic Wand、Multi-Ref Editing、Smart Resize等编辑工具及预设模板
原文视频
출시 경로
grok.com/imagine 및 Grok iOS·Android 앱 내 '퀄리티 모드'
API 지원
곧 제공 예정(xAI 발표 기준)
Image Edit Arena Elo
Imagine 2.0(low) 1,439 vs GPT-Image-2 1,463
Text-to-Image Arena Elo
Imagine 2.0(low) 1,320 vs GPT-Image-2 1,380
전체 순위
두 카테고리 모두 전체 2위, Reve 2.1·Muse-Image·Qwen-Image-3.0-Pro·Gemini·SeedDream보다 상위
편집 기능
Magic Wand, 세그멘테이션, 배경 제거, Multi-Ref Editing(최대 5장), Smart Resize
템플릿 분야
사진 편집, 제품 촬영, 마케팅 소재, 디자인 도구, 게임 에셋, 스트리밍 이모지

发布概况

xAI在Grok平台上发布了新的图像生成模型Imagine Image 2.0。该模型作为新的"质量模式",已在grok.com/imagine以及Grok的iOS、Android应用中上线,xAI表示API接口也将很快开放。公司介绍称,该模型的设计目标是精准遵循细致指令,在复杂图像中依然保持排版和布局的整洁,并在多次生成中保持一致性。

Arena基准测试成绩

截至2026年8月7日,在Arena排行榜上,Imagine 2.0速度更快的"low"版本在图像编辑和文本生成图像两个类别中均位列总榜第二。在图像编辑竞技场(Image Edit Arena)中,该模型获得1,439分的Elo评分,略低于OpenAI GPT-Image-2的1,463分。在文本生成图像竞技场(Text-to-Image Arena)中,该模型得分1,320分,同样低于GPT-Image-2的1,380分。

模型Image Edit Arena EloText-to-Image Arena Elo
GPT-Image-2 (OpenAI)1,463 bar:1001,380 bar:100
Imagine 2.0 low (xAI)1,439 bar:981,320 bar:96

Reve 2.1、Meta的Muse-Image、阿里巴巴(Alibaba)的Qwen-Image-3.0-Pro、谷歌(Google)的Gemini、字节跳动(ByteDance)的SeedDream等模型在两个类别中排名均低于Imagine 2.0。xAI表示,新模型相较于上一代"质量"版本有大幅提升。

新增编辑工具

Imagine Image 2.0新增了多项针对迭代式工作流优化的编辑功能。"Magic Wand"功能可仅修改选定区域,分割功能支持精确的区域选取。背景去除工具能够以透明背景提取目标对象。

"Multi-Ref Editing"功能可将最多5张输入图像组合成一张成品图。"Smart Resize"功能可将现有图像转换为所需的画面比例,模型会自动填补空白区域。

相关内容可参考METAL LAB的一篇文章,其中梳理了OpenAI图像生成模型的发展脉络,也可借此了解近期图像生成领域竞争格局的变化。

模板与视频预制功能

xAI还推出了针对常用图像工作流预先配置的模板,涵盖照片编辑、产品摄影、营销素材、设计工具、游戏素材、直播表情包等多个领域。

此外,公司还公布了一项功能,可分别生成角色、场景和道具,同时在整体图像中保持视觉风格的一致性。xAI表示,这一功能被定位为迈向未来完整视频制作工作流程的跳板。公司解释称,该功能能够创建出"一致的视觉世界",可作为视频制作的起点。

展望

Imagine 2.0在基准测试中略逊于GPT-Image-2的结果表明,图像生成模型在顶尖梯队的竞争已趋于白热化。API开放时间以及未来能否扩展至视频生成功能,将是下一步值得关注的焦点。