产品简介
GPT-Image-2 是 OpenAI 于 2026 年 4 月 21 日发布的新一代图像生成模型,对外品牌名 ChatGPT Images 2.0,API 模型名 gpt-image-2。它采用非扩散的全新架构,发布即替换 DALL·E 3 成为 ChatGPT 的默认图像模型,在 LM Arena 以 ELO 1512 登顶,领先 Nano Banana 2 约 240 分。
它把长期困扰图像模型的两件事解决了。一是文字渲染,中文排版准确率达到 99%,菜单、海报、杂志这类文字密集场景不再翻车,此前这是所有图像模型的通病。二是理解力,生成前会联网检索、分析上传文件、推理画面结构,而不是机械拼贴,面对复杂 prompt 也能稳定执行。规格上支持最高 4096×4096 分辨率、单次生成 8 张变体,ChatGPT、Codex、API 三端同步上线。
2026 年 9 月 8 日升级为 ChatGPT Images 2.5,覆盖全部付费层级的 ChatGPT、ChatGPT Work 与 Codex,桌面、移动、网页三端可用。相比 2.0,生成延迟最高降低 50%,细节更锐利、光照更自然、纹理更丰富;精确编辑只改动指定区域,多轮修改的一致性更强,参考照片的人物与物体特征保持度也明显提升,还支持透明背景等复杂版式。API 端同步推出 GPT-Image-2.5 Flare 与 Sunburst 两个模型,分别面向高效生成与高端视觉工作流,ChatGPT Images 与 GPT-Image API 合计每周生成超 30 亿张图像。
核心功能
- 99% 文字渲染准确率:中英文排版几乎完美,支持菜单、海报、杂志等文字密集场景
- 4K 分辨率:最高 4096×4096 超高清输出,速度比前代快一倍
- 思考能力:生成前联网检索、分析上传文件、推理图像结构
- 单次 8 张:一次生成多变体,快速迭代
- UI 截图生成:能做高保真界面设计图、网页截图
- 精准局部编辑:修改指定区域,保持其余部分不变
适合谁用
以下类型的用户会特别受益于 GPT-Image-2:
- 社交媒体海报、小红书封面、公众号头图
- 产品发布会主视觉、活动物料
- 电商商品图、菜单、杂志内页
- UI 设计原型、网页概念稿
- 带文字的营销物料(中文文字再也不翻车)
优点亮点
- LM Arena 登顶第一,综合能力最强
- 中文文字渲染 99% 准确,业界首次
- 4K 分辨率 + 速度翻倍
- 引入推理能力,理解复杂 prompt
- ChatGPT / Codex / API 三端同步上线
价格与方案
ChatGPT Plus ($20/月) 可用,API 定价:$8-$30/百万 token,折合单张图 $0.006-$0.211(取决于分辨率和质量)。免费版用户有限次数试用。
总结与建议
GPT-Image-2 是 2026 年做中文内容最值得优先尝试的图像模型。它把文字渲染从行业通病变成了自己的长板,2.5 升级后速度、精确编辑与参考图一致性又进一步,公众号、小红书、电商物料等高频场景都能稳定出图。艺术风格化创作可以搭配 Midjourney v8、FLUX 2 等模型互补,文字密集和需要反复精修的活交给它最省心。
版本演进
- ChatGPT Images 2.5 发布 (2026-09-08):OpenAI 发布 ChatGPT Images 2.5(官方标注美西时间 9/8),覆盖所有付费层级的 ChatGPT、ChatGPT Work 与 Codex,桌面、移动、网页三端可用。相比 2.0:生成延迟最高降低 50%,细节更锐利、光照更自然、纹理更丰富;精确编辑只改动指定区域,多轮编辑一致性更强;使用参考照片时人物与物体特征保持度更高,支持透明背景等复杂版式。API 同步推出两个模型:GPT-Image-2.5 Flare(默认推荐,速度快、成本效益高)与 GPT-Image-2.5 Sunburst(面向高端视觉工作流)。ChatGPT Images 与 GPT-Image API 合计每周生成超 30 亿张图像。
- GPT-Image-2 发布 (2026-04-21):OpenAI 发布 GPT-Image-2(对外品牌 ChatGPT Images 2.0),替换 DALL·E 3 成为 ChatGPT 默认图像模型,API 同步开放,上线即覆盖 ChatGPT、Codex、API 三端。采用非扩散新架构,LM Arena ELO 1512 登顶,中文排版准确率 99%,支持 4096×4096 分辨率、单次 8 张,生成前会联网检索、分析上传文件、推理画面结构,定位从画面生成转向能理解上下文的设计助手。