
就在刚刚,OpenAI 发布新一代图像生成模型 ChatGPT Images 2.5。
官方表示,新模型重点提升了图片细节质量、生成速度、编辑精度以及多轮修改过程中的一致性,并新增 Sketch 手绘参考、创作模板、图片评论编辑等功能,让用户能够更接近专业设计流程完成 AI 创作。

OpenAI 称,目前用户每周通过 ChatGPT Images 和 API 中的 GPT Image 系列模型生成超过 30 亿张图片。
Images 2.5 的推出,意味着 OpenAI 希望进一步扩大 AI 图像工具在个人创作、营销设计、产品视觉等场景中的使用范围。

相比上一代 Images 2.0,Images 2.5 最大变化在于对「修改」的理解能力提升。

过去,AI 绘图通常更擅长从零生成一张图片,但当用户要求调整某个细节时,模型容易误改其他部分。例如修改人物服装时,可能改变脸部特征;调整背景时,可能导致整体风格发生变化。
OpenAI 表示,Images 2.5 在精准编辑方面进行了优化,能够更准确执行用户指定的修改,同时保留原有主体、构图和视觉风格。用户可以针对产品、背景、文字等单个元素进行调整,而无需重新生成整张图片。真就·指哪打哪。

OpenAI 展示的案例中,一张人物照片可以被转换成不同场景和风格,例如将普通人物头像改造成复古摄影棚写真,或者将宠物照片转换成新的视觉主题,同时保持原始人物和动物的关键特征。
我也实际尝试了 Images 2.5 多个不同类型的生成任务。
比如在人像生成测试中,我尝试要求模型保持参考人物面部特征,生成一张高清摄影创意作品。

实际效果显示,Images 2.5 对参考人物特征的保留能力有所提升。模型能够在改变摄影风格、服装和环境的同时,让人物身份保持较高一致性。
而且现在,Images 2.5 也终于能够通过数字直观显示图片生成进度了。

根据网友的测试,甚至还能在生成图像期间玩贪吃蛇。
类似能力也体现在影视角色合成场景中。例如,我测试了马斯克「与教父在片场自拍」的场景,要求模型保留参考照片人物的脸部结构、表情、姿态,并生成一张 1:1 比例的电影幕后自拍。

这一类任务过去容易出现人物脸部变化、比例错误等问题,而 Images 2.5 对人物主体的保持更加稳定。
在街头摄影风格下,马斯克的「人生照片」也是有了。

除了人物,Images 2.5 对产品视觉设计的理解也有所增强。在一个商品设计测试中,我要求模型生成一只完全由柔软毛绒材质构成的可乐罐。

在复杂视觉逻辑测试中,我尝试生成一个递归画面。
提示词要求「一只橘猫坐在办公室椅子上拿着 iPad,iPad 屏幕中又显示同一只猫拿着同一个 iPad,并不断循环」。

这种递归结构需要模型同时理解主体、屏幕内容以及重复关系。生成结果能够识别这种视觉嵌套关系,完成多层递归效果。
除了写实图片,Images 2.5 对复杂艺术风格的理解也有所提升。

在这幅黑神话风格的画面中,Images 2.5 的整体风格更接近游戏概念原画,而不是简单堆叠符号。

还有《三国演义》连环画风格插画。
生成结果能够理解黑白线描、淡彩上色、老式纸张质感等传统连环画特征,整体视觉更接近中国经典插画风格,而不是简单添加古装元素。

和前代一样,Images 2.5 在中文这块表现亮眼。

整体来看,Images 2.5 的提升主要体现在三个方面。
一是对复杂提示词的理解能力增强,能够同时处理多个风格、主体和限制条件。二是参考图保持能力提升,人物、产品等核心元素在多次修改过程中更加稳定。三是编辑流程更加接近真实设计工作,用户可以围绕同一张图片持续调整,而不是反复生成新的结果。
从网友 @aimlapi 的实测效果来看, 对 Nano Banana Pro 来说,Images 2.5 的效果明显更有艺术风格。

不过 Images 2.5 也不是没有缺点,比如噪点这一块依旧可以说是灾难级别的。

再比如也有网友发现,OpenAI 官方展示案例中仍存在一些细节瑕疵。

除了模型能力提升,OpenAI 也为 ChatGPT 增加了一系列围绕创作流程的新功能。
其中,Sketch 功能允许用户直接在 ChatGPT 中绘制草图,并将其作为生成图片的视觉参考。用户可以简单画出房间布局、服装轮廓或创意草稿,再让 AI 根据描述生成完整图片。
比如,我随手一画,就能生成笔记本和钢笔。

Sketch 通过手绘直观表达画面布局和创作意图,解决了用户难以用文字准确描述空间关系、反复调整提示词的问题。

看来接下来互联网将涌现出一大批「灵魂画师」了。

除了静态图片,Sketch 也可以用于 GIF 等动态内容创作。

OpenAI 还推出了模板功能,帮助用户从常见设计场景开始创作,例如海报、商品图片等。用户无需从空白提示词开始,可以选择模板后进一步补充文字、风格和设计要求。

此外,用户现在可以直接在图片上添加评论,指定需要修改的位置,也可以分享生成图片时使用的提示词,让其他用户基于同一创意生成自己的版本。
面向开发者,OpenAI 同步推出两个 API 图像模型。
其中,GPT Image 2.5 Flare 是面向大多数应用场景的默认模型,在质量、编辑能力和速度方面进行了升级。
OpenAI 表示,相比 GPT Image 2,该模型能够提供更高质量的图片,同时将延迟降低 50%,适用于社交内容、电商视觉、视觉搜索和大规模图片生成等场景。

另一款 GPT Image 2.5 Sunburst 则面向更高要求的创意工作流程,强调更精细的控制能力,适用于广告素材制作、高端产品图片设计等场景。
目前,ChatGPT Images 2.5 已向 ChatGPT、ChatGPT Work 和 Codex 用户开放,覆盖桌面端、移动端和网页端。API 用户则可以调用 GPT Image 2.5 Flare 与 GPT Image 2.5 Sunburst。
ChatGPT Images 2.5 的意义,并不只是一次图像模型升级。一个能够理解视觉内容、保持上下文一致,并根据反馈持续调整的图像模型,也将会成为 AI 理解世界的重要组成部分。
感兴趣的朋友快去体验一下吧。
#欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。