OpenAI发布ChatGPT Images 2.5:双模型分工,编辑更精准,生成速度最高提升 50%
OpenAI推出ChatGPT Images 2.5,包含GPT-Image-2.5 Flare和Sunburst两个模型,主打精准图像编辑和更快生成速度。新增Sketch绘图、模板和提示词分享功能。目前ChatGPT用户使用哪个模型尚不明确,编辑测试显示Chat模式可能默认使用较弱模型。
AI解读:OpenAI这次把图像生成拆成了两个模型:Flare负责快,生成延迟比Images 2.0最高降低 50%;Sunburst负责精,专门处理复杂的多轮编辑,让图片只改你要求的部分,其他细节保持不变。开发者可以在API里明确选择,但ChatGPT用户目前没有开关。
对我们普通用户来说,最直接的疑问是:自己在ChatGPT里到底用的是哪个模型?OpenAI没在公告或文档里说明。The Decoder的测试给出了一些线索:在Work模式(配合GPT-6 Astra Max)下编辑很听话,只改你指定的内容;但在普通Chat模式里,改一个香蕉颜色,图片其他细节也跟着变,只有切到“6 Pro”设置时,较强的Sunburst模型才偶尔出现。所以,想要体验精准编辑,可能得先用上Work或更高档位。
这次还带来一个实用功能“Sketch”,你可以在ChatGPT里直接画草图,然后用它做模板生成海报、房间布局或示意图,不用从空白开始。另外,模板和可分享的提示词降低了上手门槛,让普通人也能复制别人的创意。
价格方面要留意:虽然两个模型每百万token的费率相同(输入 8 美元、输出 30 美元),但实际单张图片成本可能差很多。新增的“max”质量档生成一张 1024x1024图片约耗 7024 个输出token,成本约 0.21 美元,与上一代的高档相当;而且目前没有更便宜的批处理折扣。如果你是API重度用户,建议先按自己的用量跑一批测试,算清楚再切换。
OpenAI正式发布ChatGPT Images 2.5,推出两个新图像模型:GPT-Image-2.5 Flare和GPT-Image-2.5 Sunburst。据OpenAI介绍,Flare相比Images 2.0可将图像生成延迟降低最多 50%,而Sunburst则面向更复杂的视觉任务,提供更精准的编辑控制,但生成时间更长。两个模型现已面向全球所有ChatGPT、ChatGPT Work和Codex用户在桌面、移动端和网页端开放,包括免费版。
双模型分工与API定价
面向开发者,OpenAI将两个模型都引入了API。GPT-Image-2.5 Flare是大多数用途的默认选择,图像质量高于GPT-Image-2,延迟降低 50%。更强的GPT-Image-2.5 Sunburst则针对要求更高的视觉工作,提供更严格的编辑控制,需要更长的生成时间。
两个模型采用相同的token费率:每百万输入token 8美元,每百万输出token 30美元。但由于不同模型和质量档位的token消耗不同,相同费率并不意味着每张图片的成本相同。Images 2.5新增了“xhigh”和“max”两个质量档位,高于此前的“high”上限。一张 1024x1024图片在“low”档成本约 0.006 美元,与上一代持平;“high”档约 0.053 美元;新的“max”档约 0.21 美元,消耗约 7024 个输出token。Images 2.5的“max”档价格与GPT-Image-2的“high”档相当。与上一代不同,Images 2.5目前没有更便宜的批处理费率。
早期测试中,尽管token价格相同,Sunburst的单张图片成本通常高于Flare,原因可能是其推理过程更长。此外,OpenAI未提供Images 2.5的平均单图价格,也未说明ChatGPT如何在两个模型之间路由用户。公告和文档均未提及ChatGPT何时调用Flare或Sunburst。API用户可以明确选择模型,但ChatGPT界面目前没有这样的控制选项。
编辑能力实测:Chat与Work表现有别
新模型的改进重点在于编辑。OpenAI表示,新模型旨在只更改被要求的元素,而保持图像其余部分不变,即使面对更复杂的主题和背景也是如此。在较长的对话中,之前的修改应保持一致性,多次编辑后图像质量不下降。OpenAI以房间改造为例展示了这一能力:旧模型在每次编辑时都会改变其他细节,而新模型在多次迭代中保持稳定。
The Decoder通过ChatGPT Work中的GPT-6 Astra (Max) 进行了快速测试,使用了一个包含猴子、老虎、宇航员等元素的复杂提示词,并逐步调整一个小细节(香蕉颜色)和一个大细节(大猫)。结果显示,在Work模式下,无论推理设置如何,提示词只会改变被要求的内容,编辑效果符合预期。而在Chat模式下,即使是高推理设置,后续图像中仍有更多细节发生偏移。只有在“6 Pro”设置下,较强的模型才偶尔生效。测试中还发现,编辑测试中模型能够按指令修正刻意植入的错误(如将标题中的“2.5”误写为“2.0”),并在简单请求“生成美国英语版本”时保持其他内容不变。对比实验显示,普通Chat模式在翻译过程中也会改变其他细节。
The Decoder指出,随着本周持续推出,实际表现可能有所变化。
新增Sketch、模板与提示词分享功能
在ChatGPT中,OpenAI还推出了一系列新功能。其中最重要的是“Sketch”,允许用户直接在ChatGPT中绘图,并将草图作为生成图像的视觉模板。用户可通过“@Sketch”命令激活,OpenAI称其适用于图表、房间布局或海报等场景。
“模板”是预制提示词,旨在帮助用户轻松上手海报、标志、信息图、缩略图、插图或广告等格式。它们提供结构而非空白画布,并通过针对性后续问题明确需求。用户还可以直接在图像上添加评论,并分享所用提示词,方便他人尝试。OpenAI举例提到一个当前流行的 1980 年代风格肖像生成提示词。
Arena排行榜与来源标记
在Arena的文本转图像排行榜上,新模型暂列前两位。GPT-Image-2.5 Sunburst以 1421 分领先,紧随其后的是GPT-Image-2.5 Flare(1399 分),但两者均标注为“初步”结果,票数较低(分别约 3100 和 2900 票)。第三名是前代GPT-Image-2(1381 分,约 78700 票)。后续排名包括微软的mai-image-2.6(1331 分)、SpaceXAI的grok-imagine-image-2.0(1315 分)等。由于新模型评分尚属初步,其位置可能随票数增加而变化。
安全与可用性
在来源标记方面,OpenAI继续采用C2PA行业标准嵌入元数据,并通过Google DeepMind的SynthID添加不可见水印,应用于ChatGPT、Codex和API。OpenAI表示,来源标记不存在单一解决方案,因此采取分层方法。
Images 2.5现已面向全球所有ChatGPT、ChatGPT Work和Codex用户开放,包括免费版。OpenAI称,等待时间更短,使用限制更高。The Decoder的测试表明,Chat模式目前使用较弱模型。