GPT Image 2.5 局部重绘实测:ComfyUI 里像开挂

GPT Image 2.5的局部重绘效果被誉为"作弊",折射出闭源商业模型与开源方案之间仍存在明显质量差距。
一则Reddit讨论引发了AI图像社区对局部重绘工具现状的广泛探讨。用户发现GPT Image 2.5在保持画面一致性、理解语义上下文、自然融合修改区域等方面表现突出,体验远超以Flux Fill为代表的开源方案,戏称"像作弊"。讨论同时暴露出一个现实困境:这类闭源模型无法直接在ComfyUI等开源工作流中使用,社区开发者正尝试通过自定义节点包加以桥接。对创作者而言,免费本地部署与商业订阅的效果差距,以及已付费用户的边际成本几乎为零,共同决定了当前的工具选择倾向。如何将ChatGPT订阅能力合规地接入本地节点,仍是待解的技术与合规问题。
在 AI 图像生成社区里,一条来自 Reddit 的讨论引发了不少关注:有创作者直言,用 GPT Image 2.5 做局部重绘(Inpainting)"感觉像在作弊"。这句略带调侃的评价背后,是新一代编辑模型在图像修改任务上的表现,正在拉开与传统开源方案的差距。
局部重绘为何让人惊艳
局部重绘的核心逻辑并不复杂——只修改用户选定的区域,其余部分保持不变。这正是原帖讨论中一位用户的疑问:"这不就是所有 inpainting 的工作方式吗?只改选中的区域?"
从技术定义上说确实如此。但真正的差异在于"改得好不好"。GPT Image 2.5 之所以被形容为"作弊",是因为它在保持画面一致性、理解上下文语义、以及自然融合修改区域这几个维度上,表现明显优于许多现有工具。发帖者强调,这种质量差距是他愿意为此付费订阅的关键原因。

局部重绘(Inpainting)技术的发展经历了几个关键阶段。早期基于扩散模型的 inpainting(如 Stable Diffusion 的 inpaint 模式)依赖于将蒙版区域填充为噪声后重新去噪,容易出现边缘接缝、光影不一致、以及语义跳跃等问题——例如在一张室内照片中把一把椅子替换成沙发,结果沙发的透视与光源方向和周围环境明显对不上。后来出现的专项训练方案(如 Adobe Firefly 的生成式填充、DALL·E 的编辑模式)通过大规模有监督数据专门优化了边缘融合与上下文感知能力。GPT Image 2.5 所属的新一代模型进一步将语言理解与图像编辑深度耦合,使得模型不只是"填满像素",而是能理解"这个区域在整张图里语义上应该是什么",从而实现更自然的过渡与更合理的内容生成。
ComfyUI 生态的缺口
讨论中一个有意思的技术点是:这类闭源模型目前很难直接在 ComfyUI 中使用。
"在 comfy 里没有真正可行的方法来做这件事,除非你自己写一个节点。"一位参与者指出。随后另一位开发者透露,自己正在制作一个节点包(node pack),将把这类功能整合进去。更进一步的思路是——不只是单个重绘节点,而是"用图像作为提示词"的一整套节点组合,从而把外部模型的编辑能力引入本地工作流。
这反映出当前 AI 绘图工具链的一个现实:闭源商业模型质量领先,但灵活性和可组合性不足;开源生态灵活可控,却在部分高级编辑任务上力有不逮。社区开发者正试图用自定义节点弥合这一鸿沟。
ComfyUI 是一款基于节点图(node graph)范式的开源 Stable Diffusion 前端工具,用户可以通过拖拽连接不同功能节点来搭建图像生成与编辑的完整流水线(workflow)。其核心优势在于高度可组合性——采样器、ControlNet、LoRA 加载、图像后处理等环节均可自由拼接,方便进行批量实验和自动化处理。节点包(node pack / custom nodes)是社区扩展 ComfyUI 功能的主要方式,开发者可以将外部 API 调用、新模型推理逻辑等封装为可视化节点,无需修改核心代码即可集成进现有工作流。正因为这种扩展机制,才有开发者考虑将 GPT Image 等闭源模型的 API 能力封装成节点,让商业模型的编辑质量与 ComfyUI 的工作流灵活性得以结合。
与开源方案的正面对比
讨论中免不了搬出开源阵营的代表——Flux Fill。
"你不熟悉 Flux Fill 吗?它免费、能在你自己的电脑上跑,做的是同样的事。"一位用户如此反驳。
但发帖者的回应颇具代表性:"你真的认真用过吗?为什么我要用一个基于 Flux Dev 的编辑模型,而不是 Flux 2 9B?"他坦言,这些开源编辑模型"没那么好,至少没有这些模型好",而 GPT Image 2.5 通过他本就在付费的 Plus 订阅即可使用,"既然已经付费了,不如物尽其用"。
这段交锋揭示了创作者选型时的真实权衡:免费本地部署 vs. 效果与便利性。对于已经订阅商业服务的用户来说,边际成本几乎为零,效果又更好,天平自然倾斜。
其他可选项
讨论中还有人提到 Seedream 5,认为它"也做得不错,值得一试",只是成本高低尚不明确。这说明市场上做高质量图像编辑的模型正在增多,用户有了更多横向比较的空间。
Flux Fill 是由 Black Forest Labs(Stable Diffusion 原核心团队创立)推出的开源图像编辑模型,专为 inpainting 和 outpainting 任务训练,基于其 Flux 架构系列。相比直接用基础生成模型做 inpainting,Flux Fill 在蒙版区域的语义连贯性上有所提升,且支持本地部署,对注重数据隐私或希望避免按次付费的用户有吸引力。帖子中发帖者提到的"Flux 2 9B"指的是更新一代的 Flux 基础模型,暗示其认为直接用更强的基础模型配合标准 inpainting 流程,效果反而可能优于基于旧版 Flux Dev 微调的 Flux Fill——这一判断折射出社区中关于"专用编辑模型 vs. 更强基础模型 + 通用方法"的持续争论。
订阅模型如何接入本地节点
讨论末尾抛出了一个技术悬念,也是许多读者最关心的问题:"你是怎么把 ChatGPT 的订阅接进 comfy 节点的?后端用的是什么机制?"
原帖并未给出明确答案,但这个问题本身指向了一个值得关注的趋势——如何将商业订阅账号的模型能力,桥接到开源工作流中。这通常涉及 API 调用、会话凭证复用等方式,其合规性与稳定性都需要开发者谨慎处理。
小结
这场讨论虽然篇幅不长,却折射出 AI 图像编辑领域的几组核心矛盾:闭源质量与开源自由、订阅成本与本地部署、单一节点与组合工作流。GPT Image 2.5 的"作弊感",本质上是模型能力代际提升带来的体验跃迁。而社区开发者围绕节点包的努力,则代表着把这种能力民主化、可组合化的持续尝试。对普通创作者而言,真正的建议或许是:不妨亲自把手头的方案都"认真用过",再决定哪个才是你的最优解。
相关推荐

Claude Code 入门指南:AI 编程助手的能力与安装要点
Claude Code 是 Anthropic 推出的 AI 编程助手,能通读项目上下文、自动生成代码并调错。本文对比 Cursor、TRAE、Codex 等工具,解析其准确度优势,并梳理安装前必须了解的系统要求与网络要点。

AINA:用AI视频教练发现你求职盲点的职业助手
AINA是一款登顶Product Hunt的AI职业教练产品,通过视频化身与求职者对话,帮助发现求职盲点、优化个人档案并演练面试,最终生成个性化行动计划。本文解析其核心功能与市场定位。

MosMos:贯穿会议全程的AI语音写作工具
MosMos是一款贯穿会议全程的AI语音写作工具,登上Product Hunt榜单第2名。它超越普通语音听写,支持自然口述转成文、个人术语词库、联网搜索,并在多人会议中实现说话人区分、结构化笔记与行动项提取。