Command Palette
Search for a command to run...
Mi-Ripple:恢复被迭代 AI 编辑降质的图像
Mi-Ripple:恢复被迭代 AI 编辑降质的图像
Jiayin Chen Yicheng Xu Muting Wang
摘要
迭代式参考条件图像编辑可能引入网格状和颗粒状纹理,通常被称为数字波纹。我们提出 Mi-Ripple,一种以诊断为指导的恢复工作流,旨在抑制此类数字波纹,同时保护图像结构。Mi-Ripple 将周期性晶格伪影与内容纠缠的颗粒纹理分离,然后结合选择性频谱陷波、结构感知平滑和清理后的参考图像再生。这种分离使得当伪影在频谱上被隔离时能够进行低失真滤波,而当滤波会抹除合理细节时则进行视觉重建。在十四次仅使用陷波的执行中,整幅图像的残差标准差在 CIELAB 明度单位下为 0.08 至 0.44。在一个成对再生示例中,参考图像清理将输出图像的碎片密度降低了 45%。Mi-Ripple 将可量化的伪影减少与视觉上更清晰的生成图像联系起来,而非仅仅优化频谱分数。
一句话总结
米羊科技、中国科学院和上海交通大学的研究者提出 Mi-Ripple,一种诊断引导的修复工作流,通过将周期性晶格伪影与内容纠缠的颗粒纹理分离,并应用选择性频谱陷波、结构感知平滑和清洁参考再生,抑制迭代 AI 编辑产生的数字波纹伪影。在十四次仅陷波执行中,全图残差标准差在 CIELAB 明度单位下为 0.08–0.44,并在一个配对再生示例中将输出碎片密度降低 45%,将可测量的伪影减少与视觉上更干净的图像联系起来。
核心贡献
- 诊断引导的修复工作流在迭代参考条件图像编辑中,将周期性晶格伪影与内容纠缠的颗粒纹理分离,从而能够针对伪影类型做出特定的处理决策。
- 该工作流结合了针对孤立峰的选择性频谱陷波、结构感知平滑以及清洁参考再生,以抑制数字波纹,同时保护合法的图像结构。
- 在十四次仅陷波执行中,全图残差标准差在 CIELAB 明度下为 0.08–0.44,一个配对再生示例将输出碎片密度降低 45%,将可测量的伪影减少与视觉上更干净的图像联系起来。
引言
迭代参考条件图像编辑会传播结构化伪影,如网格、蜂窝图案和颗粒表面,这些在原生分辨率下变得可见,作者将这种现象称为数字波纹。以往的工作主要集中于检测合成图像或在架构层面解释伪影形成,而非在递归编辑管道中进行修复,这留下了频谱污染能否在不损害合法细节的情况下被去除,或者是否与场景内容纠缠的问题。作者引入了一种诊断驱动的修复工作流,该工作流将晶格伪影(孤立频谱峰)与内容纠缠的颗粒纹理区分开来,对前者应用带有失真验证的选择性陷波滤波,对后者采用清洁参考再生,从而恢复干净表面,同时保留真实纹理。
数据集
作者通过使用两个商业编辑渠道构建了一个自定义图像编辑数据集,无法访问模型内部。这些数据仅用于实验分析,不用于模型训练。
-
来源与访问条件
- 渠道 A:一个桌面集成,宣传为“OpenAI Image 2”。
- 渠道 B:一个 OpenAI 兼容网关,公开了名为
gpt-image-2和gpt-image-2.5的路由。 - 两个渠道均被视为采样接入点,而非独立模型或供应商排名。
-
数据集组成与子集
- 同场景链(渠道 B):5 条链,每条包含一个初始输出(gen0)和四次编辑(gen1–gen4)。提示词保持不变,前一次输出作为输入重用。
- 场景变更链(渠道 A):2 条链,每条包含 gen0 和四次编辑,场景在编辑间变化。
- 提示词比较:2 个植被丰富的场景,用于比较不同提示词下的编辑行为。
- 路由比较:8 个场景通过
gpt-image-2和gpt-image-2.5路由进行编辑。 - 辅助材料:4 张照片,5 个网页参考,15 张用于频谱调查的生成图像,4 次固定条件重复,以及 6 张用于管道案例系列的水彩肖像原图。
- 外部证据(Banana100
more_models子集):1 张起始照片和 110 个来自 7 个模型家族的编辑输出,组织成 11 个十步序列,包含不同聊天和相同聊天变体。
-
数据使用方式
- 链是核心实验单元:同场景链探测重复编辑下的一致性,场景变更链测试对新提示词的适应性,路由比较突出 API 端点之间的差异。
- 提示词比较和频谱调查研究输出的风格和结构属性。
- Banana100 子集为跨模型分析提供外部证据。
- 不适用训练分割或混合比例;所有数据服务于编辑行为的定性和定量评估。
-
处理与元数据
- 未提及显式裁剪策略。输出按生成原样使用,gen0 标记初始图像,gen1–gen4 为顺序编辑。
- 元数据包括生成索引、链类型(同场景/场景变更)、来源渠道/路由和提示条件。
方法
作者提出一个诊断引导的修复工作流,包含三个顺序阶段:诊断伪影、从清洁参考滤波或再生,以及验证生成的候选结果。该管道区分了可交付级滤波(保持像素对齐)和参考级清洁(为再生准备输入)。这种分离允许更强的参考准备,而不将其作为最终图像呈现。
在第一阶段,互补的频谱和空间探测确定适当的修复路线。所有明度测量均使用 CIELAB L* 尺度,范围 0 到 100。对于明度块 P 和汉宁窗 w,作者定义频谱幅度为:
S=log(1+F[(P−Pˉ)w]),A(u,v)=S(u,v)−B(r)其中 B(r) 是半径 r 处的中值对数幅度。基线调查使用每张图像 384 像素平坦块的中值峰。高通明度的自相关提供单独的周期估计。
为区分伪影类型,全图晶格探测使用 21×21 局部中值的对数幅度谱。它保留超出 1.2、半径 24 以外且支撑不超过 80 个频率仓的连接分量。诊断要求至少保留两个分量且最大超出至少 2.5。平坦窗口探测测试 96 像素窗口的带通强度、超峰度、斑点覆盖率和各向同性,而互补的全帧尺度指数报告合格 128 像素瓦片的百分比。标称的 3 到 8 像素带隔离诊断纹理但施加了尺寸偏好,因此周期性单独检查,不使用该带通。颗粒区域在不相干的位移处表现出弱的自相关最大值,而晶格产生可重复的周期向量。方向性渲染变化与这两种形式分开处理。这些不同伪影表现的视觉示例如下所示。
在第二阶段,管道要么对图像进行滤波,要么从清洁参考再生。对于晶格伪影,孤立峰陷波使用诊断探测的分量选择标准。令 K 指示保留分量,E 为其超出局部基线的正超出量。使用高斯羽化 G1.5,滤波后的频谱为:
F=Fexp[−G1.5(KE)]此操作保留相位,通常仅修改明度,使用反射填充减少边界效应。紧凑峰选择避免了与方向性图像内容相关的扩展频谱脊。对于缺乏孤立峰进行陷波的颗粒纹理,基于边缘强度、方向一致性和纹理密度的严格掩模允许局部带缩减,同时保护结构。当伪影与合法植被或材质纹理重叠时,管道请求人工审核,而不是增加滤波强度。当内容重建可接受时,参考级清洁允许在再生前进行更广泛的抑制,并具有明确的面部保护。再生输出再次诊断,新引入的孤立晶格峰可被陷波。
最后阶段验证失真并记录决策。接受基于图像差异,而非滤波器优化的异常分数。结构窗口的残差标准差必须不超过 0.6 明度单位,高频保留至少 90%。保留是输出与输入 SD(L−G1L) 的比率,其中 G1 是标准差为 1 像素的高斯平滑。平坦窗口带通标准差不得增加超过 0.02,全图残差标准差不得超过 1.0。这些经验检查测量滤波损伤,人工审核决定是否采纳候选结果。基于规则的路径选择作为默认实现,可选的语言模型层在允许的操作中进行选择,而不改变数值阈值。执行记录保留观察、允许的操作、决策和验证结果。再生需要明确许可和有限的重试次数。
实验
评估设置使用原生分辨率周期性测量、跨分辨率 Lanczos 下采样和归一化多场景链来评估伪影特征和修复路线。修复实验表明,选择性频率陷波和参考清洁可以减少可见颗粒和晶格伪影,但合适的路线取决于伪影是否与图像内容可分离;密集、纠缠的区域需要掩蔽抑制或再生。特征描述揭示晶格特征强烈依赖于配置,无法从供应商标签预测,而颗粒纹理与场景内容和重复相关,基于提示的纹理约束未能提供一致的控制。
生成图像与摄影对照相比表现出升高的频谱异常,颗粒尺度纹理可在同场景迭代中累积。有针对性的再生和陷波处理减少结构化纹理,而肖像修复以高保留度保持身份相关的发丝结构。生成源对照显示中位频谱异常为 4.13–4.61,显著高于摄影对照中观察到的 1.73。同场景苔藓链将颗粒覆盖率从 0.9% 增加到 23.7%,而面部链的合格尺度瓦片保持为 0.0%。
实验将生成图像与摄影对照进行比较,揭示生成输出表现出更高的频谱异常,并在同场景迭代中累积颗粒纹理。有针对性的再生和陷波处理有效减少结构化纹理,而肖像修复以高保真度保持身份相关的发丝结构。这些发现突显了生成图像中频谱伪影的存在,并表明迭代同场景生成会放大颗粒覆盖率,尽管干预措施可以减轻这些影响。