INPO:基于再参数DDIM的扩散模型高效配准的反演偏好优化)
论文题目InPO: Inversion Preference Optimization with Reparametrized DDIM for Efficient Diffusion Model AlignmentINPO基于再参数ddim的扩散模型高效配准的反演偏好优化会议CVPR2025摘要直接偏好优化(DPO)在不使用显式奖励的情况下使用成对的人类偏好数据来微调生成模型这一方法在大型语言模型(LLM)中得到了相当大的关注。然而使文本到图像(T2I)扩散模型与人类偏好保持一致的探索仍然有限。与有监督的精调相比现有的对准扩散模型的方法存在训练效率低和生成质量不佳的问题这是由于马尔可夫链过程长和逆过程的难解性造成的。为了解决这些局限性我们引入了一种有效的扩散模型直接偏好对齐方法--DDIM-INPO。我们的方法将扩散模型概念化为一步生成模型允许我们有选择地微调特定潜在变量的输出。为了实现这一目标我们首先通过重新参数化技术将隐含报酬直接分配给任何潜在变量。然后我们构造了一种反演技术来估计适当的潜在变量以进行偏好优化。这一修改过程使扩散模型能够仅微调与偏好数据集具有很强相关性的潜在变量的输出。实验结果表明我们的ddim-INPO只需400步的微调就能获得最先进的性能超过了人类偏好评估任务中T2I扩散模型的所有偏好对齐基线。DDIM-InPO让扩散模型对齐人类偏好快 18 倍的新方法一、背景为什么需要让扩散模型对齐人类偏好近年来以 Stable Diffusion、SDXL 为代表的文本生成图像T2I扩散模型在图像质量上取得了显著进展。然而这些模型通常在海量噪声数据上进行预训练生成的图像往往与真实用户的审美偏好存在差距——可能在构图、光线、风格或文字一致性上不尽如人意。大语言模型LLM领域早已形成了一套成熟的对齐范式先在大规模数据上预训练再用少量人类偏好数据进行对齐微调RLHF / DPO。然而将这套方法迁移到扩散模型并非易事现有方法普遍存在训练效率低、生成质量差的问题。二、现有方法的三大痛点1. 奖励泄漏与显存爆炸DRaFT、AlignProp 等方法通过训练一个奖励模型然后将奖励梯度反向传播过整条采样链来更新扩散模型。这种做法需要在所有去噪步上保留计算图显存开销极大并且容易产生奖励泄漏reward leakage——模型会过度优化奖励函数而非真正对齐人类偏好。2. 稀疏奖励导致训练极慢DPOK、DDPO 将扩散模型的去噪过程建模为马尔可夫决策过程MDP用策略梯度方法进行优化。但由于一张图片需要经历数十甚至数百个去噪步才能生成有效的奖励反馈只能在完整轨迹末端获得导致严重的稀疏奖励问题训练极不稳定且效率低下。3. DPO 方法的决策空间过大Diffusion-DPO、D3PO 将 LLM 中的 DPO 思想引入扩散模型通过在所有去噪步上展开奖励来构造训练目标。然而这本质上仍然是将奖励分配到整条马尔可夫链上稀疏奖励问题依然存在在分布外输入上的泛化能力有限训练效率也较低。三、DDIM-InPO 的核心思路本文的出发点是一个简洁的洞察能否把扩散模型当作单步生成模型来处理直接优化与目标图像强相关的少数潜变量而非展开整条马尔可夫链基于这一思路作者提出了DDIM-InPO其核心由两个技术模块组成。四、技术方法详解4.1 重参数化 DDIM把任意时间步的潜变量与图像直接挂钩【论文 Figure 2Inversion for Preference Optimization 示意图】传统 Diffusion-DPO 在噪声图像空间中操作需要将奖励分摊到所有去噪步导致决策空间庞大。DDIM-InPO 的关键在于引入了一个初始变量其中。的含义是在时间步 t 对噪声图像做单步去噪后得到的近似干净图像它处于空间中且满足。这一重参数化的好处在于联合分布变得良定义可以在任意时间步 t 直接为分配隐式奖励无需展开完整的去噪轨迹。在此基础上作者将原始 RLHF 目标改写为关于联合分布的优化问题并类比 DPO 推导过程得到了扩散模型的新优化目标Eq. 11。4.2 基于 Inversion 的偏好优化找到合适的潜变量有了新的优化目标下一个问题是给定偏好数据集中的图像如何找到对应的使得能在单步内生成的近似这等价于求解一个非线性方程组Eq. 12而 DDIM Inversion 正好提供了一种有效的估计手段。具体来说先在空间利用 DDIM InversionEq. 15从出发迭代估计再根据 Eq. 16 计算其中由 Inversion 步骤给出。这样得到的与高度相关保证了优化目标Eq. 11的有效性。4.3 最终损失函数简洁而高效经过 Jensen 不等式近似与化简最终的 DDIM-InPO 损失Eq. 18形式如下其中是由 Inversion 得到的目标噪声w(t) 为与 Diffusion-DPO 一致的权重函数。与 Diffusion-DPO 的联系Diffusion-DPO 实际上是 DDIM-InPO 的一个特例——当被近似为独立同分布的随机噪声时DDIM-InPO 退化为 Diffusion-DPO。也就是说Diffusion-DPO 使用的是一个粗糙的估计而 DDIM-InPO 通过 Inversion 获得了更精准的估计因此性能更优。五、实验设置数据集Pick-a-Pic v2包含 851,293 对偏好图像和 58,960 个独特提示词排除约 12% 无法判断偏好的样本。基础模型Stable Diffusion 1.5SD1.5和 Stable Diffusion XL-base-1.0SDXL。基线方法Base model、SFT监督微调、Diffusion-DPO、Diffusion-KTO仅用于 SD1.5。评估指标自动评估LAION 美学分类器Aesthetic、CLIP 文本-图像对齐分数、PickScore、HPSv2测试集为 Parti-Prompts1632 条和 HPDv23200 条。人工评估16 名参与者回答三个问题(1) 整体偏好(2) 视觉吸引力(3) 文字对齐程度。训练效率H800 GPU 小时数。训练配置8 张 NVIDIA H800 GPU每卡 batch size 为 1 对图像梯度累积 128 步等效 batch size 为 1024 对Diffusion-DPO 的一半。SD1.5 使用 AdamW 优化器SDXL 使用 Adafactor。六、实验结果6.1 量化结果全面超越基线【论文 Table 1Win-rate comparison between DDIM-InPO and baselines】在 HPDv2 和 Parti-Prompts 两个测试集上InPO 对齐的模型在几乎所有评估指标上均超越基线InPO-SDXL vs DPO-SDXLHPDv2HPSv2win-rate65.81%InPO-SDXL vs SFT-SDXLHPDv2HPSv2win-rate89.91%InPO-SDXL vs Base-SDXLHPDv2HPSv2win-rate85.38%InPO-SD1.5 vs KTO-SD1.5HPDv2HPSv2win-rate60.94%InPO-SD1.5 vs Base-SD1.5HPDv2HPSv2win-rate90.22%6.2 训练效率大幅领先【论文 Figure 4训练效率与生成质量的权衡对比气泡图】在 SD1.5 上的 HPDv2 测试集结果表明仅需400 步微调即可达到 state-of-the-art训练速度比 Diffusion-KTO 快18.4 倍训练速度比 Diffusion-DPO 快3.6 倍在使用更少训练数据的情况下生成质量仍高于两者。6.3 人工评估结果【论文 Figure 3 上半部分用户研究柱状图】16 名人工评估者的结果如下InPO-SDXL vs DPO-SDXL vs Base-SDXL评估维度InPO-SDXLDPO-SDXLBase-SDXLQ1 整体偏好60%23%18%Q2 视觉吸引力73%17%10%Q3 文字对齐61%23%16%InPO-SDXL 在三项指标上均大幅领先。6.4 消融实验【论文 Table 2Ablation studies】作者在 SD1.5 上进行了详细消融主要发现包括DDIM Inversion 是核心加入 Inversion 后四项指标相较于 Base initialized 基准均有显著提升。Inversion 步数步数越多n30性能越好但训练时间增加需 136 GPU 小时n10 在质量Aesthetic 5.7734PickScore 21.894HPSv2 28.523CLIP 36.876与效率57.6 GPU 小时之间取得最佳平衡。β 参数β 设置过高会导致 KL 散度惩罚项过强限制模型调整灵活性SD1.5 选用 β2000 最优。Inversion 时的 CFGInversion 过程中使用会引入数值误差影响偏好微调效果因此采用无条件 DDIM Inversion。6.5 定性结果【论文 Figure 3 下半部分InPO-SDXL vs DPO-SDXL vs Base-SDXL 定性对比】【论文 Figure 5DDIM-InPO 的六项优势对比图】InPO-SDXL 生成的图像相比基线展现出多方面优势增强的光线与空间结构更真实的细节捕捉更具想象力的创意设计稳定的色彩一致性优化的多实例布局图像中文字的准确集成七、扩展实验7.1 AI 偏好优化【论文 Figure 6PickScore 和 HPSv2 中位数对比柱状图】由于人工标注成本高昂作者还探索了用 AI 评估器PickScore 和 HPSv2重新标注 Pick-a-Pic v2 数据集并用重标注数据微调 SD1.5。结果显示 PickScore 和 HPSv2 两项指标相较于人工标注版本进一步提升验证了 AI 反馈驱动对齐的可行性。7.2 条件生成【论文 Figure 7InPO-SDXL 在 depth map / canny edge / inpainting 任务上的对比】将 InPO-SDXL 与基于 Base-SDXL 训练的 ControlNet 结合无需任何额外训练即可直接用于条件生成任务深度图控制、Canny 边缘控制、图像修复。结果表明InPO 学到的偏好对齐能力可以无缝迁移到条件生成场景生成质量显著优于 Base-SDXL 和 DPO-SDXL。八、总结与局限性DDIM-InPO 通过以下两个关键创新系统性地解决了扩散模型偏好对齐中的训练效率与稀疏奖励问题重参数化 DDIM将扩散模型视为单步生成模型使隐式奖励可以在任意时间步直接分配基于 Inversion 的潜变量估计精准定位与偏好数据高度相关的潜变量集中优化资源。最终效果仅需400 步微调训练速度提升最高18.4 倍在所有主流评估指标上超越现有基线。局限性方法基于离线微调对数据集质量敏感若训练数据中含有有害、暴力或色情内容可能导致不当输出。在线训练范式online RLHF被作者认为是未来更可靠的方向。