× 南航 × OPPO:DPPMG——个性化多模态生成框架)
这篇 SIGIR 2026 的工作试图解决一个很有意思的问题推荐模型学到的是连续的用户偏好而 LLM / Diffusion 接收的是离散 Token那么能不能把“用户喜欢什么”直接变成 Token喂给生成模型传统个性化生成的问题传统方法不能准确学习用户偏好用户偏好本身是多模态的但生成结果容易出现图片/文本不一致。前言DPPMG干的事验证/解决一个问题如何把“用户偏好”真正传给生成模型并且同时生成个性化、跨模态一致的内容传统个性化生成主要有两个问题①传统方法不能准确学习用户偏好② 用户偏好本身是多模态的但生成结果容易出现图片/文本不一致。所以DPPMG用推荐模型学习用户偏好 → 用 RQ-VAE 离散化成 Preference Tokens → 注入 LLM / Diffusion → 用 Personalized Cross-modal Reward 优化。DPPMG概述。阶段1通过边缘级面向偏好和节点级跨模态对齐任务学习特定于模态的偏好令牌。阶段2将令牌注入下游模型通过跨模态个性化一致性奖励进行优化。文本协作令牌学习遵循与图像分支相同的逻辑。为了简洁起见仅显示令牌ID省略生成器指令。创新1Modal-specific Preference Token Learning模态特定的离散用户偏好 Token核心思想不要直接把用户的连续 embedding 塞给 LLM / Diffusion。而是先用推荐模型学习用户偏好 → 再用 RQ-VAE 把连续偏好离散化 → 得到 Preference Tokens → 再交给生成模型。好处解决了一个非常关键的Continuous Preference → Discrete Token的鸿沟。让推荐模型学到的用户偏好embedding变成生成模型可以使用的Preference Token ID同时保留协同过滤和跨模态信息。因为推荐模型通常得到user preference → zᵤ ∈ R^d也就是一个连续向量。但是生成模型天然处理的是token ID →embedding →LLM / Diffusion所以 DPPMG 做了一个非常关键的“接口”推荐模型 Continuous Preference ↓ RQ-VAE ↓ Discrete Preference Token ↓ 生成模型论文明确把 RQ-VAE 定义为解决 continuous-discrete mismatch 的组件。♀️做法① 分别建立 Text / Image 两套 Preference Model用户的交互本身就是多模态的。例如电影用户→电影A包括简介和海报所以论文没有简单把所有信息混成一个 embedding而是分别构建Text Interaction Graph Image Interaction Graph ↓ ↓ LightGCN LightGCN ↓ ↓ zᵗᵤ(用户的Text Preference) zᵛᵤ(用户的Visual Preference)同样物品也会得到zᵗᵢ、zᵛᵢ。论文中明确使用两个 modality-specific graph并分别通过 LightGCN 得到用户/物品表示。② 用 RQ-VAE 把连续 embedding 变成离散 Token例如 zᵤ ↓ RQ-VAE ↓ (c₁, c₂, c₃, c₄)(hierarchical discrete tokens)每一个C都不是普通embedding而是一个codebook中的离散索引。比如论文默认L4K96也就是用户→Token1、Token2、Token3、Token4每个Token从96个code中选择一个因此理论上的组合空间达到96⁴ 84934656而不是只有96种用户偏好。c₁到c₄一次比一次拥有更细的粒度后一层专门负责补前一层没有表达好的 residual。。论文后面的分析也验证了这个 hierarchical structure高层 Token 更多表达 broad attributes低层 Token 表达 fine-grained details。③ 再设计两个监督不只是“量化”还要保证 Token 真的是 Preference这里是 DPPMG 很重要的一点。如果只是LightGCN→RQ-VAE→Token那么RQ-VAE 只是在压缩 embedding。并不能保证这个Token真的是“用户喜欢什么”。所以作者额外设计了两个监督。a.Preference-oriented TaskBPR要求score(用户u,正样本i) score(用户u,负样本i)保证Token 不能只是“压缩得像”还必须保留用户-物品交互中的偏好信息。b.Cross-modal Alignment Task保证图片和文字对同一个 item 的语义是对应的。例如电影 i text representation 电影 i 的 text ↕ ↕ image representation 电影 i 的 image 正样本 负样本所以第一阶段最终干的事LightGCN负责从用户-物品交互中学习偏好RQ-VAE负责把连续偏好变成离散 TokenBPR保证 Token 保留协同过滤偏好Cross-modal Contrastive Learning 保证不同模态之间保持语义对应。最终得到用户 u ├── Pᵗᵤ (cᵗ,1, cᵗ,2, cᵗ,3, cᵗ,4)Text Preference Tokens └── Pᵛᵤ (cᵛ,1, cᵛ,2, cᵛ,3, cᵛ,4)Visual Preference Tokens 物品 i ├── PᵗᵢText Semantic Tokens └── PᵛᵢVisual Semantic Tokens创新2Preference Token → Generator把“用户偏好”变成生成模型能够使用的条件第一阶段解决怎么学到用户偏好第二阶段解决学到之后怎么真正让生成模型利用它这也是 DPPMG 非常关键的一步。好处让已经训练好的LLaMA3和 Stable Diffusion能够直接利用用户 Preference而且不需要重新训练整个大模型。♀️做法①Image Generation传统方法 DPPMG Prompt User Visual Token ↓ CLIP Text Encoder Item Visual Token ↓ ↓ Stable Diffusion Placeholder U* / I* ↓ ↓ Image Codebook Lookup ↓ CLIP Text Encoder ↓ Stable Diffusion❌ 冻结 ↓ Personalized Image也就是Token ID → Codebook Lookup → Embedding → CLIP Text Encoder → Diffusion②Text Generation文字生成逻辑类似User Text Token Item Text Token System Prompt ↓ LLaMA3❌ 冻结 ↓ Personalized Text论文把Pᵗᵤ 、Pᵗᵢ通过 textual codebook lookup 转换成 embedding然后和 system prompt 一起送进 LLM。创新3Multimodal Consistent Personalized Reward个性化 跨模态一致性联合优化好处解决了一个非常典型的 trade-off只优化 Personalization而DPPMG实现了Personalization ↑ Cross-modal Consistency ↑所以最终目标是既像用户喜欢的东西又让生成的多模态内容彼此对应。解决问题单纯追求个性化图片/文本可能符合用户喜好但彼此不一致。单纯追求跨模态一致图片和文本虽然匹配但不一定符合用户喜好。♀️做法这是第二阶段里面真正解决“图片和文字可能不一致”的关键。前面得到User Preference Token ↓ ┌──────────────┐ ↓ ↓ Image Text Generator Generator ↓ ↓ Vg Tg问题来了图片可能很符合用户喜欢的风格但是文字说的是另一个东西。或者图片和文字很匹配但是根本不像这个用户喜欢的内容。所以作者设计两个 Reward。① Personalization Reward和用户历史图片 V₁,V₂,...,Vₙ 分别做 CLIP similarity再平均得到Rᵛₚ文字同理将生成Text和用户历史文本送入CLIP similarity得到Text Personalization Reward② Cross-modal Consistency Reward将上面两个Generated Image Vg和Generated Text Tg计算Rcrs CLIPSim(Vg,Tg)也就是生成图片和生成文字必须相互匹配。一个为电影生成图像和文本的例子。实验验证① Preference Token 有效加入 Preference Token 后个性化指标提升→ 证明 Token 确实编码了用户偏好。②Multimodal 有效去掉另一模态后个性化性能下降→ 用户偏好确实具有多模态特征。③RQ-VAE 的 hierarchical Token 有意义共享 Token prefix 越长User / Item similarity ↑→ 离散 Token 具有层级语义结构并能够解释 collaborative filtering effect。④Reward 各司其职Preference Token → Personalization ↑ Unimodal Reward → Personalization ↑ Cross-modal Reward → Consistency ↑ 两者联合 → Personalization Consistency⑤效果DPPMG 在个性化图像/文本生成的大多数指标上优于对比方法人工评测中参与者也更偏好 DPPMG 的个性化结果及跨模态一致性。DPPMGGenRank / HSTU方向输入多模态用户-物品交互用户行为序列偏好建模LightGCNHSTU表示连续 preference embeddingsequential representation离散化RQ-VAESemantic ID 等Token 表达什么用户偏好物品/行为序列信息生成什么图片 文本Item / 推荐结果核心问题preference → generationsequence → generation共同思想推荐表示 → 离散 Token → 生成模型补充DPPMG 的 Preference Token ≠ Semantic ID。DPPMG 的 Token 主要回答“这个用户喜欢什么”Semantic ID 主要回答“这个 item 是什么”