ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

27届大模型面试准备(四十六):多模态生成式架构——扩散与自回归的统一

27届大模型面试准备(四十六):多模态生成式架构——扩散与自回归的统一 27届大模型面试准备四十六多模态生成式架构——扩散与自回归的统一引言大模型的能力版图里A14 讲了视觉语言模型VLM理解侧A31 讲了多模态推理A40 讲了多模态大模型训练与对齐A44 讲了生成式世界模型与视频生成偏世界如何被模拟。本文把镜头对准生成范式本身同样是文生图、文生视频底层为什么会出现自回归Autoregressive, AR和扩散Diffusion两条技术路线它们各自擅长什么、又为什么正在相互靠拢这不仅是论文里的分类游戏更是面试高频考点华为等多模态岗常问为什么文生图用扩散、文生视频又开始用自回归DiT 和 Transformer 什么关系扩散和 AR 能不能统一。把这条主线讲清楚能直接体现你对生成式模型架构演进的全局理解。一、两条生成主线自回归 vs 扩散如果只记一句话自回归是按顺序一个词一个词往外蹦扩散是从一团噪声里逐步擦干净。二者对生成的数学建模完全不同。生成范式的两种世界观 自回归 AR: 噪声/起始 ──- token1 ──- token2 ──- ... ──- tokenN (因果、串行) 扩散 Diffusion: 纯噪声 x_T ──- x_{T-1} ──- ... ──- x_0 (去噪、可并行) 两者都收敛到数据分布但路径与表示不同维度自回归AR扩散Diffusion表示空间离散 tokenVQ codebook连续 latentVAE 隐空间采样方式因果、串行、不可并行迭代去噪、单步可并行与 LLM 关系天然统一同一套 Transformer需桥接DiT 用 Transformer 但非因果文本对齐强语言即序列需条件注入CFG/cross-attn保真度中误差累积高去噪稳定速度慢串行相对快少步蒸馏后代表DALL-E 1、VideoPoet、LVMDDPM、Stable Diffusion、DiT、Sora关键直觉AR 把生成当成语言建模的一段延续因此天然能吃指令、好控、易和 LLM 拼装扩散把生成当成从噪声分布的逆过程保真度更高但对语言指令是外挂的。二、自回归生成从 VQGAN 到视频 tokenAR 生成图像的第一步是把连续图像变成离散 token。做法是用 VQ-VAEVector Quantized VAE编码器把图像压成 latent再用一个 codebook 把每个 latent 量化成最近邻的离散码于是整张图变成一串视觉单词。VQ 量化示意图像 - token 序列 图像 ──encoder──- latent grid (H/d x W/d x C) │ codebook 最近邻量化 v token map (H/d x W/d) ──展平──- 1D token 序列 (每个 token in {0..K-1})importtorch,torch.nnasnnclassVQ(nn.Module):def__init__(self,n_embed1024,embed_dim8):super().__init__()self.embednn.Embedding(n_embed,embed_dim)# 推理把 latent 量化成最近 codebook 项defquantize(self,z):d(z[...,None,:]-self.embed.weight[None,None,None,:,:]).pow(2).sum(-1)idxd.argmin(-1)# 最近邻索引 离散 tokenz_qself.embed(idx)# 量化后的 latentreturnz_q,idx视频则是把时间轴也 token 化把视频切成时空 patch沿时间, 高, 宽展平成超长序列喂给标准因果 Transformer。优势是和语言模型用同一套架构、天然支持文本条件劣势是序列极长、串行采样慢、且逐 token 的误差会累积高分辨率下保真度吃亏。三、扩散生成从 DDPM 到 DiT扩散模型的思路反过来训练时给干净图逐步加高斯噪声直到变成纯噪模型学给定带噪图、预测加进去的噪声采样时从纯噪出发反复减去预测噪声逐步还原。DDPM 训练 / 采样 训练: x0 ──加噪 q(x_t|x_0)──- x_t (越来越糊) 模型 eps_theta(x_t, t) 预测噪声 损失 ‖ eps_theta - eps_true ‖2 采样: x_T~N(0,I) ──反复 x_{t-1}denoise(x_t)──- x_0 (清晰图)defsample_step(model,x_t,t,cfg7.5,condNone,uncondNone):# classifier-free guidance有条件与无条件预测之差放大eps_condmodel(x_t,t,cond)eps_uncondmodel(x_t,t,uncond)epseps_uncondcfg*(eps_cond-eps_uncond)x_prevdenoise_step(x_t,eps,t)# 一步去噪returnx_prev架构上早期扩散用 U-Net当分辨率/规模上来后DiTDiffusion Transformer用标准 Transformer 替代 U-Net 主干把 latent patch 当成 token 做注意力质量与可扩展性显著提升也是 Sora 一类系统的底座。文本对齐靠 cross-attention 把文本编码注入靠 CFG 强化听话程度。四、统一架构两条线为什么在收敛近年一个清晰趋势AR 和扩散在互相借鉴边界模糊。核心统一视角是——二者都是从某个初始状态噪声或掩码迭代细化到数据差别只在采样顺序因果串行 vs 并行去噪与表示离散 vs 连续。几条收敛路线离散扩散 / 掩码生成Masked Generative把图像 token 随机掩码模型并行预测所有掩码位迭代揭开训练目标类似 BERT 的 MLM但用于生成。它既有 AR 的离散表示又有扩散的并行迭代。MARMasked Autoregressive把按块自回归和块内并行掩码结合兼顾可控与速度。把扩散写成 AR用离散化噪声水平构造似然分解把 AR 写成并行用 speculative 解码或块级并行提速。# 掩码生成(Masked Generative)的训练目标示意defmasked_gen_target(tokens,mask_ratio0.5):masktorch.rand(tokens.shape)mask_ratiocorruptedtokens.masked_fill(mask,MASK_ID)predmodel(corrupted)# 并行预测所有掩码位lossce(pred[mask],tokens[mask])# 只在掩码位算损失returnloss一句话总结统一生成 迭代细化AR 选因果顺序 离散码扩散选并行去噪 连续 latent而掩码生成等中间形态让两者可平滑过渡。五、文生视频的工程要点文生视频是两条路线交锋最激烈的地方。视频在时间和空间上都相关工程要点时空 patchify把视频切成帧, 高, 宽三维 patch作为 Transformer 的 token。时空注意力联合时空注意力保运动连贯或分解为空间注意力 时间注意力以省算力。时序一致性扩散在 latent 视频空间逐步去噪天然能保持时序平滑AR 则需靠因果顺序自身保证但长视频易漂移。与 A44 世界模型的关系Sora 类用扩散在 latent 视频空间生成看起来合理的视频世界模型JEPA/Dreamer强调在 latent 空间做可物理推演的预测目标更偏模拟而非画面好看。两者共享视频 latent 建模底座但评价目标不同。评测上常用 FID图、FVD视频衡量帧序列分布差距、文本-视频对齐分数如 CLIPScore 的视频版与人工评测。注意 FVD 对帧率、分辨率敏感跨模型比较要同口径。六、选型与部署取舍落到工程选 AR 还是扩散取决于你最在意什么目标推荐路线理由强文本可控、要接 LLM Agent自回归与语言模型同架构指令跟随天然高保真图像、质量优先扩散 / DiT去噪稳定、保真度高实时、低延迟扩散 少步蒸馏单步可并行蒸馏到 1~4 步长视频一致性扩散(latent)时序平滑漂移小统一多模态(图/文/视频一体)自回归 token一套架构通吃部署侧扩散常用 UNet/DiT VAE 编码器/解码器显存峰值高但可少步采样提速AR 受限于序列长度长视频显存和时延都吃紧常用时空分块或分层生成缓解。量化上两者都能吃 INT8/FP8但 VAE 解码端对精度更敏感需单独校准。七、扩散与自回归的工程权衡再谈落到真刀真枪的选型不能只说各有所长要能量化。延迟上AR 串行采样生一张图要吐几百到上千 token首字延迟高、总时长随分辨率线性增长扩散单步可并行且能用少步蒸馏LCM、一致性模型压到 1 到 4 步吞吐反而高。显存上扩散要常驻 VAE 编码/解码加 DiT 主干峰值高但稳定AR 受序列长度拖累高分辨率下 KV Cache 占显存爆炸。质量上扩散保真度与细节通常更优AR 在强文本对齐、复杂排版带文字的图、UI 截图上更稳。一个被低估的工程技巧是混合架构用 AR 定结构与布局先把场景、物体、位置关系用 token 敲定再用扩散在 latent 上细化纹理与光照。这样兼顾 AR 的可控与扩散的保真也缓解 AR 长程误差累积。视频场景同理用 AR 做关键帧与镜头脚本用扩散做帧间插值与时序细化。部署侧扩散常走VAE 编码 - DiT 去噪 - VAE 解码三段瓶颈在 DiT 与解码量化时 DiT 吃 INT8/FP8 稳VAE 解码对精度敏感需单独校准呼应 A34 端侧部署。AR 走Tokenizer 编码 - Transformer 生成 - Tokenizer 解码瓶颈在序列长度常用时空分块或分层生成先粗后细把序列压短。两者都能上连续批处理A25提吞吐。八、收口统一架构的落地趋势把本文放回系列坐标A14 讲 VLM理解侧多模态A31 讲多模态推理A40 讲多模态训练与对齐A44 讲生成式世界模型与视频生成本文讲生成范式本身。五篇拼起来就是多模态从看懂、到推理、到对齐、到生成世界的全景。面试讲多模态生成建议用范式-统一-工程三层答题先讲清 AR 与扩散两条范式的表示与采样差异第一节表格再讲它们为何在收敛掩码生成、MAR第四节最后落到工程权衡本节的质量-速度-可控三角与混合架构。一句话收尾未来不会是 AR 或扩散二选一而是统一迭代细化框架——离散还是连续、因果还是并行只是同一目标下的超参数选哪个取决于你最在意质量、速度还是可控性。这也正是 A44 世界模型与本文文生视频共享的底层逻辑都在 latent 空间做生成式建模只是评价目标一个偏模拟、一个偏画面。九、收口补充多模态生成的工程易错点与进阶考点最后把多模态生成最常踩的坑和面试官最爱追的点收一遍。第一个易错点是把扩散和自回归当成非此即彼。前文已讲清二者是迭代细化这同一目标的两种采样超参数离散还是连续、因果还是并行。成熟系统常混合——AR 定结构与布局扩散细化纹理与时序这样兼顾可控与保真。第二个易错点是忽视文本对齐的来源。扩散的文本对齐是外挂的cross-attention 加 CFG天然弱于 AR 把语言当成自身序列强文字、强排版场景带字图、UI 截图、图表往往 AR 更稳。第三个易错点是混淆文生视频与生成式世界模型A44前者追求画面合理好看后者追求 latent 空间可物理推演二者共享视频 latent 建模底座但评价目标不同别在面试里混为一谈。进阶考点有两个方向。其一是少步采样一致性模型、LCM 把 50 步扩散压到 1 到 4 步靠把概率流 ODE 的轨迹蒸馏成单步映射是部署侧提速的关键要能说清为什么能少步。其二是表示统一把图像、视频、文本都切成 token 或 patch用一套 Transformer 通吃统一多模态这是当下明显趋势也呼应 A40 多模态训练与对齐。把这三点讲透你的多模态生成答题就有了架构演进的纵深而不是停留在SD 画图、Sora 视频的表层。收尾一句话未来不是 AR 或扩散二选一而是统一迭代细化框架——选离散还是连续、因果还是并行只看你最在意质量、速度还是可控性。能按场景做这个权衡比背下任何一份模型清单都更能打动面试官。十、实战选型清单与面试深化把前面结论落成可执行的选型表面试时直接甩出来最加分。第一纯文生图且质量优先选扩散或 DiT必要时少步蒸馏压延迟第二强文本对齐、带字截图、UI 生成优选自回归因为它把语言当自身序列第三视频且要时序一致扩散在 latent 视频空间更稳自回归易漂移第四要接 LLM Agent 统一多模态自回归 token 化最顺第五预算吃紧混合架构AR 定结构、扩散细化通常性价比最高第六实时场景必须少步采样否则扩散的多步去噪扛不住延迟预算。再补几个面试高频深化点。其一是 DiT 为什么比 U-Net 好Transformer 主干随数据规模持续受益注意力天然建模长程空间依赖质量上限更高代价是训练算力更贵、部署峰值显存更高。其二是少步采样为什么成立扩散前向加噪可写成概率流 ODE沿轨迹任意点都能映射回数据一致性模型把轨迹蒸馏成单步近似所以 1 到 4 步也能还原合理样本但极端少步会丢细节要在速度与保真间权衡。其三是评测口径图像看 FID/IS视频看 FVD对帧率分辨率敏感跨模型比较要同口径文本对齐看 CLIPScore 类指标加人工评测不能只看单分数。其四是视频 tokenization 的压缩技巧时空分块、关键帧复用、沿时间轴做余弦相似帧合并都是把爆炸的 token 数压下来的工程手段直接关系到显存与成本。再往架构演进看统一多模态是明显趋势把图像、视频、文本都切成 token 或 patch用一套 Transformer 通吃避免为每个模态训一个模型。这呼应 A40 多模态训练与对齐——对齐的本质就是让不同模态落到同一表示空间而生成侧的统一 token 化是它的自然延伸。文生视频与生成式世界模型A44共享视频 latent 建模底座但评价目标不同前者求画面合理好看后者求 latent 可物理推演、能预测状态转移面试里别混为一谈。常见陷阱有三个把扩散和 AR 当非此即彼其实是同一目标的不同采样超参数、忽视文本对齐来源扩散是外挂的 cross-attention 加 CFG天然弱于 AR、只追新模型不谈权衡质量速度可控三角才是决策依据。部署侧再点一句扩散量化时 DiT 吃 INT8/FP8 稳VAE 解码对精度敏感需单独校准自回归量化瓶颈在序列长度常用分层生成把序列压短。最后收一句多模态生成没有银弹只有按质量、速度、可控性三目标做有依据权衡。能把这权衡讲清楚比背任何模型清单都更能体现架构判断力。十一、把多模态生成讲成体系面试时最怕把多模态生成讲成一串模型名字DiT、Sora、MAR 背一遍。更好的讲法是按表示-生成-评价三层来串把每个模型落到框架里的具体位置而不是当成孤立名词。表示层回答图和文字怎么进同一个空间自回归走 VQ 离散 token扩散走 VAE 连续 latent统一多模态趋势是把两者都切成 patch 用一套 Transformer这呼应 A40 多模态训练与对齐里对齐即落到同一表示空间的结论。生成层回答从噪声或掩码到数据怎么迭代自回归是因果串行、扩散是并行去噪、掩码生成是并行填掩码本文主线就是把三者统一到迭代细化这一个目标下。评价层回答怎么知道生成得好图像看 FID/IS视频看 FVD文本对齐看 CLIPScore 类指标加人工评测跨模型比较必须同口径。再给一个收束视角本文在系列里的位置网——A14 VLM 是理解侧、A31 多模态推理是思考侧、A40 训练与对齐是底座、A44 生成式世界模型是模拟侧、本文是生成侧。五篇拼成多模态从看懂、到推理、到对齐、到生成世界的全景。面试时你能随手指出任意一篇在这个框架里的位置并讲清 AR 与扩散为何收敛面试官就会认定你真的建立了体系而不是背了五篇稿子。最后落一句工程提醒选生成范式永远回到质量、速度、可控性三角没有哪个模型能同时赢三项权衡本身才是考察点能把权衡讲清楚比报模型清单值钱得多。面试速答问为什么文生图多用扩散、文生视频又开始用自回归答文生图重保真扩散去噪稳定、质量高视频序列极长纯扩散在超长时空上训练/采样成本高而把视频 token 化后用 AR Transformer 可复用 LLM 基础设施、文本对齐更强。两条线在工程上各有最优区间。问DiT 和 U-Net 扩散什么关系答DiT 是用 Transformer 替换扩散里 U-Net 主干。把 latent patch 当 token 做注意力可扩展性、质量优于 U-Net是 Sora 类系统的底座。问CFGclassifier-free guidance做什么答采样时用有条件预测与无条件预测之差放大条件信号让生成更听话、文本-图对齐更强代价是多样性下降。问AR 和扩散能统一吗答能。统一视角是生成迭代细化区别在采样顺序与表示。掩码生成、MAR 等中间形态并行预测掩码位、兼具离散表示与并行迭代使两者可平滑过渡。问VQ 量化有什么用答把连续图像/视频压成离散 token使 AR 模型能用标准因果 Transformer 生成视觉内容并与语言序列共享同一生成框架。问扩散为什么保真度高、AR 为什么误差累积答扩散每步只预测该减多少噪声目标平滑、并行去噪AR 逐 token 串行前一步错会带入后续长程易退化。问文生视频怎么保时序一致答扩散在 latent 视频空间联合时空去噪时序天然平滑AR 靠因果顺序自身保证但长视频易漂移需分层或分块生成。问和世界模型A44什么区别答文生视频扩散类追求画面合理好看世界模型追求latent 空间可物理推演、能预测状态转移。共享视频 latent 建模底座但评价目标不同。高频追问清单离散扩散和连续扩散在训练目标上具体差在哪掩码生成如何保证生成顺序不崩先揭哪些掩码视频 token 化后序列长度爆炸有哪些压缩手段时空分块、关键帧CFG 的引导系数过大/过小分别有什么副作用少步蒸馏一致性模型 / LCM怎么把 50 步压到 1~4 步扩散模型能做图像编辑/局部重绘吗inpainting 怎么实现AR 视频如何缓解长程漂移有没有用检索/参考帧量化部署时 VAE 解码端为什么对精度更敏感怎么单独校准
返回列表