
Abstract:论文整体想表达什么?这篇论文要解决的是生成模型中的一个核心矛盾:模型越灵活,越能描述复杂数据;但模型通常越难训练、采样和计算概率。例如,简单的高斯分布容易计算和采样,但无法表达复杂图像;复杂的概率模型能够拟合丰富的数据结构,却往往很难计算其归一化常数、生成样本或评估概率。1. 论文提出的基本想法论文借鉴了非平衡统计物理中的“扩散”过程,设计了一个分为正向和反向的生成框架。正向过程:逐步破坏数据结构从真实数据开始,通过很多个小步骤逐渐加入噪声,使数据中的结构被慢慢破坏:真实数据 → 轻微加噪 → 更多加噪 → 纯噪声经过足够多步之后,复杂的数据分布会变成一个简单、已知、容易采样的分布,例如高斯分布。反向过程:逐步恢复数据结构然后训练另一个反向过程,从简单的噪声分布出发,逐步去除噪声、恢复结构:纯噪声 → 逐步去噪 → 复杂数据这个反向过程就是论文真正的生成模型。只要从简单噪声开始运行反向扩散,就可以生成类似真实数据的新样本。2. 为什么这种方法能够兼顾灵活性和可计算性?论文的关键思想是:不直接用一个复杂函数描述整个数据分布;而是把复杂的生成过程拆成很多个简单的小步骤;每一步只需要学习一个较小的扰动或反向转换。由于每一步的概率分布都可以解析计算,所以整个多步过程也能够进行概率计算。这样就同时获得了:较强的表达能力:很多步组合起来可以描述非常复杂的数据分布;较好的可计算性:每一步都比较简单,容易训练、采样和评估。3. 论文声称可以完成哪些任务?摘要中强调,这个扩散概率模型不仅可以生成样本,还可以:快速学习复杂数据分布;从模型中采样;计算数据的概率或对数似然;计算条件概率;计算后验概率。这意味着它不仅能“生成图片”,还可以用于图像去噪、修复以及根据部分观测推断完整数据等任务。4. 实验验证了什么?论文在多种数据上进行了实验,包括:二维 Swiss roll 数据;二值序列;MNIST 手写数字;CIFAR-10 自然图像;树皮和落叶等自然图像。实验目的是说明,这种扩散过程能够学习从简单噪声分布到复杂数据分布的转换,并且可以产生具有真实结构的样本。论文还公开了该算法的开源实现,方便其他研究者复现和使用。Abstract 的一句话总结论文提出了一种扩散概率模型:先通过正向过程逐步把复杂数据变成简单噪声,再学习反向过程从噪声中逐步恢复数据,从而在保持强大建模能力的同时,实现可训练、可采样、可计算概率和可进行后验推断的生成模型。1. Introduction这一章首先说明,论文关注的是概率生成模型中的一个长期问题:如何让模型足够灵活,能够描述复杂数据,同时又保持可训练、可采样、可计算概率?1. 灵活性和可计算性之间的矛盾简单的概率模型,例如高斯分布或拉普拉斯分布,通常容易计算:概率可以直接求出;参数容易学习;样本容易生成。但它们的表达能力有限,难以描述自然图像、手写数字等复杂数据。另一类模型可以使用非常灵活的函数来描述数据分布,理论上能够拟合任意复杂结构。但这类模型通常会遇到归一化常数难以计算的问题,导致:无法直接计算样本概率;训练成本很高;采样需要昂贵的蒙特卡洛方法;推断和后验计算也比较困难。过去的一些方法,例如变分推断、对比散度、得分匹配和重要性采样等,虽然能够缓解这个矛盾,但通常只能在灵活性和可计算性之间取得部分折中。2. 扩散概率模型的基本框架论文提出的扩散概率模型使用一个马尔可夫链,将数据分布逐步转换成简单分布。设真实数据分布为起点:q(x(0))q(x^{(0)})q(x(0))正向扩散过程不断对数据加入少量噪声:x(0)→x(1)→x(2)→⋯→x(T)x^{(0)} \rightarrow x^{(1)} \rightarrow x^{(2)} \rightarrow \cdots \rightarrow x^{(T)}x(0)→x(1)→x(2)→⋯→x(T)当步骤足够多时,最终的x(T)x^{(T)}x(T)会接近一个简单、已知的分布,例如单位高斯分布。然后,论文学习这个过程的反向形式:x(T)→x(T−1)→⋯→x(1)→x(0)x^{(T)} \rightarrow x^{(T-1)} \rightarrow \cdots \rightarrow x^{(1)} \rightarrow x^{(0)}x(T)