去噪扩散概率模型

这篇文章是引起去噪模型大火的一篇文章,里面有非常多的细节内容值得琢磨。不过我是站在机器人policy learning的角度去看,看的略微有些浅薄。若有疏漏,请多多指出。

更详细的后续会解读,真正落地到机器人policy learning里的diffusion policy这篇文章

“我们展示了使用扩散概率模型的高质量图像合成结果,这是一种受非平衡热力学启发的潜在变量模型类别。我们通过训练加权变分界,该变分界基于扩散概率模型与去噪评分匹配朗之宫动力学匹配的新颖联系,获得最佳结果,”

图2:本研究中考虑的有向图形模型。

解读:本文描述的是原始 DDPM ,是无条件模型,

当 xt 接近纯噪声时,模型并不知道它应该是哪个类别。原始无条件 DDPM 是随机生成的,类别由初始噪声和反向采样轨迹共同决定。模型负责学习真实数据分布的去噪方向,而不是从纯噪声中识别隐藏标签。

“此外,我们证明了扩散模型的某些参数化在训练期间与多噪声水平的去噪评分匹配以及采样过程中退火朗之文动力学的等价性(第3.2节)[55, 61]。

“尽管样本质量高,我们的模型在对数似然上与其他基于似然的模型相比并不具有竞争性(不过,我们的模型的对数似然比退火重要性抽样对能量模型和评分匹配的大型估计值要好[11, 55])。我们发现,大多数模型的无损码长都被用来描述难以察觉的图像细节(第4.3节)。我们用有损压缩的语言对这一现象进行了更精细的分析,并展示了扩散模型的采样过程是一种渐进解码方式,类似于沿位序进行的自回归解码,极大地推广了自回归模型通常可能实现的内容。”

“联合分布pθ(x0:T)称为逆过程,定义为一个马尔可夫链,其学习的高斯转移从p(xT ) = N (xT ; 0, I)开始:”

解读:第 2 节是在定义 DDPM 的概率框架。q 负责把真实图片逐步加噪到标准高斯,p_θ 负责学习把标准高斯逐步去噪回图片;β_t、α_t、ᾱ_t 控制噪声强度和信号保留比例;训练目标就是让学出来的每一步反向过程尽量接近数学上可计算的真实反向后验。

“训练通过优化通常的负对数似然变分界限来实现:”

解读:

L_T:让最终加噪后的 x_T 接近标准高斯噪声 p(x_T)。

L_{t-1}:让模型学会每一步反向去噪,即让 p_θ(x_{t-1}|x_t) 接近真实后验 q(x_{t-1}|x_t,x_0)。

L_0:最后一步从 x_1 还原 x_0 的重建项。

D_KL(a || b):KL 散度,衡量两个分布有多不一样。

“现在我们讨论 pθ(xt−1|xt) = N (xt−1; μθ(xt, t), Σθ(xt, t)) 对 1 < t ≤ 的选择。首先,我们将 Σθ(xt, t) = σt2I 设为未训练的时变常数。实验上,σt² = βt 和 σt² = β ̃t = 1−α ̄t−1 ̄t−1 1−α ̄t βt 结果相似。第一种选择对 x0 ∼ N (0, I) 最优,第二种选择对确定性设为一点的 x0 最优。这两种极端选择分别对应于具有坐标单位方差的数据的反向过程熵的上下界[53]。”

解读:这会让训练出现额外权衡:模型可以通过调大方差来“掩盖”均值预测错误,但方差太大又会降低采样质量。原论文为了得到简单稳定的训练目标,把方差固定住,这样 Lt−1 就主要变成预测均值/预测噪声的 MSE。

完整协方差在图像上几乎不可行。一张图片维度可能是几十万。如果让模型输出完整协方差矩阵,参数量和计算量都爆炸。所以即使学习方差,通常也只学 diagonal variance 或每个时间步的 scalar/log variance,不会学完整矩阵。

不过,后来的工作确实会学习方差。比如 Improved DDPM 里就让模型学习 reverse variance,通常是在 βt 和 \tilde βt 之间插值预测 log variance。这样可以改善 likelihood,也有助于更少步数采样。但在原始 DDPM 论文里,固定方差是一个非常务实的选择:先把主要任务简化成学去噪方向,也就是预测 ε,采样质量已经很好。

最终优化目标为:

“这类似于以T为索引的多个噪声量表的去噪分数匹配[55]。由于方程(12)等于(其中一项)朗之万维逆过程的变分界(11),我们看到优化类似去噪分数匹配的目标,等同于用变分推断拟合类似朗之万动力学的采样链的有限时间边际。 总结来说,我们可以训练逆过程均值函数近似器μθ来预测 ̃μt,或者通过修改其参数化,训练它预测 。(也有可能预测x0,但我们发现这在实验早期会导致样本质量下降。)我们证明了 -预测参数化既类似于朗之万动力学,又简化了扩散模型对目标函数的变分束定,类似于去噪分数匹配。尽管如此,它只是pθ(xt−1|xt)的另一种参数化,因此我们在第4节中验证了其有效性,比较了预测与预测的“μt”。”

解读:相当于模型它每次接收当前噪声图 xt 和时间步 t,输出同尺寸的噪声预测 εθ(xt,t);再用固定公式把这个噪声预测变成反向高斯分布的均值,从而一步步采样出图像

Logo

脑启社区是一个专注类脑智能领域的开发者社区。欢迎加入社区,共建类脑智能生态。社区为开发者提供了丰富的开源类脑工具软件、类脑算法模型及数据集、类脑知识库、类脑技术培训课程以及类脑应用案例等资源。

更多推荐