新闻详情

新闻详情

首页 / 资讯中心 / 详情

Diffusion模型连续时间框架:SDE与ODE到一步生成

发布时间:2026/9/26 15:55:05来源:尧图网络
Diffusion模型连续时间框架:SDE与ODE到一步生成
1. 从一张模糊照片说起为什么连续时间框架值得死磕刚接触 Diffusion 那会儿我和大多数人一样是从 DDPM 的离散步骤入手的。训练一个 UNet 预测噪声采样时跑 1000 步去噪代码跑通、图能出来就觉得已经懂了。直到有一次我想把采样步数从 1000 压到 50结果图像质量断崖式下跌细节全糊成一团。那时候我才意识到离散的马尔可夫链视角虽然直观但它把时间切成了一段段孤立的台阶你很难优雅地跨步。后来我把目光转向连续时间框架也就是用**随机微分方程SDE和常微分方程ODE**来重新描述扩散过程。这个视角一换很多之前想不通的事情突然就通了为什么 DDIM 可以跳步、为什么有些采样器 20 步就能出好图、为什么会有“一步生成”这种听起来像魔法的东西。核心在于连续时间框架把扩散的加噪和去噪看成一条连续的轨迹而不是一堆离散的跳跃。你可以在任意时刻取点也可以用不同的数值方法去解这条轨迹。这篇文章我想聊的就是这条线索Diffusion 模型中的 SDE 与 ODE从连续时间框架到一步生成。我会从为什么需要连续视角讲起拆解前向 SDE 和反向 SDE 的构造逻辑再讲概率流 ODE 是怎么把随机性“拧干”的最后落到一步生成这条前沿路线上。适合已经跑过 DDPM 或 Stable Diffusion、想往底层原理再走一步的人也适合对 Neural ODE 感兴趣、想知道它怎么和生成模型结合的朋友。读完之后你至少能明白那些采样器背后的数学骨架长什么样以及为什么“一步出图”在理论上站得住脚。2. 连续时间框架到底解决了什么问题2.1 离散扩散的痛点步数、误差与灵活性DDPM 的离散设定里前向过程是 ( x_t \sqrt{\bar\alpha_t} x_0 \sqrt{1-\bar\alpha_t}\epsilon )一共 T 步通常 T1000。这个公式本身没问题问题出在采样阶段。反向过程需要一步步从 ( x_T ) 走到 ( x_0 )每一步都依赖上一步的结果。你想少走几步就得重新设计噪声调度或者接受质量损失。我实测过用原始 DDPM 的采样器跑 100 步FID 会明显变差人脸的五官开始出现轻微扭曲。这不是模型没训好而是离散近似带来的累积误差。每一步的预测都有微小偏差1000 步累积下来还能靠随机性“糊”过去但步数一少误差就暴露了。更麻烦的是离散框架下你很难回答一个问题如果我想在任意时刻 t 采样该怎么做离散的 t 只能是整数你没法在 t0.5 处自然地定义状态。这就限制了采样器的设计空间也让很多理论分析变得别扭。2.2 连续视角的引入把时间轴拉成实数域连续时间框架做的事情很直接把 t 从 {1, 2, ..., T} 扩展到 [0, T] 的实数区间。前向过程不再是一步步加噪声而是一个随机微分方程在驱动[ dx f(x, t) dt g(t) dw ]这里 ( f(x,t) ) 是漂移项控制确定性的变化趋势( g(t) ) 是扩散系数控制噪声注入的强度( dw ) 是布朗运动。这个式子的意思是在无穷小的时间 dt 内状态 x 会有一个确定性的漂移再加上一点随机扰动。为什么这么写有好处因为一旦写成 SDE你就可以用随机分析的工具去处理它。反向过程同样可以写成一个 SDE只不过时间倒流漂移项需要包含一个“分数函数”项。这个分数函数 ( \nabla_x \log p_t(x) ) 正是神经网络要学的东西。我个人的体会是连续框架最大的价值不是“更精确”而是更统一。DDPM、DDIM、Score-based Model 这些看起来不同的方法在连续视角下都是同一个 SDE 的不同离散化或不同数值解法。你不再需要为每个方法单独记一套公式而是理解一条主线索剩下的都是变体。2.3 SDE 与 ODE 的分工随机性与确定性的两条路在连续框架里SDE 和 ODE 扮演不同角色。SDE 负责描述带随机性的扩散过程前向加噪是 SDE反向去噪也可以写成 SDE。这条路径保留了随机性采样时每一步都有噪声注入好处是能探索更多模式坏处是轨迹不稳定需要较多步数。ODE 则是把随机性去掉后的确定性版本。概率流 ODE 描述的是如果我把所有随机扰动都“平均掉”剩下的确定性轨迹是什么样。这条轨迹有一个重要性质——它保持边缘分布不变。也就是说沿着 ODE 走你在每个时刻 t 得到的样本分布和 SDE 在同样时刻的边缘分布是一样的。这个性质非常关键。它意味着你可以用 ODE 来做采样而且因为 ODE 是确定性的你可以用高阶数值解法比如 Runge-Kutta来加速步数可以压得很低。DDIM 本质上就是概率流 ODE 的一种离散化。我后来把采样器从 DDPM 换成 DDIM同样的模型50 步就能出接近 1000 步的质量速度提升非常明显。3. 前向 SDE 与反向 SDE 的构造细节3.1 前向 SDE如何把一张图变成纯噪声前向 SDE 的设计目标很简单从真实数据分布 ( p_0(x) ) 出发经过时间 T 后变成标准正态分布 ( p_T(x) \approx \mathcal{N}(0, I) )。常用的形式是 Variance Preserving (VP) SDE[ dx -\frac{1}{2}\beta(t) x , dt \sqrt{\beta(t)} , dw ]这里 ( \beta(t) ) 是噪声调度函数通常从 0.1 线性或余弦增长到 20 左右。漂移项 ( -\frac{1}{2}\beta(t)x ) 的作用是让 x 的方差保持有界不至于爆炸扩散项 ( \sqrt{\beta(t)}dw ) 负责注入噪声。我第一次看到这个式子的时候觉得漂移项那个负号很反直觉——为什么要把 x 往回拉后来想明白了如果没有这个负号噪声注入会让方差指数增长数值上很快溢出。加上这个负号方差会被稳定在 1 附近最终收敛到标准正态。这就像给一个不断被吹气的气球扎了个小孔让它不会爆掉。另一个常见选择是 Variance Exploding (VE) SDE[ dx \sqrt{\frac{d[\sigma^2(t)]}{dt}} , dw ]没有漂移项方差随时间爆炸式增长。VE SDE 在 Score-based Model 里用得比较多因为它的形式更简单分数函数的估计也更直接。但 VP SDE 在数值稳定性上更好Stable Diffusion 系列用的就是 VP 形式。3.2 反向 SDE从噪声里“倒放”出图像反向 SDE 的推导来自 Anderson 在 1982 年的工作。给定前向 SDE反向过程可以写成[ dx [f(x,t) - g(t)^2 \nabla_x \log p_t(x)] dt g(t) d\bar{w} ]注意这里时间是从 T 倒流到 0( d\bar{w} ) 是反向布朗运动。关键项是 ( \nabla_x \log p_t(x) )也就是分数函数。它告诉我们在时刻 t概率密度在 x 处的梯度方向。直观理解如果你站在概率密度的“山坡”上分数函数指向密度增加最快的方向也就是“更像真实数据”的方向。神经网络要学的就是这个分数函数。训练目标是去噪分数匹配[ \mathcal{L} \mathbb{E}{t, x_0, \epsilon} \left[ | \epsilon\theta(x_t, t) - \epsilon |^2 \right] ]这里 ( \epsilon_\theta ) 是网络预测的噪声而 ( \epsilon ) 是实际加入的噪声。训练好之后( \nabla_x \log p_t(x) \approx -\epsilon_\theta(x_t, t) / \sigma_t )其中 ( \sigma_t ) 是时刻 t 的噪声标准差。我踩过的一个坑是反向 SDE 的离散化对步长很敏感。如果你用 Euler-Maruyama 方法步长稍大一点采样就会发散图像变成彩色噪点。后来我改用自适应步长或者换用 ODE 采样器问题才解决。这也是为什么现在主流采样器大多基于 ODE 而不是 SDE。3.3 分数函数连接 SDE 与神经网络的桥梁分数函数是整个框架的核心枢纽。它既是反向 SDE 的漂移项组成部分也是概率流 ODE 的定义基础。理解它的几何意义对调参和排查问题很有帮助。想象概率密度 ( p_t(x) ) 是一座山山顶是数据密集区山脚是低概率区。分数函数 ( \nabla_x \log p_t(x) ) 就是每个位置的“上坡方向”。在采样时你从山脚纯噪声出发沿着分数函数指的方向走就能爬到山顶真实数据。但分数函数有个问题在低密度区域它的估计非常不准。因为训练数据很少覆盖那些区域网络没见过预测的梯度方向可能是错的。这就是为什么采样初期t 接近 T容易出问题。解决办法之一是加一个小的噪声扰动让轨迹不要走到太偏的地方。这也是 SDE 采样比 ODE 采样更“稳”的原因——随机性帮你避开了分数函数的盲区。4. 概率流 ODE把随机性拧干之后4.1 概率流 ODE 的推导与直观理解概率流 ODE 的推导思路是在反向 SDE 中随机项 ( g(t)d\bar{w} ) 会引入方差。如果我们想得到一个确定性轨迹同时保持边缘分布不变就需要调整漂移项来补偿随机项带来的扩散。最终得到的 ODE 是[ dx \left[ f(x,t) - \frac{1}{2}g(t)^2 \nabla_x \log p_t(x) \right] dt ]对比反向 SDE你会发现漂移项里少了一个 ( -\frac{1}{2}g(t)^2 \nabla_x \log p_t(x) ) 的因子而且没有随机项。这个 ( \frac{1}{2} ) 的差异来自 Fokker-Planck 方程的推导目的是让 ODE 的边缘分布和 SDE 完全一致。直观上概率流 ODE 描述的是“概率质量流动的速度场”。想象你把一堆沙子从高处倒下SDE 像是每粒沙子都随机抖动地往下落而 ODE 像是沙子的整体流动趋势。虽然每粒沙子的具体路径不同但整体堆积的形状是一样的。这个性质让 ODE 采样有了一个巨大优势你可以用任意高阶数值解法。因为 ODE 是确定性的没有随机噪声干扰Runge-Kutta 4 阶方法可以大幅减少步数。我实测过同样的模型DDIM一阶 ODE50 步换成 Heun 二阶方法 25 步就能达到类似质量再换成更高阶的方法15 步左右就差不多了。4.2 DDIM 与概率流 ODE 的关系DDIM 刚出来的时候论文是从非马尔可夫链的角度推导的看起来和 ODE 没什么关系。但后来大家发现DDIM 的更新公式本质上就是概率流 ODE 的 Euler 离散化。具体来说DDIM 的采样公式[ x_{t-1} \sqrt{\alpha_{t-1}} \left( \frac{x_t - \sqrt{1-\alpha_t}\epsilon_\theta}{\sqrt{\alpha_t}} \right) \sqrt{1-\alpha_{t-1}} \epsilon_\theta ]可以重写成 ODE 的 Euler 步。这个发现让 DDIM 的理论地位一下子清晰了它不是某个孤立的技巧而是连续框架下的一个自然离散化。我一开始用 DDIM 的时候只是觉得它“跳步效果好”但不知道为什么。理解 ODE 视角后我才明白DDIM 的确定性采样实际上是在沿着概率流 ODE 走所以它可以跳步而不破坏分布。而 DDPM 的随机采样是在沿着 SDE 走跳步会破坏随机项的累积效果所以质量下降更明显。4.3 ODE 采样的实操参数与步数选择在实际操作中ODE 采样的步数选择有一个经验法则步数不要低于 20 步否则即使高阶方法也会因为离散误差累积而出现伪影。我试过用 Heun 方法跑 10 步背景会出现轻微的网格状纹理放大看很明显。另一个参数是 ( t ) 的调度。概率流 ODE 在 t 接近 0 和 t 接近 T 时分数函数的变化率差异很大。通常需要在两端加密采样点。比如用余弦调度或者 sigmoid 调度让步长在中间大、两端小。我常用的配置是采样器步数调度质量评价Euler50线性可用细节略糊Heun25余弦接近 1000 步 DDPMDPM-Solver15余弦质量稳定速度快UniPC12自适应目前我用得最多的注意不同模型对步数的敏感度不同。Stable Diffusion 1.5 在 20 步左右就收敛了但一些微调模型可能需要 30 步以上。建议先用 25 步跑一张再降到 15 步对比找到质量拐点。5. 一步生成从 ODE 到一致性模型5.1 一步生成的核心思想学习 ODE 的解映射概率流 ODE 虽然可以加速但本质上还是需要多步迭代。一步生成的目标是训练一个网络直接输出 ODE 从 tT 到 t0 的解。也就是说给定纯噪声 ( x_T )网络直接预测 ( x_0 )不需要任何中间步骤。这个想法听起来很激进但理论上是有依据的。因为概率流 ODE 是确定性的从 ( x_T ) 到 ( x_0 ) 存在一个确定的映射 ( \Phi(x_T) )。如果我们能学好这个映射就能一步出图。问题在于这个映射非常复杂直接回归很难训好。一致性模型Consistency Model的思路是不直接学 ( \Phi )而是学一个函数 ( f_\theta(x_t, t) )使得对于 ODE 轨迹上的任意两点 ( x_t ) 和 ( x_{t} )都有 ( f_\theta(x_t, t) f_\theta(x_{t}, t) )。也就是说网络把轨迹上的所有点都映射到同一个起点 ( x_0 )。这个性质叫自一致性。训练时你从 ODE 轨迹上采样两个相邻点让网络的输出一致。这样网络就学会了“沿着轨迹往回跳”的能力。采样时从 ( x_T ) 出发直接调用 ( f_\theta(x_T, T) )就得到 ( x_0 )。5.2 一致性蒸馏与一致性训练的区别一致性模型有两种训练方式一致性蒸馏和一致性训练。蒸馏需要一个预训练的扩散模型作为教师用教师的 ODE 轨迹来指导学生学习。训练时学生网络在轨迹上取点目标是让相邻点的输出一致。蒸馏的好处是质量高因为教师模型已经训好了坏处是需要额外的教师模型训练成本高。一致性训练则不需要教师模型直接从数据出发训练。它利用一个巧妙的性质如果网络满足自一致性那么它自动定义了一个 ODE 的解。训练目标是让网络在相邻时间步的输出一致同时保证在 t0 时输出真实数据。这种方式更简洁但训练稳定性差一些需要仔细调参。我试过一致性蒸馏的简化版用一个小模型做教师学生模型在 4 步内就能出可用的图。但一步出图的质量还是差一些细节会有模糊。后来看到 LCMLatent Consistency Model的工作它在潜空间做一致性蒸馏质量提升很明显一步出图已经能看了。5.3 一步生成的现状与局限一步生成目前还在快速发展中。LCM 和 SDXL-Turbo 是做得比较成熟的例子前者在潜空间做一致性蒸馏后者用对抗训练加蒸馏。我实测 LCM 在 4 步左右质量最好1 步也能出图但细节损失明显。SDXL-Turbo 的 1 步效果更好但模型更大推理成本不低。局限主要有两个一是多样性下降。因为 ODE 是确定性的一步生成把随机性完全去掉了同一个噪声输入只能出一个结果。如果你想生成多个不同样本需要换噪声种子。二是复杂场景的细节丢失。一步生成在简单主体上表现不错但遇到多物体、复杂纹理的场景还是容易糊。我的建议是如果你追求速度4 步 LCM 是当前比较平衡的选择如果追求质量还是用 20 步左右的 ODE 采样器。一步生成适合快速预览和交互式应用不适合最终出图。6. 实操中踩过的坑与排查技巧6.1 采样发散与数值不稳定最常见的问题是采样过程中图像变成彩色噪点或纯色块。原因通常是步长太大Euler 方法在分数函数变化剧烈的地方失稳。解决办法有三个一是减小步长增加步数二是换用高阶方法比如 Heun 或 DPM-Solver三是检查噪声调度确保 ( \beta(t) ) 在两端不要变化太快。我遇到过一次用自定义的线性调度在 t 接近 0 时 ( \beta(t) ) 降得太快导致最后几步的分数函数估计不准图像边缘出现彩色条纹。后来换成余弦调度问题消失。这个坑让我明白调度函数的设计比采样器选择更重要。6.2 分数函数估计偏差的排查如果你发现生成的图像整体偏暗或偏亮可能是分数函数的尺度有问题。检查方法是在固定噪声输入下比较不同 t 时刻的预测 ( \epsilon_\theta )。如果 ( \epsilon_\theta ) 的方差随 t 变化异常说明训练时的噪声调度和采样时的调度不一致。另一个排查点是条件与非条件的混合。如果你用了 classifier-free guidanceguidance scale 太大会导致分数函数被过度放大图像出现过饱和。我通常把 scale 设在 7 到 12 之间超过 15 就容易出问题。6.3 一步生成模型的调参经验一步生成模型对训练超参非常敏感。学习率太大会导致自一致性损失震荡太小则收敛慢。我试过用 1e-4 的学习率配合 cosine 退火效果比较稳。Batch size 建议不低于 64太小的话一致性约束不够强。还有一个技巧在训练初期用较多的步数比如从 4 步开始逐渐降到 1 步。这样网络先学会多步一致性再压缩到一步比直接训一步更稳定。这个策略在 LCM 的论文里也有提到我实测确实有效。问题现象可能原因排查方法解决措施图像彩色噪点步长过大减小步长重试换高阶采样器边缘彩色条纹调度两端变化太快检查 β(t) 曲线换余弦调度整体偏暗/偏亮分数函数尺度偏差比较不同 t 的 ε 方差重新训练或调 guidance一步生成模糊一致性约束不足检查 batch size增大 batch 或加蒸馏损失采样速度慢步数过多测质量拐点换 DPM-Solver提示排查采样问题时先用固定种子跑一张小图比如 256x256这样迭代快容易定位问题。不要一上来就跑 1024x1024浪费时间。7. 我对这条技术路线的个人体会从离散 DDPM 到连续 SDE再到概率流 ODE 和一步生成这条线索走下来我最大的感受是连续时间框架不是炫技而是把问题变简单了。离散视角下每个采样器都像是一个独立的发明你需要记不同的公式和参数。连续视角下它们都是同一个 ODE 或 SDE 的不同数值解法你只需要理解一条主线索剩下的都是工程选择。另一个体会是ODE 和 SDE 不是对立的而是互补的。SDE 采样保留了随机性适合需要多样性的场景ODE 采样确定性强适合加速和一步生成。实际应用中你可以根据需求灵活切换。比如做创意生成时用 SDE做批量出图时用 ODE。最后分享一个小技巧如果你在调采样器时不确定选哪个先用 DPM-Solver 跑 20 步作为基准然后尝试降到 15 步、12 步观察质量变化。大多数模型在 15 步左右就能达到可用质量再低就需要换一致性模型了。这个流程我用了很多次基本能快速找到速度和质量的平衡点。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

汇川H5U程序框架搭建指南:任务配置、变量规划与轴控制 2026/9/26 17:17:25

汇川H5U程序框架搭建指南:任务配置、变量规划与轴控制

这两年用汇川H5U做了几条产线的控制改造,说实话,第一次在InoProShop里看到那个工程树时,我愣了一下——这跟以前用日系PLC的习惯完全不一样。H5U是汇川面向中端设备控制推出的PLC,支持多任务、多轴同步和EtherCAT总线,…

阅读更多 →
微服务API网关设计指南:路由、限流与灰度实践 2026/9/26 17:17:18

微服务API网关设计指南:路由、限流与灰度实践

微服务架构拆得越细,前端调用就越乱。几十个服务各自暴露一堆接口,客户端要记地址、管鉴权、处理重试,这个月加个服务改一下配置,下个月升级个服务又要调超时参数,光是联调就能把人磨到没脾气。API网关这个组件&#x…

阅读更多 →
Flink双流联结实战:Interval Join原理与订单支付对账案例 2026/9/26 17:17:18

Flink双流联结实战:Interval Join原理与订单支付对账案例

接到双流对账需求那天,我盯着需求文档看了十分钟,脑子里还在想“这不会是让我把两条流拉到一张表里join吧”。等真正动手写了代码,才发现Flink的双流联结远不止一个join那么简单。尤其是“基于时间的合流”,既要考虑两条流各自的乱…

阅读更多 →
Stitch:从“AI随机发挥”到“精准输出”的UI生成实战指南 2026/9/26 17:17:18

Stitch:从“AI随机发挥”到“精准输出”的UI生成实战指南

做前端和做UI设计的这两年,多多少少都被AI生成结果气到过。你写一句“做一个仪表盘”,它真敢给你一整屏蓝紫色渐变卡片,指标倒是齐,但配色、间距、圆角、字体层级全在你审美底线附近疯狂试探,这种体验用一个词总结就是…

阅读更多 →
微服务架构下API网关设计核心要点:路由、限流、高可用选型与踩坑实践 2026/9/26 17:17:18

微服务架构下API网关设计核心要点:路由、限流、高可用选型与踩坑实践

微服务架构做了几年之后,我越来越觉得 API 网关是个“越早想清楚越省钱”的组件。很多团队一开始觉得网关就是个反向代理,等服务拆到几十个、几百个的时候才意识到,流量入口那把守得严不严,直接决定了整个架构的稳定性、安全性和排…

阅读更多 →
从WSL开始,用TaoToken统一Key搭建K8s本地实验环境 2026/9/26 17:17:12

从WSL开始,用TaoToken统一Key搭建K8s本地实验环境

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉