跳到正文
原文
arXiv· arXiv:2610.00209· Huizhen Huang, Yu Li, Tao Huang, Chen Hou·· 15 小时前

基于差分隐私扩散模型的能源时间序列插补:裁剪感知的目标条件化方法

Energy Time-Series Imputation with Differentially Private Diffusion Models via Clipping-Aware Objective Conditioning

论文速读

防御

据论文 PDF 整理(AI 生成),以原文为准

作者提出时间步感知目标条件化,在固定阈值 DP-SGD 下用 v-prediction 与动态加权做能源时序插补;主设定下相对 ε-prediction 误差更低。

威胁模型训练采用固定阈值 DP-SGD,隐私单元为非重叠窗口;扩散骨干、裁剪阈值、噪声乘子与采样规则在目标变体间保持固定,只改预测目标与时间步加权。

问题
能源时序插补要补回缺失测量,细粒度用电又含敏感时间信息。余弦调度下后期低 SNR 的 ε-prediction 易产生过大裁剪前梯度,固定阈值 DP-SGD 裁剪后优化信号变弱。
方法
在固定 DP-SGD 机制下只改去噪目标:用 v-prediction 作目标重参数化,静态损失加权作均匀缩放对照,并以 λt=ᾱt 的时间步动态加权在裁剪前加强后期低 SNR 衰减。
实验与结果
在 (ε,δ)=(10,10^{-5})、50% 缺失下,v-pred. dynamic 在五个数据集、三种缺失模式的 MSE/MAE/RMSE 均低于 ε-pred.(Table 1)。作者称主要收益来自 v-prediction,动态加权在其上再降误差;裁剪比例仍高于 91%。
局限与可以继续做的
作者指出评测限于余弦调度、固定扩散骨干和文中 DP-SGD 设定,动态加权的增量随训练与任务变化;隐私单元为窗口级。实验覆盖五种能源数据集、三种缺失模式及后缀缺失预测,并与 PatchTST、TimesNet、iTransformer 和调参后的 ε-pred. 比较。
实验设置DiT-style Transformer、PatchTST 等 · ETTh1、ETTm1 等 · MSE、MAE 等
模型
DiT-style TransformerPatchTSTTimesNetiTransformerTimeDiT (ε-pred.)
基准
ETTh1ETTm1ElectricityIndividual Household Electric Power ConsumptionAppliances Energy Prediction
指标
MSEMAERMSEGradp95Gradp99Overall Clipping Fraction
AI 导读全文 235 字

针对能源时间序列缺失值插补,研究提出裁剪感知的目标条件化方法,在固定阈值 DP-SGD 下用 v-prediction 缓解余弦扩散调度后期低 SNR 时间步的梯度放大,并引入扩散调度感知的动态加权在裁剪前加强衰减。在五个真实能源时间序列数据集上,覆盖随机点缺失、连续块缺失、持续中断及多种缺失严重程度,该方法在匹配 DP-SGD 设置下插补效用一致优于 ε-prediction 基线。梯度诊断显示裁剪前梯度范数上尾更低、裁剪比例下降,后期低 SNR 时间步衰减更强。

深度解读

6 个问题,约 11,900 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    固定阈值 DP-SGD 下,后期低 SNR 的 ε-prediction 易被裁剪,作者用目标条件化改善能源时序插补。

    在余弦扩散调度与固定阈值 DP-SGD 下,后期低 SNR 的标准 ε-prediction 会产生过大的裁剪前梯度,裁剪削弱优化信号,从而影响差分隐私能源时序插补的效用。

    • 场景与重要性:作者称能源监测中传感器故障、通信中断、设备故障和信号传输问题会造成缺失(Lotfipoor et al., 2023)。变压器监测、智能电表、负荷监测和建筑能源管理需要插补,而细粒度家庭用电可反映活动与在室模式(Molina-Markham et al., 2010; Razavi et al., 2019)。差分隐私因此被作者视为敏感测量上的训练框架(Dwork and Roth, 2014; Mao et al., 2024)。
    • 现有方法的不足:扩散模型适合条件去噪以重建缺失值(Tashiro et al., 2021; Alcaraz and Strodthoff, 2022; Cao et al., 2024),但在 DP-SGD 下,去噪目标与固定阈值裁剪直接相互作用。作者称目标引起过大的逐样本梯度时,裁剪会削弱其对更新的贡献并可能降低训练效用(Abadi et al., 2016)。余弦调度下后期时间步对应低 SNR(Nichol and Dhariwal, 2021),标准 ε-prediction 更易超过固定裁剪阈值。作者称这一目标–裁剪交互在私有扩散训练中受到的考察有限。
    • 核心观察:作者把该交互表述为固定阈值 DP-SGD 下的目标优化问题:扩散时间步不同于训练迭代;后期低 SNR 时 ε-prediction 放大裁剪前梯度。权重 λt=ᾱt 由调度决定,不依赖私有数据、梯度或 DP 噪声。
    • 提出的方法:作者提出时间步感知目标条件化(timestep-aware objective conditioning):以 v-prediction 作目标重参数化,以静态损失加权作均匀缩放对照,并以调度感知的动态加权在裁剪前对后期低 SNR 做更强衰减。骨干、优化器、掩码、裁剪与噪声机制和采样规则在目标变体间保持固定。
    • 威胁模型:
      • 目标:在差分隐私约束下训练条件扩散模型,恢复掩码位置的能源时序值,并保持插补效用。
      • 隐私机制:训练使用固定阈值 DP-SGD,先把逐样本梯度裁剪到阈值 C,再加高斯噪声(式 (2))。主设定为 (ε, δ)=(10, 10^{-5});敏感性分析另含 ε∈{6, 8}。
      • 隐私单元与能力:序列切成不重叠窗口,每个窗口是独立训练记录;隐私单元在窗口级,不做跨窗口记录聚合。条件为 c=(x0⊙m, m),任务是掩码值插补。
      • 攻击者知识:论文未把该设定写成 no-box、black-box 或 white-box 攻击;比较的是同一 DP-SGD 机制下的去噪目标变体,而非对已部署系统的查询攻击。
  2. 有哪些相关研究?

    作者把本文放在私有扩散训练、扩散目标设计与能源时序隐私三者的交界,并称该交界刻画不足。

    私有扩散优化

    • DP-SGD(Abadi et al., 2016):深度学习中的差分隐私常用固定阈值梯度裁剪再加校准噪声;超过阈值的梯度在加噪前被缩放,裁剪前梯度范数分布影响私有训练中可用的优化信号。
    • DPDM、DP-Promise、DP-LoRA(Dockhorn et al., 2022; Wang et al., 2024; Tsai et al., 2025):分别研究差分隐私下的扩散模型训练、面向图像合成的私有扩散概率模型,以及扩散模型的参数高效私有微调。作者称这些工作说明差分隐私训练扩散模型在多种生成与适配设定下可行,并促使进一步考察 DP-SGD 下的优化行为。作者指出后期低 SNR 的目标–裁剪交互在私有扩散训练中考察有限。

    目标参数化与加权

    • CSDI、SSSD 及相关掩码重建(Tashiro et al., 2021; Alcaraz and Strodthoff, 2022; Cao et al., 2024):条件扩散用于时序插补与插值,作者称其主要关注插补质量,而未明确刻画 DP-SGD 裁剪下的优化行为。
    • ε-prediction、v-prediction 与 Min-SNR 加权(Ho et al., 2020; Salimans and Ho, 2022; Hang et al., 2023; Karras et al., 2022):标准训练常用 ε-prediction;v-prediction 可改善训练稳定性与样本质量;Min-SNR 等损失加权改变非私有训练中各时间步的相对贡献。作者称这些策略对固定阈值 DP-SGD 裁剪前梯度的影响仍待刻画。

    能源时序插补与隐私

    • 缺失来源与隐私风险(Lotfipoor et al., 2023; Molina-Markham et al., 2010; Razavi et al., 2019):能源监测会因传感器与通信问题缺测;智能电表可揭示家庭活动,居民用电曲线可用于推断在室模式。作者称准确插补与隐私感知学习都是实际能源数据分析的要求。
    • 能源扩散恢复与隐私机制:作者称近期基于扩散的方法通过建模时间依赖和条件生成改善了能源相关时序恢复,而能源隐私研究主要关注泄露风险与隐私保护机制。作者指出扩散目标优化与固定阈值 DP-SGD 裁剪在能源时序恢复中的交互受到的关注有限。

    基线方法与基准

    • 基线包括同一骨干上的 ε-pred.、ε-pred. dynamic、v-pred. unweighted、静态加权 λ∈{0.6, 0.9},以及外部架构 PatchTST(Nie et al., 2022)、TimesNet(Wu et al., 2022)、iTransformer(Liu et al., 2023)和 TimeDiT 的 ε-prediction 基线(Cao et al., 2024)。另有按验证损失调 C、学习率与检查点的 tuned ε-prediction。
    • 基准/数据集为 ETTh1、ETTm1(Zhou et al., 2021)、Electricity(Trindade, 2015)、Individual Household Electric Power Consumption(Hebrail and Berard, 2012)和 Appliances Energy Prediction(Candanedo et al., 2017)。外部比较遵循 TimeDiT 的随机掩码插补设定,在 ETTh1、ETTm1、Electricity 上做 50% 随机点缺失。

    作者把本文定位为上述三个方向的交界:余弦调度扩散目标如何在固定阈值 DP-SGD 下塑造裁剪前梯度,以及该行为与恢复效用的关系;并称这一交界仍刻画不足。

  3. 论文如何解决这个问题?

    固定 DP-SGD 机制,只把去噪目标改成 v-prediction 加 λt=ᾱt 的时间步动态加权。

    作者在固定裁剪与加噪机制下,只改预测目标与时间步加权,提出 timestep-aware objective conditioning。

    问题设定与 DP-SGD

    • 插补任务:x0∈R^{T×D} 为时序片段,二值掩码 m∈{0,1}^{T×D} 标出已观测位置。模型以 c=(x0⊙m, m) 为条件,重建 (1−m)⊙x0。序列切成不重叠窗口,每窗为一条独立 DP-SGD 记录,隐私单元在窗口级。
    • 余弦前向过程:xt=√ᾱt x0+√(1−ᾱt) ε,ε∼N(0,I)(式 (1))。ᾱt 为信号保留系数的累积乘积。作者称余弦调度下后期 ᾱt 下降,对应低 SNR;Figure 1 画出累积乘积随扩散时间步下降,以及一条示意性逆信号趋势在对数刻度上上升,阴影标出后期低 SNR 区域,横轴为 Diffusion timestep (t),约 0 到 1000。
    • 裁剪:对记录 i,gi=∇θLi 为裁剪前梯度。g̃i=gi·min(1, C/∥gi∥2)(式 (2))。∥gi∥2>C 时按 C/∥gi∥2 缩放。作者称阈值与噪声固定时,改去噪目标是在裁剪前调节梯度的途径。

    目标重参数化与动态加权

    • v-prediction:标准目标 Lε=E∥ε−εθ(xt,t,c)∥2^2。作者改为 v=√ᾱt ε−√(1−ᾱt) x0,并优化 Lv=E∥v−vθ(xt,t,c)∥2^2。作者称这改变去噪目标表示,更适合后期低 SNR。
    • 动态加权:Ldynamic=E[λt∥v−vθ(xt,t,c)∥2^2],λt=ᾱt(式 (3))。后期 ᾱt 较小,因而衰减更强。权重在调度固定后是确定的,不依赖私有数据、梯度或 DP 噪声实现。作者选择 λt=ᾱt,因为它已决定前向过程中的保留信号水平。
    • 四配置分解:L(y,wt)=E[wt∥y−fθ^{(y)}(xt,t,c)∥2^2],y∈{ε,v},wt∈{1, ᾱt}(式 (4))。四个配置为无加权 ε-prediction、带动态加权的 ε-prediction、无加权 v-prediction、带动态加权的 v-prediction。静态损失加权作为均匀缩放对照,在渐进消融中取 λ∈{0.6, 0.9},与动态加权分开考虑。

    局部梯度分析

    • 命题 1:对 Lw,i(t)=λt ℓi(t),λt∈(0,1] 且与 θ 无关,∇θLw,i(t)=λt∇θℓi(t),因而范数同样被 λt 缩放。静态加权是均匀缩放;动态加权 λt=ᾱt 在后期更强。证明见 Appendix G。
    • 命题 2:加权样本被裁剪当且仅当 ∥gi(t)∥2>C/λt。因为 λt∈(0,1],C/λt≥C,所以加权后超过 C 的概率不高于未加权梯度超过 C 的概率。实际阈值 C 不变,变的是未加权梯度尺度上的有效边界;λt=ᾱt 时该效应在后期最强。
    • 推论 1:裁剪失真 dC(g)=∥g−g̃∥2=(∥g∥2−C)+,由超出阈值的量决定。作者因此用高分位裁剪前梯度范数和总体裁剪比例作诊断。分析局限于固定模型状态、单条私有记录和单个扩散时间步,不刻画独立训练的目标变体之间的全局动力学。

    训练、骨干与成功判定

    • 骨干与超参:DiT 风格 Transformer,AdaLN-Zero 条件化;8 个 DiT block,隐藏维 256,8 头自注意力,时间步嵌入为 256 维正弦加 MLP,可训练参数约 7.5M(Table B.10)。学习率 10^{-4},AdamW,训练 100,000 步,扩散步 T=1000,C=1.0,噪声乘子 σ=1.5,主 DP-SGD 为 (ε, δ)=(10, 10^{-5})(Table B.11)。批大小:ETTh1、ETTm1、Household、Appliances 为 32,Electricity 为 16。
    • 数据与窗口:各数据集按时间 70%/10%/20% 划分训练、验证、测试。按通道用训练集统计做 min–max 归一化,参数固定后用于验证与测试。ETTh1、ETTm1、Household、Appliances 的窗口长度与步长为 96,Electricity 为 192。Electricity 保留全局单通道并以 MT_369 为固定评测传感器。Household 目标为 Global_active_power,保持一分钟分辨率,子集内对内部缺失做线性插值,去掉首尾缺失,线性插值点不作为评测目标。Appliances 使用 Appliances,十分钟分辨率,不再重采样。
    • 推理与指标:每个评测条件用 DDIM、50 步推理生成 30 个扩散样本,以样本中位数为点预测;归一化空间裁到 [0, 1] 再反变换。MSE、MAE、RMSE 只在掩码位置(预测则只在预测视野)上计算。检查点按同一验证规则选取验证表现最好者。主结果对种子 42、43、44 取平均。
  4. 论文做了哪些实验?

    五数据集、匹配 DP-SGD 下,v-pred. dynamic 的插补与预测误差低于 ε-pred.,裁剪比例仍高于 0.91。

    实验设置

    • 被测模型:核心比较共用约 7.5M 参数的 DiT 风格扩散骨干,变体为 ε-pred.、ε-pred. dynamic、v-pred. unweighted、v-pred. static(λ=0.6 或 0.9)、v-pred. dynamic。外部基线为 PatchTST、TimesNet、iTransformer 和 TimeDiT(ε-pred.)。另有按验证损失选择 C、学习率与检查点的 tuned ε-pred.。
    • 数据集与缺失:ETTh1、ETTm1、Electricity、Household(Individual Household Electric Power Consumption)、Appliances Energy Prediction。插补含随机点缺失、连续块缺失和持续中断,缺失率 10%、20%、30%、50%。后缀缺失预测视野 H∈{24, 48, 72},复用插补训练的检查点,只改评测掩码。论文未在正文给出各数据集样本条数。
    • DP-SGD:主设定 (ε, δ)=(10, 10^{-5}),C=1.0,σ=1.5。敏感性分析在匹配设定上取 ε∈{6, 8};外部基线另报 ε=8 与 ε=10。论文写明核心变体共享骨干、掩码、优化器、训练步数、采样、裁剪阈值、噪声乘子和检查点规则。
    • 指标与重复:反变换后计算 MSE、MAE、RMSE,插补只在掩码位置、预测只在视野上。结果为种子 42、43、44 的平均。梯度诊断用训练最后 20% 迭代中、裁剪前逐样本全参数梯度范数的 Mean、Median、Gradp95、Gradp99,以及超过 C=1.0 的 Overall Clipping Fraction。
    • 推理:每条件 30 个 DDIM 样本、50 步,取中位数。Figure 2 的曲线来自固定检查点上的合成归一化批次,用于示意目标引起的缩放,训练期诊断以 Table 4 为准。

    主结果

    Table 1 在 50% 缺失、(ε, δ)=(10, 10^{-5})、三种子平均下比较 ε-pred. 与 v-pred. dynamic。下表摘录 MSE(越低越好)。

    表格较宽,可左右滑动

    数据集随机点 ε / dynamic连续块 ε / dynamic持续中断 ε / dynamic
    ETTh11181.36 / 9.12867.77 / 27.91941.54 / 20.28
    ETTm11173.89 / 8.831051.89 / 18.841070.37 / 29.45
    Electricity2415.27 / 32.882173.88 / 31.832113.45 / 25.67
    Household61.79 / 0.2567.11 / 0.3863.03 / 0.38
    Appliances417812.50 / 53959.11485956.25 / 38401.84505110.42 / 17996.79

    据 Table 1。MAE 与 RMSE 同表,15 个数据集–模式组合上 v-pred. dynamic 的三项误差都更低。例如 ETTh1 随机点 MAE 从 29.61 到 2.36、RMSE 从 34.37 到 3.02;Appliances 持续中断 MAE 从 551.88 到 81.65、RMSE 从 710.71 到 134.15。

    • 作者解读:作者称效用提升出现在时间结构不同的三种缺失上,且两变体处于同一匹配 DP-SGD 训练与评测条件,因此 Table 1 显示的是共享扩散框架内相对标准 ε-prediction 的插补效用改进。
    • 作者解读:第 4.3 节再把目标重参数化与动态加权拆开,并与裁剪前梯度行为对照。

    目标消融与分解

    • 渐进消融(Table 2):50% 缺失、同一 (ε, δ)=(10, 10^{-5})。作者称把 ε-prediction 换成无加权 v-prediction 后,所报告的 ETTh1、ETTm1、Appliances 及三种缺失上 MSE 与 MAE 都下降,并称目标重参数化提供了所评变体中的主要效用收益。静态 λ=0.6 或 0.9 有时低于无加权 v-prediction,有时更高,例如 ETTh1 连续块 MSE:无加权 29.80,λ=0.6 为 49.30,λ=0.9 为 35.68,dynamic 为 27.91。作者称单一系数的均匀缩放不能稳定适应时间步依赖特征。v-pred. dynamic 在 Table 2 报告的九个数据集–模式上 MSE 与 MAE 最低。Table 2 未列出 Electricity 与 Household。
    • 分解(Table 3):在三种缺失、四种缺失率共 12 个插补条件上,报告平均 MSE/MAE 的相对降幅(%),正值表示误差下降。ε-pred. 加上动态加权:ETTh1 为 3.34/2.59,ETTm1 为 -6.88/-5.25,Electricity 为 0.57/0.56,Household 为 12.04/11.26,Appliances 为 -19.12/-15.13。换成无加权 v-prediction:五数据集 MSE 相对降幅 91.32%(Appliances)至 99.13%(Household),MAE 为 75.14% 至 90.95%。在 v-prediction 上再加动态加权:MSE 相对降幅 8.69%(Appliances)至 50.09%(ETTm1),MAE 为 12.05% 至 34.02%。作者称动态加权单独加在 ε-prediction 上效果不一致,重参数化是主要来源,动态加权在重参数化之后于主设定上再提供收益。

    梯度诊断

    • Figure 2:纵轴 Gradient norm(对数刻度,标注自 10^{-9} 到 10^9),横轴 Diffusion timestep (t) 从 0 到 1000。图例为 ε-pred.、v-pred. unweighted、v-pred. dynamic,虚线为 C=1.0,阴影为后期低 SNR。作者称 ε-prediction 在后期低 SNR 区域梯度增长明显,无加权 v-prediction 在该区域幅度更小,v-pred. dynamic 向后期的衰减最强,与 λt=ᾱt 一致。图注写明曲线由固定检查点上的合成归一化批次计算,用于可视化缩放趋势;训练期数字在 Table 4。图中未标注各曲线的端点数值。
    • Table 4:最后 20% 训练迭代、C=1.0。ETTh1 上 ε-pred. 的 Mean/Median/Gradp95/Gradp99/裁剪比例为 7.982/3.168/15.290/38.901/1.000;无加权 v-pred. 为 4.526/3.043/9.660/13.836/1.000;dynamic 为 3.683/1.943/8.233/12.730/0.944。ETTm1 的裁剪比例从 ε-pred. 与无加权的 1.000 降到 dynamic 的 0.948;Appliances 从 1.000 降到 0.917,Gradp99 从 128.333(ε-pred.)到 127.709(无加权)再到 105.080(dynamic)。作者称无加权 v-prediction 降低了三个数据集上的高分位范数,但裁剪比例仍为 1.000;dynamic 进一步降低范数并降低裁剪比例,同时总体裁剪比例仍高于 91%,阈值超出仍然频繁。
    • 受控梯度诊断:固定已训练的 v-prediction 检查点、输入、掩码、扩散噪声和时间步,只把 λt=1 改为 λt=ᾱt。作者称在 ETTh1、ETTm1、Appliances 上,t=0–99 箱的中位数梯度衰减约为 0.8%–1.1%,t=900–999 箱约为 98.5%–99.1%,并称这支持命题 1 的时间步选择性缩放。细节在 Appendix I。Table 4 未包含 Electricity 与 Household。

    缺失严重度、预测与外部基线

    • 缺失率(Table 5):同一主 DP-SGD,测试时缺失率 10%–50%,检查点与其余协议固定。MAE 为三种缺失模式的平均。五个数据集、四个缺失率共 20 组中,v-pred. dynamic 的平均 MAE 最低。例如 ETTh1 在 10%/50%:ε-pred. 为 24.68/25.72,无加权为 3.15/4.00,dynamic 为 2.35/3.48;Appliances 为 453.00/550.69、110.00/142.62、104.98/120.44。作者称动态加权相对无加权 v-prediction 的优势在所评缺失率上保持。
    • 后缀缺失预测(Table 6):同一主设定,误差只在视野上计算。两个 v-prediction 变体在五数据集、H=24/48/72 的 MSE 与 MAE 上都低于 ε-pred.。v-pred. dynamic 在全部 15 个数据集–视野组合上 MSE 与 MAE 最低。例如 ETTh1、H=72 的 MSE:ε-pred. 885.18,无加权 45.55,dynamic 26.58。作者称重参数化的效用改进在该评测设定下保持,动态加权在主设定上再有改进;该扩展不引入单独的预测架构或预测专用训练目标。
    • 外部基线(Table 7):50% 随机点缺失,ε=8 与 ε=10,数据集为 ETTh1、ETTm1、Electricity。协议内预处理、归一化、掩码与评测相同。Ours(v-pred. dynamic)在六个数据集–配置上 MSE 与 MAE 最低。ε=10 的 MSE:PatchTST 为 3348.61/1963.74/2516.32,TimesNet 为 2273.45/1130.65/3214.54,iTransformer 为 4341.34/2968.12/3457.21,TimeDiT(ε-pred.)为 1181.36/1173.89/2415.27,Ours 为 9.12/8.83/32.88(顺序为 ETTh1、ETTm1、Electricity)。ε=8 时 Ours 的 MSE 为 16.08/36.58/17.99。Household 与 Appliances 未出现在 Table 7。作者称优势同时相对 TimeDiT ε-prediction 与三个非扩散架构出现;目标重参数化与动态加权的贡献由第 4.3 节的受控比较分析。
    • 调参后的 ε-pred.(Table 8):在 ETTh1、ETTm1、Appliances 上按验证损失选 C、学习率与检查点。三数据集选出的 C 均为 1;学习率 ETTh1 与 Appliances 为 3×10^{-5},ETTm1 为 1×10^{-4};最佳验证损失分别为 0.203965、0.217985、0.180863;检查点步数为 87000、99000、87000。在主设定 (ε, δ)=(10, 10^{-5}) 下,调参后的 ε-pred. 在所报 12 组数据集–条件的 MAE 与 RMSE 上都低于原始 ε-pred.。无加权 v-prediction 在随机点、连续块、持续中断(对 10%–50% 平均)和后缀预测(对 H∈{24,48,72} 平均)的每一比较中 MAE 与 RMSE 最低。例如 ETTh1 随机点 MAE:调参 ε 25.53,原始 ε 29.42,无加权 v 3.15。作者称验证调参持续加强了 ε-prediction 基线,重参数化相对标准 ε-prediction 的优势在更强基线调参后仍然保持。Table 8 比较的是无加权 v-prediction,不是 v-pred. dynamic。

    其他消融与分析

    • Appendix D 全量插补:Table D.12 在五数据集、三种缺失、10%–50% 上比较 ε-pred.、无加权 v-pred. 与 dynamic 的 MSE/MAE。作者称 dynamic 在 60 个数据集–模式–缺失率组合上 MSE 最低;MAE 在 59/60 上最低,唯一例外是 ETTh1、持续中断、30%,无加权 MAE 3.56,dynamic 为 3.58。
    • ε∈{6,8,10}(Table H.16):附录 H 在 ETTh1、ETTm1、Appliances 上、50% 缺失、三种子平均,比较同一目标变体。作者称在 27 个数据集–模式–ε 组合上,v-pred. dynamic 的 MSE 与 MAE 都低于 ε-pred. 和无加权 v-pred.。例如 ETTh1 随机点、ε=6 的 MSE:ε-pred. 1248.73,无加权 28.41,dynamic 12.06。
    • 静态加权全条件(Table F.14):Appendix F 在 12 个插补条件的平均 MSE/MAE 上,v-pred. dynamic 低于 λ=0.6 与 λ=0.9。逐条件时,60 个 MSE 比较中 dynamic 有 59 个更低;Appliances、随机点、10% 上 λ=0.6 的 MSE 为 38842.17,dynamic 为 40112.63。MAE 上 dynamic 在 56/60 更低;四个例外里 dynamic 更高,作者称这些例外的 MAE 差为 0.01–0.22,对应 MSE 仍更低。
    • ε-pred. 加动态加权(Table F.15):12 条件平均 MSE/MAE 的相对变化为 ETTh1 +3.34%/+2.59%,ETTm1 -6.88%/-5.25%,Electricity +0.57%/+0.56%,Household +12.04%/+11.26%,Appliances -19.12%/-15.13%(正号为相对 ε-pred. 变好)。逐条件:60 个 MSE 比较中 28 个变好、32 个变差;60 个 MAE 比较中 27 个变好、33 个变差。
    • 种子(Appendix C):Table C.13 给出 ETTh1、ETTm1、Appliances 在 50% 缺失下三种子的 MAE 均值±标准差。例如 ETTh1 随机点:ε-pred. 29.61±0.84,dynamic 2.36±0.07。作者称各子结果保持 Table 1 的排序,且 v-pred. dynamic 在九个组合上 MAE 标准差更低。
    • 受控梯度分箱(Table I.17):固定 v-prediction 检查点,中位数梯度衰减在 t=0–99 为 ETTh1 1.082%、ETTm1 0.947%、Appliances 0.813%;t=900–999 为 99.072%、98.814%、98.534%。ETTh1 的 Gradp95 衰减从 t=0–99 的 0.794% 增至 t=900–999 的 99.116%。
  5. 有什么可以进一步探索的点?

    作者写出评测限于余弦调度、固定骨干和文中的 DP-SGD 设定,动态加权增量随设定变化。

    作者指出的局限与后续方向

    • 调度、骨干与 DP-SGD 设定:当前评测使用余弦扩散调度、固定扩散骨干,以及本文考虑的匹配 DP-SGD 配置(第 6 节 Limitations)。
    • 动态加权的增量不稳定:时间步感知动态加权带来的增量收益随训练配置和任务设定变化(第 6 节)。
    • 后续评测范围:作者写未来评测应考虑更多扩散骨干与调度、其他私有优化设定、更广的时间步感知加权策略,以及专门的时序插补基线(第 6 节)。
    • 隐私单元:本研究采用窗口级隐私单元,不重叠窗口被当作独立训练记录(第 6 节)。

    实验覆盖范围

    • 数据与任务:插补评测覆盖 ETTh1、ETTm1、Electricity、Household、Appliances 共五个数据集,缺失模式为随机点、连续块和持续中断,缺失率为 10%、20%、30%、50%;后缀缺失预测使用同一条件扩散模型与插补检查点,H∈{24, 48, 72}(第 4.1、4.5 节,Table 1、Table 6)。
    • 隐私与重复:主结果使用匹配设定 (ε, δ)=(10, 10^{-5}),C=1.0,σ=1.5;附录 H 另报 ε∈{6, 8} 下 ETTh1、ETTm1、Appliances 的 50% 缺失结果。除非另述,结果为种子 42、43、44 的平均(第 4.1 节,Table B.11,Appendix H)。
    • 梯度:训练期梯度诊断报告 ETTh1、ETTm1、Appliances 在训练最后 20% 迭代的裁剪前范数与总体裁剪比例;受控诊断在这三个数据集上比较 λt=1 与 λt=ᾱt(Table 4,第 4.3.3 节,Appendix I)。
    • 外部与调参比较:Table 7 在 50% 随机点缺失、ε=8 与 ε=10 下比较 PatchTST、TimesNet、iTransformer、TimeDiT(ε-pred.)与本文方法,数据集为 ETTh1、ETTm1、Electricity。Table 8 在 ETTh1、ETTm1、Appliances 上比较验证调参后的 ε-pred. 与无加权 v-pred.。
    • 分析边界:第 3.3 节写明分析限于固定模型状态、单条私有记录和单个扩散时间步,不刻画跨独立训练目标变体的全局训练动力学。论文未报告与人工评分的一致性;效用指标为掩码位置或预测视野上的 MSE、MAE、RMSE。
  6. 总结一下论文的主要内容

    固定阈值 DP-SGD 下,v-prediction 加 ᾱt 加权降低能源时序插补误差,并降低后期低 SNR 的裁剪前梯度。

    作者研究固定阈值 DP-SGD 训练的扩散模型,如何在余弦调度的后期低 SNR 时间步避免 ε-prediction 产生易被裁剪的大梯度,从而做能源时序缺失值恢复。

    • 问题:窗口级隐私单元下,每个不重叠窗口是一条训练记录。裁剪阈值与噪声固定时,去噪目标决定裁剪前梯度。作者称后期 ᾱt 变小,标准 ε-prediction 更易超过阈值 C,优化信号被衰减。
    • 方法:骨干、优化器、掩码、C、噪声乘子和采样保持不变,只改目标。v=√ᾱt ε−√(1−ᾱt) x0 替代 ε;动态损失乘以 λt=ᾱt,静态 λ∈{0.6, 0.9} 作均匀缩放对照。命题 1–2 与推论 1 说明确定性加权会缩放裁剪前梯度范数,并在未加权尺度上提高有效裁剪边界;分析是局部的。
    • 主结果:在 (ε, δ)=(10, 10^{-5})、50% 缺失下,v-pred. dynamic 于五数据集、三种缺失模式的 MSE、MAE、RMSE 均低于 ε-pred.(Table 1)。例如 ETTh1 随机点 MSE 从 1181.36 到 9.12,Household 随机点从 61.79 到 0.25,Appliances 持续中断从 505110.42 到 17996.79。
    • 分解:12 个插补条件上,换成无加权 v-prediction 的平均 MSE 相对降幅为 91.32%–99.13%;再加动态加权为 8.69%–50.09%。动态加权直接加在 ε-prediction 上则有升有降,ETTm1 与 Appliances 的平均 MSE/MAE 变差(Table 3)。Table 4 中 dynamic 把总体裁剪比例从 1.000 降到 ETTh1 0.944、ETTm1 0.948、Appliances 0.917,作者称仍高于 91%。t=900–999 的中位数梯度衰减约为 98.5%–99.1%,t=0–99 约为 0.8%–1.1%。
    • 其他评测:Table 5 的 20 个数据集–缺失率平均 MAE、Table 6 的 15 个数据集–视野,dynamic 均为最低。Table 7 在 ε=8 与 ε=10 的 50% 随机点缺失上,Ours 的 MSE/MAE 低于 PatchTST、TimesNet、iTransformer 和 TimeDiT(ε-pred.)。验证调参加强 ε-pred. 后,无加权 v-prediction 的 MAE/RMSE 仍更低(Table 8)。Appendix D 中 dynamic 的 MAE 有一个例外高于无加权 v-prediction:ETTh1、持续中断、30%(3.58 对 3.56)。
    • 作者结论:作者称裁剪感知的目标条件化可以在固定阈值 DP-SGD 下同时改善裁剪行为与插补效用,目标重参数化是主要来源,动态加权在主设定上提供额外收益,并支持隐私约束下的能源时序恢复。第 6 节同时写明增量收益随训练配置和任务设定变化。
阅读原文arxiv.org