Statistical Inference for Differentially Private Stochastic Gradient Descent¶
讲者: Xintao Xia
会场: Federated Learning and Statistical Data Privacy
报告题目: Statistical Inference for Differentially Private Stochastic Gradient Descent
链接: arXiv
来源: JCSDS 2026 · 返回会议总览
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向要解决的根本问题是:如何对差分隐私随机梯度下降(DP-SGD)算法的输出进行有效的统计推断(构造置信区间、假设检验)。当前成熟度:理论框架刚刚建立,但主要针对凸损失和低维参数,且随机子采样规则下的推断理论此前完全空白。
发展脉络¶
-
奠基工作:ASGD 的渐近正态性
- Ruppert (1988); Polyak & Juditsky (1992):证明了平均化 SGD (ASGD) 的迭代均值 \(\bar{\theta}_T\) 是渐近正态的,渐近方差为 \(A^{-1}SA^{-1}\)(\(A\) 为 Hessian,\(S\) 为梯度协方差)。这是所有后续 SGD 推断工作的基石。本文引用其作为“full sample asymptotic variance”的基准。
-
主要进展:非私有 SGD 的统计推断
- Chen et al. (2020a):在循环规则 (cyclic rule) 下,提出了两种估计 ASGD 渐近协方差的方法(plug-in 和 batch-means),从而构造置信区间。本文指出其局限:“apply only when the index \(I_t\) in update (1.1) is selected according to the cyclic rule”。
- Lee et al. (2022):在循环规则下,利用函数中心极限定理 (FCLT) 和随机缩放 (random scaling) 构造渐近枢轴量,避免了协方差矩阵的显式估计。本文同样指出其仅适用于循环规则。
- Su & Zhu (2018); Han et al. (2024); Chen et al. (2022):将 SGD 的分布性质扩展到在线学习、上下文赌博机、去偏推断等场景,但均未涉及随机子采样规则。
-
当前 Frontier:DP-SGD 的隐私分析与算法改进
- Abadi et al. (2016):提出了 DP-SGD 算法和 Moments Accountant 方法,给出了更紧的隐私损失上界。这是本文算法的基础。
- Dong et al. (2022); Bu et al. (2020):引入 Gaussian Differential Privacy (GDP) 框架,证明了 DP-SGD 在温和条件下达到 \(\mu\)-GDP,并给出了一个“private central limit theorem”。本文利用此框架简化了隐私分析。
- Altschuler & Talwar (2022):证明了在只报告最后一步迭代时,DP-SGD 的隐私损失不会随迭代次数无限增长(“more iterations without more privacy loss”)。本文引用此结论来论证 DP-SGD 相比 DP-GD 的优势。
- Avella-Medina et al. (2023):提出了差分隐私梯度下降 (DP-GD) 的统计推断框架(构造 M-估计量的置信区间)。本文将其作为主要对比基线,并指出其隐私误差与迭代次数 \(T_{gd}\) 成正比(\(O_p(\sqrt{T_{gd}}/(n\mu))\)),而 DP-SGD 的隐私误差与 \(T\) 无关(\(O_p(1/(n\mu))\))。
-
本文的位置:本文是首次将统计推断框架从循环规则 SGD 扩展到随机规则 SGD,并进一步推广到 DP-SGD。它填补了“DP-SGD 的渐近分布和统计推断性质”这一空白。
子线索聚类¶
- 非私有 SGD 的统计推断:Chen et al. (2020a), Lee et al. (2022), Su & Zhu (2018), Han et al. (2024), Chen et al. (2022)。核心是研究在循环规则下,如何利用 SGD 迭代序列进行推断。
- DP-SGD 的隐私分析与算法设计:Abadi et al. (2016), Dong et al. (2022), Bu et al. (2020), Altschuler & Talwar (2022), Chourasia et al. (2021), Bassily et al. (2020), Wang et al. (2022)。核心是分析 DP-SGD 的隐私保证、收敛性,并设计更高效的算法。
- 差分隐私下的统计推断:Avella-Medina et al. (2023), Cai et al. (2021), Sheffet (2017)。核心是研究在差分隐私约束下,如何对统计模型(如线性回归、M-估计)进行推断。本文处于第 1 条和第 2 条线索的交汇处,并直接与第 3 条线索中的 DP-GD 方法进行对比。
核心问题与瓶颈¶
- 核心问题 1:在随机子采样规则下,ASGD 的渐近分布是什么?与循环规则有何不同?
- 核心问题 2:DP-SGD 的渐近分布如何分解?隐私噪声、子采样噪声和统计噪声如何相互作用?
- 核心问题 3:如何在不泄露额外隐私的前提下,构造 DP-SGD 参数的有效置信区间?
- 主流方法与瓶颈:现有推断方法(Chen et al., 2020a; Lee et al., 2022)仅适用于循环规则,而 DP-SGD 必须使用随机规则以实现“privacy amplification via sampling”。因此,DP-SGD 的推断理论完全缺失。DP-GD (Avella-Medina et al., 2023) 虽然提供了推断框架,但其隐私误差随迭代次数增长,且需要额外的隐私预算来估计方差。
⚠️ 作者的 framing¶
- 作者将缺口 frame 成什么:作者将现有文献的缺口 frame 成“existing inference results for SGD apply only when the index \(I_t\) is selected according to the cyclic rule”,而“DP-SGD requires randomized subsampling”。因此,建立随机规则下的渐近分布是“a natural question”和“a solid foundation”。这使得本文成为“显然的下一步”。
- 被淡化或回避的竞争路线:作者明确将 DP-GD (Avella-Medina et al., 2023) 作为对比基线,并论证 DP-SGD 在隐私误差上的优势(\(O_p(1/(n\mu))\) vs. \(O_p(\sqrt{T_{gd}}/(n\mu))\))。这实际上是在淡化 DP-GD 路线,强调 DP-SGD 是更优的选择。作者没有深入讨论 DP-GD 在非凸或高维场景下的潜在优势。
- 什么明显该被引 / 该存在、却没出现在 intro 里?:本文主要关注凸损失和低维参数。对于非凸损失(如深度神经网络)下的 DP-SGD 推断,intro 中仅作为未来工作提及。一个值得研究者去查的问题是:是否有工作尝试在非凸设定下对 DP-SGD 进行推断? 例如,一些关于“DP-SGD 的泛化误差”或“DP-SGD 的稳定性”的工作(如 Bassily et al., 2020; Wang et al., 2022)被引用了,但它们并未直接处理推断问题。这暗示了该方向的一个明确空白。
张力¶
未见明显对立引用。所有被引工作基本在各自的设定下(循环 vs. 随机,私有 vs. 非私有)自洽,本文是首次将它们统一在一个框架下。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据交代清楚¶
-
符号:
- \(\theta \in \mathbb{R}^p\):待估参数。
- \(\theta^*\):真值,总体风险 \(L(\theta) = \mathbb{E}[l(Z;\theta)]\) 的唯一最小化点。
- \(l(Z;\theta)\):单个样本 \(Z\) 的损失函数。
- \(\nabla l(Z;\theta)\):损失函数的梯度(\(p\) 维向量)。
- \(\nabla^2 L(\theta^*)=A\):总体 Hessian 矩阵(\(p \times p\)),在 \(\theta^*\) 处评估。
- \(S = \mathbb{E}[\nabla l(Z;\theta^*) \nabla l(Z;\theta^*)^\top]\):梯度协方差矩阵(\(p \times p\))。
- \(\eta_t\):第 \(t\) 步的学习率。
- \(I_t \subset \{1,\dots,n\}\):第 \(t\) 步随机采样的 mini-batch 索引集,大小为 \(m\)。
- \(n\):总样本量。
- \(T\):SGD 总迭代次数。
- \(k = T/n\):epoch 数(平均每个数据被使用的次数)。
- \(\bar{\theta}_T = \frac{1}{T} \sum_{t=1}^T \theta^{(t)}\):ASGD 的迭代均值(输出)。
- \(\xi_t \sim N(0, \sigma_1^2 I)\):DP-SGD 中为保护隐私而添加的独立高斯噪声。
- \(\Delta_g\):梯度 \(\nabla l(Z;\theta)\) 的 \(\ell_2\) 灵敏度上界。
-
模型:
- 数据 \(\{z_i\}_{i=1}^n\) 是来自分布 \(P\) 的 i.i.d. 样本。
- 损失函数 \(L(\theta)\) 是强凸的(Assumption 1),且梯度 \(\nabla l(Z;\theta)\) 的协方差在 \(\theta^*\) 附近光滑(Assumption 2)。
- DP-SGD 中,梯度 \(\nabla l(Z;\theta)\) 的 \(\ell_2\) 范数有界(Assumption 3),或通过梯度裁剪(Section 5)使其有界。
-
可观测数据:
- 可观测:数据集 \(\mathcal{D} = \{z_1, \dots, z_n\}\),以及 SGD 算法产生的迭代序列 \(\{\theta^{(t)}\}_{t=1}^T\)。
- 想要但观测不到:真值 \(\theta^*\),总体 Hessian \(A\),梯度协方差 \(S\)。这些需要通过数据来估计。
第二步:讲最小内核¶
最简特例:线性回归,批大小 \(m=1\),\(T=n\),学习率 \(\eta_t = 1/(2t)\)
- 问题:估计均值 \(\mu\)。损失函数 \(l(x;\theta) = (x-\theta)^2\),数据 \(x_i \sim N(\mu, \sigma^2)\)。
- 循环规则 (Cyclic Rule):SGD 依次遍历每个数据点一次。可以验证,ASGD 的均值 \(\bar{\theta}_{cyc} = \frac{1}{n}\sum_{i=1}^n x_i\),即样本均值。其渐近分布为 \(\sqrt{n}(\bar{\theta}_{cyc} - \mu) \xrightarrow{d} N(0, \sigma^2)\)。
- 随机规则 (Randomized Rule):SGD 每次从 \(\{x_1,\dots,x_n\}\) 中有放回地随机抽取一个样本。经过 \(T=n\) 次迭代后,ASGD 的均值 \(\bar{\theta}_{ran} = \frac{1}{n}\sum_{i=1}^n x_{(i)}\),其中 \(\{x_{(i)}\}\) 是有放回简单随机样本。
- 核心思路:\(\bar{\theta}_{ran}\) 的方差不再是 \(\sigma^2/n\),而是 \(2\sigma^2/n\)。这是因为有放回抽样引入了额外的抽样方差。
- 为什么:样本均值 \(\bar{x}\) 的方差是 \(\sigma^2/n\)。而 \(\bar{\theta}_{ran}\) 的方差可以分解为 \(\text{Var}(\bar{\theta}_{ran}) = \text{Var}(\bar{x}) + \text{Var}(\bar{\theta}_{ran} - \bar{x})\)。其中 \(\bar{\theta}_{ran} - \bar{x}\) 是由于有放回抽样导致的“抽样误差”。可以证明 \(\text{Var}(\bar{\theta}_{ran} - \bar{x}) = \sigma^2/n\),所以总方差为 \(2\sigma^2/n\)。
- 推广:当批大小 \(m>1\),且 \(T = k \cdot n\) 时,方差变为 \(\sigma^2/n \cdot (1 + 1/(km))\)。当 \(k \to \infty\)(即迭代次数远大于样本量),抽样误差项 \(1/(km) \to 0\),渐近方差退化为 \(\sigma^2/n\),与循环规则和全样本估计一致。
这个最小内核揭示了整篇论文的核心数学困难:随机子采样规则下的 SGD,其 ASGD 估计量的方差比循环规则多出一项,该项与 epoch 数 \(k\) 和批大小 \(m\) 成反比。本文的 Theorem 1 就是将这个线性回归特例的结论推广到一般强凸损失函数,并证明了方差膨胀因子为 \((1 + 1/(km))\)。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在随机子采样规则下,非私有 SGD 和差分隐私 SGD (DP-SGD) 的渐近分布,以及如何基于此构造有效的置信区间。
- 核心工具/方法:利用调查抽样 (survey sampling) 技术处理随机子采样带来的依赖,结合函数中心极限定理 (FCLT) 和随机缩放 (random scaling) 方法构造枢轴量。
- 主要结论:建立了随机规则下 ASGD 的渐近正态性,方差膨胀因子为 \((1 + 1/(km))\);证明了 DP-SGD 的渐近方差可分解为统计、子采样和隐私三项;提出了两种有效的置信区间构造方法(plug-in 和 random scaling),并证明了其渐近有效性。
关键设定与假设¶
- Assumption 1 (强凸性与 Hessian):\(L(\theta)\) 是 \(\lambda\)-强凸的,且 \(\nabla^2 L(\theta^*)=A\) 存在。这是保证 ASGD 达到 \(n^{-1/2}\) 收敛速度和渐近正态性的标准条件。
- Assumption 2 (梯度协方差光滑性):梯度 \(\nabla l(Z;\theta)\) 的条件协方差在 \(\theta^*\) 附近是 Lipschitz 连续的。这是为了控制 SGD 迭代的随机波动,是证明渐近分布的关键技术假设。
- Assumption 3 (梯度灵敏度有界):\(\|\nabla l(Z;\theta)\|_2 \leq \Delta_g\)。这是 DP 文献中的标准假设,用于确定添加噪声的尺度 \(\sigma_1\)。本文通过梯度裁剪(Section 5)来保证此条件。
- Assumption 4 (Hessian 和梯度外积的灵敏度有界):\(\|\nabla^2 l(Z;\theta)\|_2 \leq \Delta_A\),\(\|\nabla l(Z;\theta)\nabla l(Z;\theta)^\top\|_2 \leq \Delta_S\)。这是为了在估计方差矩阵时,通过高斯机制添加噪声以满足 DP。
- Assumption 5 (Hessian 的 Lipschitz 连续性):\(\|\nabla^2 l(Z;\theta) - \nabla^2 l(Z;\theta^*)\|_2 \leq L_2 \|\theta - \theta^*\|_2\)。这是为了保证 plug-in 方差估计量的一致性。
- Assumption 6 (梯度裁剪的有效性):\(\sup_{\theta \in \Theta, 1 \le i \le n} \|\nabla l(z_i;\theta) - \nabla L(\theta)\|_2 \le \tau/2\) 以概率趋近于 1。这保证了当估计值接近真值时,裁剪操作不会引入渐近偏差。
- 相比已有文献:Assumptions 1, 2 与 Chen et al. (2020a) 相同。Assumption 3 是 DP 文献的标准假设。Assumption 6 在非私有裁剪 SGD 分析中常用(如 Zhang et al., 2020; Koloskova et al., 2023)。本文的创新在于将这些假设组合起来,并首次在随机子采样规则下进行分析。
主要结果¶
-
Theorem 1 (随机规则 SGD 的渐近分布):
- 陈述:在 Assumptions 1, 2 下,若 \(\eta_t = \eta t^{-\alpha}, \alpha \in (1/2, 1)\),且 \(T = k \cdot n\),\(k \ge c_0\),则 \((1 + 1/(km))^{-1/2} \sqrt{n}(\bar{\theta}_T - \theta^*) \xrightarrow{d} N(0, A^{-1}SA^{-1})\)。
- 直觉:随机子采样导致方差膨胀了 \((1 + 1/(km))\) 倍。增加 epoch 数 \(k\) 或批大小 \(m\) 可以减小此膨胀。
- 必要条件:\(T\) 必须与 \(n\) 成比例(\(k\) 为常数),且 \(k\) 不能太小(\(k \ge c_0\)),以保证 ASGD 达到 \(n^{-1/2}\) 的收敛速度。
- 解决的技术难点:循环规则下,每次迭代处理独立的数据子集,分析相对简单。随机规则下,每次迭代的样本是有放回地从整个数据集中抽取的,导致迭代之间存在复杂的依赖关系。本文通过调查抽样技术(Fuller, 2011)来处理这种依赖。
-
Theorem 2 (DP-SGD 的渐近分布):
- 陈述:在 Assumptions 1-3 下,DP-SGD 的输出满足 \(\sqrt{n}(\bar{\theta}_T - \theta^*) \xrightarrow{d} \phi_{stat} + \phi_{sam} + \phi_{privacy}\),其中三个分量独立,且 \(\phi_{stat} \sim N(0, A^{-1}SA^{-1})\),\(\phi_{sam} \sim N(0, A^{-1}SA^{-1}/(km))\),\(\phi_{privacy} \sim N(0, \sigma_1^2 A^{-2}/k)\)。
- 直觉:DP-SGD 的渐近方差是三项之和:统计方差(全样本估计的方差)、子采样方差(由随机规则引入)、隐私方差(由添加的噪声引入)。
- 必要条件:与 Theorem 1 相同。
- 解决的技术难点:将隐私噪声 \(\xi_t\) 的累积效应与 SGD 的随机波动解耦,并证明它们渐近独立。
-
Corollaries 1-3 (DP 保证与渐近效率):
- 陈述:通过选择合适的噪声尺度 \(\sigma_1\)(依赖于 \(T, n, \epsilon, \delta\) 等),可以保证 DP-SGD 满足 \((\epsilon, \delta)\)-DP, RDP 或 \(\mu\)-GDP。并且,当 \(\sqrt{T}\log(1/\delta)/(n\epsilon) = O(1)\) 等条件满足时,\(\sqrt{n}(\bar{\theta}_T - \theta^*) \xrightarrow{d} N(0, A^{-1}SA^{-1})\),即隐私噪声的渐近影响可以忽略,DP-SGD 与全样本估计一样高效。
- 直觉:通过增加迭代次数 \(T\)(例如 \(T = n^l, 1<l<2\)),可以“稀释”隐私噪声,使其在渐近上不占主导地位。这体现了“more iterations without more privacy loss”的思想。
-
Theorem 3 (Plug-in 置信区间的渐近有效性):
- 陈述:在 Theorem 2 和 Proposition 2 的条件下,基于私有化估计的方差 \(\tilde{V}\) 构造的 Wald 型置信区间 CI\(_\alpha(\theta_j)\) 满足 \(\lim_{n\to\infty} P\{\theta_j^* \in \text{CI}_\alpha(\theta_j)\} = 1-\alpha\)。
- 直觉:只要方差估计量 \(\tilde{V}\) 是相合的,Wald 区间就是渐近有效的。
-
Theorem 4 (随机缩放置信区间的渐近有效性):
- 陈述:在 Theorem 2 和 Corollaries 1-3 的条件下,基于随机缩放统计量 \(\sqrt{n}(\bar{\theta}_{T,j} - \theta_j^*) \hat{V}_{j,j}^{-1/2}\) 构造的置信区间 CI\(_\alpha(\theta_j)\) 满足 \(\lim_{n\to\infty} P\{\theta_j^* \in \text{CI}_\alpha(\theta_j)\} = 1-\alpha\)。
- 直觉:该统计量渐近收敛到一个与未知参数无关的枢轴分布(\(Z \cdot [\int_0^1 \{W(r)-rW(1)\}^2 dr]^{-1/2}\)),因此无需估计方差矩阵即可构造置信区间。
证明路线与技术技巧¶
-
整体路线 (以 Theorem 1 为例):
- 线性化 SGD 更新:将 SGD 更新方程 (1.1) 在 \(\theta^*\) 附近线性化,得到 \(\theta^{(t)} - \theta^* \approx (I - \eta_t A)(\theta^{(t-1)} - \theta^*) - \eta_t \xi^{(t)}\),其中 \(\xi^{(t)}\) 是随机梯度噪声。
- 求解线性递推:求解上述线性递推,得到 \(\bar{\theta}_T - \theta^*\) 的显式表达式,它是随机梯度噪声 \(\xi^{(t)}\) 的加权和。
- 分解方差:将 \(\bar{\theta}_T - \theta^*\) 的方差分解为两部分:一部分来自 \(\xi^{(t)}\) 的条件方差(给定数据 \(\mathcal{D}\)),另一部分来自数据 \(\mathcal{D}\) 本身的随机性。对于随机规则,\(\xi^{(t)}\) 的条件方差比循环规则多出一项,因为每次抽样是有放回的。
- 应用调查抽样技术:利用调查抽样中的方差公式(Fuller, 2011),精确计算出有放回抽样导致的额外方差项,即 \(A^{-1}SA^{-1}/(km)\)。
- 证明渐近正态性:利用鞅差中心极限定理(Martingale CLT)证明 \(\bar{\theta}_T - \theta^*\) 的渐近正态性。
-
关键跳跃点:
- 处理随机子采样带来的依赖:这是最核心的难点。循环规则下,\(\xi^{(t)}\) 是独立的。随机规则下,\(\xi^{(t)}\) 之间以及 \(\xi^{(t)}\) 与数据 \(\mathcal{D}\) 之间存在复杂依赖。作者通过将分析条件于数据 \(\mathcal{D}\),将问题转化为处理有放回抽样的方差,从而绕开了直接处理迭代间依赖的困难。
- 证明 DP-SGD 的方差分解:证明 \(\phi_{stat}, \phi_{sam}, \phi_{privacy}\) 三个分量渐近独立。这需要证明隐私噪声的累积效应与 SGD 的随机波动在渐近上不相关。作者利用了隐私噪声 \(\xi_t\) 与数据 \(\mathcal{D}\) 和 SGD 迭代历史独立这一事实。
-
技术技巧点名:
- 调查抽样 (Survey Sampling):用于计算随机子采样导致的方差膨胀因子。这是本文区别于所有先前 SGD 推断工作的核心技术。
- 函数中心极限定理 (FCLT):用于推导随机缩放统计量的渐近分布(Proposition 3 和 Theorem 4)。
- 鞅差中心极限定理 (Martingale CLT):用于证明 ASGD 估计量的渐近正态性。
- 高斯机制 (Gaussian Mechanism):用于向方差估计量中添加噪声以满足 DP(Proposition 1)。
- Moments Accountant / RDP / GDP:用于分析 DP-SGD 的隐私损失,并确定噪声尺度 \(\sigma_1\)。
真实例子与应用¶
-
模拟实验 (Section 6.1):
- 数据/场景:线性回归和逻辑回归,\(p=3\),协方差矩阵为 Identity 和 Toeplitz 结构。样本量 \(n\) 从 500 到 1500。
- 方法应用:将 DP-SGD 算法应用于这些模型,并使用提出的 plug-in 和 random scaling 方法构造 95% 置信区间。
- 结果:两种方法在有限样本校正后均能达到名义覆盖率。Plug-in 方法的区间长度更短,接近 Oracle 估计器。Random scaling 方法的区间更宽,但无需估计方差矩阵。
- 说明的问题:验证了理论结果(渐近有效性)在有限样本下的表现,并比较了两种方法的优缺点。
-
DP-SGD vs. DP-GD 对比 (Section 6.2):
- 数据/场景:线性回归,\(n=1000\)。
- 方法应用:比较 DP-SGD 和 DP-GD 在不同迭代次数下的 RMSE、覆盖率和区间长度。
- 结果:DP-SGD 的 RMSE 更低且对迭代次数不敏感,覆盖率始终接近名义水平,区间长度随迭代次数增加而减小。DP-GD 的 RMSE 较高,覆盖率远低于名义水平,区间长度随迭代次数增加而增大。
- 说明的问题:实证上证明了 DP-SGD 在推断上的优越性,特别是其“more iterations without more privacy loss”的特性,以及有限样本校正的有效性。
-
真实数据例子 (Section 6.3):
- 数据/场景:STAR 项目数据,评估学术支持服务(SSP, SFP, SFSP)对大一学生 GPA 的影响。\(n=1399\),\(p=6\)(3个处理变量 + 2个辅助变量)。
- 方法应用:使用 DP-SGD 拟合线性模型,并用 plug-in 和 random scaling 方法估计处理效应及其置信区间。
- 结果:两种 DP 方法均得出与 Oracle 估计器一致的结论:SFSP(服务和奖学金组合)的效果最大。Plug-in 方法的区间略宽于 Oracle,反映了隐私保护的成本。
- 说明的问题:展示了所提方法在实际数据分析中的应用价值,并验证了其结论与已有研究(Angrist et al., 2009)一致。
🔎 结论是否比证明窄¶
- Theorem 4 的局限性:Theorem 4 中,随机缩放统计量的渐近分布依赖于一个缩放因子 \(\left( \frac{V_{j,j}}{V_{j,j} + m\sigma_1^2 (A^{-1}_{j,j})^2} \right)^{-1/2}\)。只有在 \(\sigma_1 = o(1)\)(即隐私噪声渐近可忽略)时,该因子才趋近于 1,统计量才收敛到标准的枢轴分布 \(Z \cdot [\int_0^1 \{W(r)-rW(1)\}^2 dr]^{-1/2}\)。作者在有限样本校正(Equation 4.7)中处理了这个问题,但理论上的简化假设(\(\sigma_1 = o(1)\))在实际中可能不成立,特别是当隐私要求非常严格(\(\epsilon\) 很小)时。论文的证明严格限于 \(\sigma_1 = o(1)\) 的情形,而更一般的结论(\(\sigma_1\) 非零)下的枢轴分布形式更复杂,需要额外的估计。
四、开放问题¶
-
扩展到非光滑损失函数:本文假设损失函数是光滑的(Assumption 2)。将结果扩展到非光滑损失(如 hinge loss, absolute loss)是一个自然方向。扎根于 Section 7: “An important direction for future research is to extend our results beyond smooth loss functions.” 以及 Wang et al. (2022) 的工作(该文研究了非光滑损失下 DP-SGD 的泛化界,但未涉及推断)。
-
扩展到非凸损失函数和高维协变量:本文假设损失函数是强凸的。将分析扩展到非凸损失(如深度神经网络)和高维参数空间(\(p \gg n\))是极具挑战性的。扎根于 Section 7: “Another open problem is extending the analysis to non-convex loss functions with potential high-dimensional covariates, such as those arising in deep neural networks.”
-
扩展到零阶优化方法:本文考虑的是基于一阶梯度的 SGD。将推断框架扩展到差分隐私的零阶优化方法(如 Kiefer-Wolfowitz 算法)是一个有趣的方向。扎根于 Section 7: “Our framework can be adapted to differentially private zeroth-order optimization methods, including the Kiefer–Wolfowitz algorithm, to derive asymptotic distributions and inference procedures.”
-
随机子采样 SGD 的渐近分布是否依赖于具体的子采样方案? 本文主要讨论了 SRSWOR 和 Poisson 子采样,并指出两者都兼容。但它们的隐私放大效应和方差结构不同。一个开放问题是:是否存在一种最优的子采样方案,能在给定隐私预算下最小化推断的方差? 这需要更精细地分析不同子采样方案下的方差-隐私权衡。扎根于 Section 3 中关于 SRSWOR 和 Poisson 子采样的讨论:“Intuitively, SRSWOR is more statistically efficient than Poisson subsampling in terms of estimation accuracy. However, Poisson subsampling introduces additional randomness, which in turn offers stronger privacy guarantees compared to SRSWOR.”
Maintained by 陈星宇 · Homepage · Source on GitHub