Minimax optimal goodness-of-fit testing for densities and multinomials under a local differential privacy constraint¶
作者: Joseph Lam-Weil, Béatrice Laurent, Jean-Michel Loubes
来源: Bernoulli
主题: 数理统计 / 假设检验
相关性: 7/10
链接: 期刊页 · arXiv
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向研究的是在局部差分隐私(Local Differential Privacy, LDP) 约束下,如何对未知分布进行拟合优度检验(goodness-of-fit testing)。核心问题是:当原始数据被一个随机化机制扰动后才被观测到,我们能否(以及以多快的速率)检验这些未观测的原始样本是否来自一个已知的密度 \(f_0\)?这本质上是将经典的非参数假设检验问题置于一个更强的隐私保护框架下,量化“隐私”带来的统计代价(即样本量的退化)。
该方向目前处于从“估计”向“检验”扩展的阶段。LDP下的估计问题(密度估计、参数估计)已有较成熟的极小化极大最优理论(Duchi-Jordan-Wainwright 系列工作),但检验问题,尤其是非参数拟合优度检验的极小化极大最优性,直到本文才在连续情形(Besov球)上首次建立。
发展脉络(history)¶
奠基工作:差分隐私与局部差分隐私的形式化 - Dwork et al. (2006) [DMNS06]:提出了中心化差分隐私(central differential privacy)的正式定义,核心思想是通过向查询结果添加与“敏感度”成比例的噪声来保护个体隐私。这是整个领域的基石。 - Warner (1965) 及后续工作(如 [AS00, AA01] 等):提出了“随机化响应(randomized response)”等局部隐私机制,即数据在离开用户端之前就被扰动。本文的LDP框架正是这一思想的现代形式化。
主要进展:LDP下的极小化极大估计理论 - Duchi, Jordan & Wainwright (2013, 2016) [DJW13b, DWJ13, DJW18]:这是该子方向最核心的系列工作。他们系统地建立了LDP下的极小化极大估计理论,给出了均值估计、广义线性模型、多项分布概率估计、非参数密度估计等问题的匹配上下界。关键发现是:隐私约束会导致样本量退化,退化因子与隐私预算 \(\alpha\) 和维度 \(d\) 有关(例如,多项分布估计的退化因子为 \(\alpha^2/d\))。这些工作为后续的检验问题提供了下界工具(如Fano、Assouad引理的隐私版本)和上界构造(如随机化响应、Laplace机制)的模板。 - Butucea et al. (2019) [BDKS19]:专门研究了LDP下Besov椭球上的密度估计,发现了“双肘效应(twofold elbow effect)”,即估计速率在 \(p \ge r\) 和 \(p < r\) 时表现不同(\(p\) 是Besov空间的 \(L_p\) 范数参数,\(r\) 是风险范数)。本文的检验问题也涉及Besov球,因此该文是重要的技术参考。
当前Frontier:从估计到检验 - Gaboardi et al. (2016) [GLRV16]:首次在差分隐私(中心化)下研究了卡方拟合优度检验和独立性检验,但他们的检验是基于蒙特卡洛的,且没有给出极小化极大最优性保证。本文将其推进到LDP框架,并追求极小化极大最优。 - Fromont & Laurent (2006) [FL06]:在无隐私约束的经典非参数设定下,提出了基于 \(L_2\) 距离估计的自适应拟合优度检验,并证明了其在Besov球上达到最优检验速率(Ingster速率)。本文的检验统计量正是基于这一经典框架的推广。
本文的位置:本文是第一个在连续情形(Besov球)下,为LDP约束下的拟合优度检验提供极小化极大最优(匹配上下界)的工作。它将Fromont & Laurent的经典检验框架与Duchi等人的LDP下界技术结合,并首次量化了隐私带来的检验速率退化。
子线索聚类¶
- LDP下的极小化极大估计理论:以Duchi, Jordan & Wainwright为核心,建立了估计问题的速率理论。本文的下界证明直接依赖于[DJW13b]的引理,但作者指出直接套用会得到次优速率(Remark 5.3),因此需要更精细的构造。
- LDP下的非参数密度估计:以Butucea et al. (2019)为代表,专门处理Besov空间上的密度估计,揭示了“肘效应”。本文的检验问题在Besov球上展开,其上界构造(Laplace噪声扰动小波系数)与Butucea等人的估计器思路一脉相承。
- 经典非参数拟合优度检验:以Fromont & Laurent (2006)为代表,基于 \(L_2\) 距离估计构造检验,并实现自适应。本文的检验统计量直接继承自这一框架,只是将“基于原始数据的 \(L_2\) 距离估计”替换为“基于扰动后数据的 \(L_2\) 距离估计”。
- 差分隐私下的假设检验:以Gaboardi et al. (2016)为代表,但主要处理中心化差分隐私下的离散检验,且不追求极小化极大最优。本文将其扩展到LDP和非参数连续情形。
这个方向在追问的核心问题¶
- 隐私的统计代价:在LDP约束下,检验的极小化极大分离速率(minimax separation rate)相比无隐私情形退化了多少?退化因子是 \(\alpha^2/d\) 还是其他形式?
- 最优机制与检验的构造:是否存在一个同时满足LDP约束和极小化极大最优性的检验统计量?其构造是否依赖于未知的光滑参数(即是否需要自适应)?
- 离散与连续的统一:多项分布(离散)和密度估计(连续)在LDP下的检验问题能否在一个统一框架下处理?
- 自适应:能否构造一个不依赖于未知光滑参数 \(s\) 的检验,且其最优性仅损失对数因子?
已知瓶颈:下界证明中,直接使用[DJW13b]的通用信息论不等式会得到次优速率(如 \(\alpha^2/n\) 量级),需要针对检验问题的特殊结构(如 \(f_0\) 为均匀分布)设计更精细的构造。上界构造中,Laplace噪声的尺度需要与隐私预算 \(\alpha\) 和样本量 \(n\) 平衡,以最小化对检验功效的损害。
⚠️ 作者的 framing¶
作者的说法:作者将缺口 frame 为“在LDP约束下,非参数拟合优度检验的极小化极大最优性尚未建立,尤其是在连续情形(Besov球)下”。他们声称本文是“第一个”提供匹配上下界的工作,并强调其检验是“极小化极大最优”的。他们将离散情形(多项分布)视为连续情形(分段常数密度)的特例,从而统一了框架。
被淡化或回避的竞争路线: - 中心化差分隐私:作者明确选择LDP(非交互式),回避了中心化差分隐私(trusted curator)的设定。在中心化设定下,隐私代价可能更小,但作者没有讨论这种权衡。 - 交互式LDP:本文只考虑非交互式(non-interactive)LDP,即每个用户只发送一次扰动后的数据。交互式协议(如多次查询)可能获得更好的速率,但作者没有涉及。 - 其他检验统计量:作者只考虑了基于 \(L_2\) 距离的检验。其他距离(如 \(L_1\)、Hellinger、KS距离)在LDP下的表现如何?作者没有讨论。
什么明显该被引/该存在、却没出现在intro里? - Butucea et al. (2019) 虽然被引,但作者没有详细讨论其“双肘效应”对检验问题的影响。检验问题的速率是否也会出现类似的肘效应?这是一个值得研究者去查的问题。 - Gaboardi et al. (2016) 被引,但作者没有对比其中心化差分隐私下的检验与本文LDP下检验的速率差异。这种对比能直观展示LDP的额外代价。 - Ingster (2000) 关于无隐私下非参数检验极小化极大速率的经典工作没有被直接引用(虽然Fromont & Laurent的工作已经隐含了它)。直接引用Ingster的速率公式会更清晰。
张力¶
未见明显对立引用。所有被引工作基本在同一个框架下(极小化极大、LDP、Besov空间)推进,没有出现彼此矛盾或相反结论的情况。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
- 符号:
- \(X_1, \dots, X_n\):未观测的原始样本,i.i.d. 来自未知密度 \(f\)(相对于Lebesgue测度或计数测度)。这是潜在量,研究者永远看不到。
- \(Z_1, \dots, Z_n\):可观测的扰动后样本,\(Z_i\) 是通过一个随机化机制 \(Q(\cdot | X_i)\) 从 \(X_i\) 生成的。这是可观测数据。
- \(f_0\):已知的参考密度,即原假设 \(H_0: f = f_0\) 下的密度。
- \(\alpha \in (0, 1]\):隐私预算。\(\alpha\) 越小,隐私保护越强。本文考虑 \(\alpha\) 随 \(n\) 固定或缓慢衰减的情形。
- \(d\):数据的维度(在离散情形下是类别数,在连续情形下是定义域维数,但本文主要考虑 \(d=1\) 的连续情形)。
- \(s\):光滑参数(Besov空间 \(B^s_{p,q}\) 中的 \(s\)),控制密度 \(f\) 的正则性。
- \(\rho_n\):分离距离(separation distance),即检验能可靠区分 \(H_0\) 和 \(H_1\) 的最小 \(L_2\) 距离。极小化极大分离速率就是 \(\rho_n\) 的最优收敛速度。
-
\(\varepsilon\):Laplace噪声的尺度参数。
-
模型:
- 数据生成:\(X_i \sim f\),\(Z_i \sim Q(\cdot | X_i)\),其中 \(Q\) 是一个满足 \(\alpha\)-局部差分隐私的随机化机制。即对任意 \(x, x'\) 和任意可测集 \(A\),有 \(Q(A|x) \le e^\alpha Q(A|x')\)。
- 本文使用的具体机制:Laplace机制。对于连续情形,\(Z_i = X_i + \xi_i\),其中 \(\xi_i \sim \text{Laplace}(0, \sigma)\),\(\sigma = \Delta / \alpha\),\(\Delta\) 是敏感度(这里 \(\Delta = 2\),因为密度值在 \([0,1]\) 上)。对于离散情形,使用随机化响应(Warner's randomized response)。
- 要估的对象:\(L_2\) 距离 \(\Delta(f, f_0) = \int (f(x) - f_0(x))^2 dx\)。检验统计量基于 \(\Delta(f, f_0)\) 的一个无偏估计。
- 已知量:\(f_0\),隐私预算 \(\alpha\),样本量 \(n\),扰动机制 \(Q\)。
-
要估/检验的对象:\(f\) 是否等于 \(f_0\)。
-
可观测数据:
- 可观测:\(Z_1, \dots, Z_n\)(扰动后的样本),以及 \(f_0\)、\(\alpha\)、\(n\)、\(Q\) 的完整描述。
- 不可观测:原始样本 \(X_1, \dots, X_n\),以及真实密度 \(f\)。
- 识别:由于 \(Z_i\) 的分布是 \(f\) 与 \(Q\) 的卷积(在连续情形下),\(f\) 可以从 \(Z_i\) 的分布中识别,但需要去卷积(deconvolution)技巧。本文通过直接估计 \(f\) 与 \(f_0\) 的 \(L_2\) 距离来绕过显式的去卷积。
第二步:讲最小内核¶
最简特例:离散情形,\(d=2\)(二元多项分布),\(f_0\) 为均匀分布
这是整篇论文思路的最简体现。它同时包含了离散和连续情形的核心逻辑。
- 设定:
- \(X_i \in \{1, 2\}\),服从一个未知的二元分布 \(p = (p_1, p_2)\),其中 \(p_1 + p_2 = 1\)。
- 原假设 \(H_0: p = (1/2, 1/2)\)(均匀分布)。
- 备择假设 \(H_1: p\) 与均匀分布有 \(L_2\) 距离 \(\rho\),即 \(\sum_{j=1}^2 (p_j - 1/2)^2 = \rho^2\)。
- 隐私机制:随机化响应。以概率 \(e^\alpha/(1+e^\alpha)\) 输出真实值 \(X_i\),以概率 \(1/(1+e^\alpha)\) 输出另一个值。即 \(P(Z_i = j | X_i = j) = e^\alpha/(1+e^\alpha)\),\(P(Z_i \neq j | X_i = j) = 1/(1+e^\alpha)\)。
-
可观测数据:\(Z_1, \dots, Z_n\)。
-
核心思路:
- 构造 \(L_2\) 距离的无偏估计:在无隐私情形下,\(L_2\) 距离 \(\sum_j (p_j - 1/2)^2\) 的一个无偏估计是 \(\sum_j (\hat{p}_j - 1/2)^2 - \frac{1}{n} \sum_j \hat{p}_j(1-\hat{p}_j)\),其中 \(\hat{p}_j\) 是经验频率。但在LDP下,我们只有 \(Z_i\),没有 \(X_i\)。
- 从 \(Z_i\) 反推 \(p\) 的估计:由于随机化响应机制已知,我们可以写出 \(Z_i\) 的分布:\(q_j = P(Z_i = j) = \frac{e^\alpha}{1+e^\alpha} p_j + \frac{1}{1+e^\alpha} (1-p_j)\)。这是一个线性变换。因此,我们可以用 \(Z_i\) 的经验频率 \(\hat{q}_j\) 来反解出 \(p\) 的一个估计:\(\tilde{p}_j = \frac{1+e^\alpha}{e^\alpha - 1} \hat{q}_j - \frac{1}{e^\alpha - 1}\)。
- 构造检验统计量:将 \(\tilde{p}_j\) 代入 \(L_2\) 距离的无偏估计公式,得到 \(T_n = \sum_j (\tilde{p}_j - 1/2)^2 - \frac{1}{n} \sum_j \tilde{p}_j(1-\tilde{p}_j)\)。当 \(T_n\) 超过某个阈值时,拒绝 \(H_0\)。
- 分析检验的分离速率:计算 \(T_n\) 在 \(H_0\) 下的方差和在 \(H_1\) 下的期望。可以发现,为了达到给定的检验功效(如第一类错误概率 \(\le 0.05\),第二类错误概率 \(\le 0.05\)),所需的分离距离 \(\rho_n\) 满足 \(\rho_n^2 \asymp \frac{1}{\sqrt{n}} \cdot \frac{1+e^\alpha}{e^\alpha - 1}\)。当 \(\alpha\) 很小时(强隐私),\(\frac{1+e^\alpha}{e^\alpha - 1} \approx \frac{2}{\alpha}\),因此 \(\rho_n^2 \asymp \frac{1}{\alpha \sqrt{n}}\)。相比无隐私情形(\(\rho_n^2 \asymp 1/\sqrt{n}\)),样本量退化了一个因子 \(1/\alpha^2\)(因为 \(\rho_n^2\) 的退化因子是 \(1/\alpha\),等价于样本量从 \(n\) 退化到 \(n\alpha^2\))。
- 下界:通过构造两个难以区分的分布(一个在 \(H_0\) 下,一个在 \(H_1\) 下且距离为 \(\rho_n\)),并利用[DJW13b]的隐私版Assouad引理,可以证明任何LDP检验都无法以低于某个概率区分它们,从而证明 \(\rho_n\) 的下界与上界匹配。
这个特例揭示了整篇论文的核心数学困难:隐私扰动(Laplace噪声或随机化响应)使得原始分布的信息被“模糊”了,导致估计量的方差增大。检验的分离速率因此退化,退化因子由隐私预算 \(\alpha\) 控制。论文的一般情形(连续、高维、Besov球)只是将这个特例的线性反演和方差分析推广到了更复杂的函数空间和小波基上。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在非交互式局部差分隐私(LDP)约束下,研究非参数拟合优度检验问题,即检验未观测的样本是否来自已知密度 \(f_0\)。
- 核心工具/方法:基于 \(L_2\) 距离估计构造检验统计量,该估计量通过扰动后数据的经验分布(或小波系数)的二次型得到,并利用Laplace机制(连续)或随机化响应(离散)实现LDP。
- 主要结论:在 \(f_0\) 为均匀分布时,推导了检验的极小化极大分离速率的上界和下界,并在连续情形(Besov球)上首次建立了匹配的速率,量化了隐私代价(样本量退化因子为 \(\alpha^2\))。同时构造了自适应检验,其最优性仅损失对数因子。
关键设定与假设¶
- 设定:
- 连续情形:\(X_i\) 定义在 \([0,1]\) 上,密度 \(f\) 属于Besov球 \(B^s_{p,q}(M)\)(\(s > 1/p\) 以保证嵌入 \(L_2\))。\(f_0\) 为 \([0,1]\) 上的均匀分布。
- 离散情形:\(X_i\) 取值于 \(\{1, \dots, d\}\),服从多项分布 \(p = (p_1, \dots, p_d)\)。\(f_0\) 为均匀分布 \(p_j = 1/d\)。作者指出离散情形等价于分段常数密度的连续情形,因此统一处理。
- 隐私机制:非交互式 \(\alpha\)-局部差分隐私。对于连续情形,使用Laplace机制:\(Z_i = X_i + \xi_i\),\(\xi_i \sim \text{Laplace}(0, 2/\alpha)\)。对于离散情形,使用随机化响应。
- 检验问题:
- \(H_0: f = f_0\)(均匀分布)
- \(H_1: \|f - f_0\|_2 \ge \rho_n\)(\(L_2\) 距离至少为 \(\rho_n\)),且 \(f\) 属于某个函数类(如Besov球)。
-
非交互式:每个 \(Z_i\) 只依赖于对应的 \(X_i\),不依赖于其他 \(X_j\) 或 \(Z_j\)。
-
假设:
- Besov球假设:\(f \in B^s_{p,q}(M)\)。这是非参数光滑性假设,控制 \(f\) 的正则性。相比经典无隐私检验,本文没有额外假设,只是将检验问题限制在这个函数类上。
- 隐私预算 \(\alpha\) 的衰减:作者主要考虑 \(\alpha\) 固定或随 \(n\) 缓慢衰减(如 \(\alpha \to 0\) 但 \(\alpha \sqrt{n} \to \infty\))的情形。这是为了确保检验仍然有非平凡的功效。
-
\(f_0\) 为均匀分布:这是下界证明的关键。如果 \(f_0\) 不是均匀分布,下界构造会更复杂,作者没有处理。
-
相比已有文献的放宽或强化:
- 放宽:相比Gaboardi et al. (2016)的中心化差分隐私,本文的LDP设定更严格(数据在离开用户前就被扰动)。
- 强化:相比Duchi et al. (2013, 2016)的估计问题,本文处理的是检验问题,需要同时控制第一类和第二类错误,对统计量的分布性质要求更高。相比Fromont & Laurent (2006)的无隐私检验,本文增加了LDP约束,导致速率退化。
主要结果¶
定理 1(上界,连续情形): - 陈述:存在一个基于Laplace机制的LDP检验,使得对于任何 \(f \in B^s_{p,q}(M)\) 且 \(\|f - f_0\|_2 \ge \rho_n\),检验的第一类和第二类错误概率之和趋于0,其中
定理 2(下界,连续情形): - 陈述:对于任何满足 \(\alpha\)-LDP的检验(非交互式),存在一个 \(f \in B^s_{p,q}(M)\) 使得 \(\|f - f_0\|_2 \ge \rho_n\),但检验无法以高概率区分 \(H_0\) 和 \(H_1\),其中
定理 3(自适应检验): - 陈述:存在一个不依赖于光滑参数 \(s\) 的LDP检验(通过数据驱动地选择小波分辨率水平),其分离速率与定理1相比仅差一个对数因子 \(\log n\)。 - 直觉:通过BIC或交叉验证等方法选择最优的小波截断水平,实现自适应。对数因子的损失是自适应检验中常见的代价。
离散情形: - 作者指出,离散情形(多项分布)的速率可以通过将 \(d\) 视为“分辨率”并令其随 \(n\) 增长而得到。具体地,当 \(d \asymp n^{1/(2s+1)}\) 时,离散情形的速率与连续情形一致。这统一了离散和连续框架。
证明路线与技术技巧¶
整体路线(以上界证明为例):
- 小波展开:将密度 \(f\) 在 \([0,1]\) 上用小波基 \(\{\phi_{J_0,k}, \psi_{j,k}\}\) 展开。\(L_2\) 距离 \(\|f - f_0\|_2^2\) 可以写成小波系数平方和。
- 去卷积:由于 \(Z_i = X_i + \xi_i\)(Laplace噪声),\(Z_i\) 的密度是 \(f\) 与Laplace密度的卷积。小波系数在卷积下会衰减:观测到的小波系数 \(\tilde{\beta}_{j,k}\) 是真实系数 \(\beta_{j,k}\) 乘以一个衰减因子 \(c_j\)(依赖于分辨率 \(j\))再加上噪声。作者利用Laplace分布的特征函数已知,可以显式计算出 \(c_j\)。
- 构造无偏估计:对每个小波系数,构造一个无偏估计 \(\hat{\beta}_{j,k}\),通过将观测系数 \(\tilde{\beta}_{j,k}\) 除以 \(c_j\) 并减去一个偏差校正项。然后,\(L_2\) 距离的估计量 \(\hat{\Delta}_n\) 就是这些 \(\hat{\beta}_{j,k}^2\) 的和,再减去一个方差校正项(类似于离散情形)。
- 选择分辨率:选择一个最优的小波截断水平 \(J\)(依赖于 \(n\), \(\alpha\), \(s\)),使得估计量的方差和偏差平衡。这个 \(J\) 决定了检验的分离速率。
- 检验决策:如果 \(\hat{\Delta}_n\) 超过某个阈值 \(t_n\)(由 \(H_0\) 下的方差决定),则拒绝 \(H_0\)。
- 速率计算:计算在 \(H_1\) 下(\(\|f - f_0\|_2 = \rho_n\)),\(\hat{\Delta}_n\) 的期望和方差,并证明当 \(\rho_n\) 如定理1所示时,检验的功效趋于1。
关键跳跃点: - 从观测系数到真实系数的反演:去卷积步骤中,衰减因子 \(c_j\) 随着 \(j\) 增大(高频)而迅速衰减(因为Laplace分布是解析的,其Fourier变换衰减很快)。这意味着高频小波系数几乎被Laplace噪声完全淹没,无法用于检验。因此,最优的 \(J\) 必须选择得足够小(只使用低频信息),这直接导致了速率退化。 - 下界构造中的“低频信号”策略:下界证明中,作者没有在高频处放置信号(因为那里噪声太大),而是在低频处放置一个微弱的信号,使得其 \(L_2\) 距离为 \(\rho_n\),但任何LDP检验都无法区分。这个构造利用了[DJW13b]的隐私版Assouad引理,但需要精细地选择信号幅度以匹配上界速率。
技术技巧点名: - 小波分析:用于将 \(L_2\) 距离分解为系数平方和,并处理去卷积。 - Laplace机制的特征函数:用于计算去卷积的衰减因子 \(c_j\)。 - U-统计量/二次型估计:\(L_2\) 距离的估计量本质上是一个二阶U-统计量(或二次型),其方差分析需要用到U-统计量的理论。 - 隐私版Assouad引理:来自[DJW13b],用于推导下界。作者指出直接使用会得到次优结果,因此需要结合问题结构进行改进。 - 自适应阈值选择:通过BIC或类似准则选择小波分辨率 \(J\),实现自适应。
真实例子与应用¶
本文为纯理论,无实证例子。作者没有提供任何模拟或真实数据应用。所有结果都是理论性的(定理和证明)。
🔎 结论是否比证明窄¶
- 结论声称:“We provide the first minimax optimal test and associated private transformation under a local differential privacy constraint over Besov balls in the continuous setting.”
- 证明的实际范围:这个结论严格成立,但需要注意以下几点:
- \(f_0\) 必须为均匀分布。下界证明强烈依赖于 \(f_0\) 是均匀分布这一事实。如果 \(f_0\) 是其他已知密度,下界是否仍然成立?作者没有讨论。结论的“最优性”仅限于 \(f_0\) 为均匀分布的情形。
- 非交互式LDP。结论只适用于非交互式LDP。交互式LDP可能获得更好的速率,但不在本文范围内。
- Besov球的参数范围。证明要求 \(s > 1/p\) 以保证嵌入 \(L_2\)。对于 \(s \le 1/p\) 的情形(非常不光滑的密度),结论是否成立?作者没有讨论。
- 自适应检验的“最优性”。自适应检验的分离速率与最优速率差一个对数因子。作者声称“remains minimax optimal up to a logarithmic factor”,这是准确的,但“up to a logarithmic factor”意味着并非严格最优。
四、开放问题¶
- 非均匀 \(f_0\) 的下界:本文的下界证明强烈依赖于 \(f_0\) 为均匀分布。对于一般的已知 \(f_0\),极小化极大分离速率是什么?是否与均匀情形相同?扎根点:定理2的证明中,构造备择分布时利用了均匀分布的特殊性质(如小波系数在 \(H_0\) 下为0)。对于非均匀 \(f_0\),需要新的构造。
- 交互式LDP:本文只考虑非交互式LDP。如果允许多轮交互(如先发一批数据估计 \(f\) 的粗糙形状,再根据结果调整后续扰动),能否获得更快的检验速率?扎根点:作者在引言中明确将设定限制为“non-interactive privacy”。
- 其他光滑类的检验:本文只处理了Besov球。对于其他光滑类(如Sobolev球、Holder球),极小化极大分离速率是否相同?是否会出现不同的“肘效应”?扎根点:作者在引言中提到了Butucea et al. (2019)在估计问题中发现的“双肘效应”,但本文的检验问题是否也有类似现象?这是一个自然延伸。
- 高维情形:本文主要考虑 \(d=1\) 的连续情形。对于高维密度(\(d>1\)),LDP下的拟合优度检验会面临“维数灾难”。极小化极大速率如何随 \(d\) 变化?扎根点:作者在离散情形中提到了维度 \(d\),但连续情形只处理了 \(d=1\)。高维扩展是一个开放问题。
Maintained by 陈星宇 · Homepage · Source on GitHub