跳转至

Optimal subgroup selection

作者: Henry W. J. Reeve, Timothy I. Cannings, Richard J. Samworth
主题: 非参数 / 半参数
相关性: 7/10
链接: https://doi.org/10.1214/23-aos2328


一、领域脉络与小综述

这个方向是什么

本文研究的子方向是子群选择(subgroup selection),其根本统计问题是:在回归设定下,给定一个预设阈值 τ,如何基于数据找到一个"低复杂度"的区域 Â,使得回归函数 η 在该区域上均匀地(uniformly)以高概率不低于 τ,同时该区域在边际分布 µ 下的质量(即 µ(Â))尽可能大。这是一个兼具假设检验(控制第一类错误)与估计/优化(最大化覆盖质量)双重性质的推断问题。该方向的成熟度处于理论快速发展期:核心的 minimax 速率已基本清晰,但自适应参数选择、更一般的区域族、以及计算可行性等问题仍开放。

发展脉络

  • 奠基工作:数据窥探与多重比较的警示。作者在引言中大量引用了医学文献中对"事后子群分析"的警告(Senn and Welch, 1997; Feinstein, 1998; Rothwell, 2005; Wang et al., 2007; Kaufman and MacLehose, 2013; Altman, 2015; Zhang et al., 2015; Gabler et al., 2016; Lipkovich, D'Agostino Sr, 2017)。这些工作确立了本问题的核心张力:不加控制地"挖掘"数据寻找显著子群,会导致第一类错误膨胀。作者将这种"数据窥探"的担忧形式化为一个严格的均匀第一类错误控制约束(即要求对分布类中所有 P 都成立),这是本文与许多仅关注点估计或平均效应的子群分析工作的根本区别。
  • 主要进展:从"检验交互"到"选择区域"。作者将子群选择与两个更广泛的文献脉络相连:
    1. 异质性处理效应(HTE)的估计与检验:引用了 Crump et al. (2008) 和 Watson and Holmes (2020) 关于检验"是否存在任何子群具有处理效应"的全局零假设的工作。本文的贡献在于,不满足于"检验存在性",而是进一步要求输出一个具体的、可解释的区域,并对其质量给出保证。
    2. 水平集(level set)估计:作者明确指出本文问题与水平集估计的"关键区别"在于误差的不对称性——本文只惩罚"把 η 低于 τ 的点包含进来"(第一类错误),而不惩罚"遗漏 η 高于 τ 的点"(第二类错误)。这不同于经典的、对称的 Hausdorff 距离或集合差度量(如 Tsybakov, 1997; Polonik, 1995; Cavalier, 1997; Scott and Davenport, 2007; Willett and Nowak, 2005; Gotovos et al., 2013; Laloë and Serviel, 2013; Zanette et al., 2018; Dau et al., 2013; Chen et al., 2017; Doss et al., 2018; Qiao and Polonik, 2019; Rodríguez-Casal and Saavedra-Nieves, 2013; Qiao, 2020)。这种不对称性使得问题在数学上更接近 Neyman-Pearson 分类(引用了 Cannon et al., 2002; Scott and Nowak, 2005; Tong et al., 2008; Xia et al., 2021),但损失函数和允许的区域族(低复杂度集合)又有所不同。
  • 当前 frontier 与本文位置:本文处于一个将非参数回归的局部估计、高维/复杂集合的逼近论(通过 κ, γ 参数刻画)与多重检验的族控制(通过 Holm 过程)三者结合的交叉点。作者明确将本文定位为"最优"子群选择:不仅给出一个可行算法,而且确定了该问题在 minimax 意义下的最优速率,从而回答了"这个问题本质上有多难"这一元问题。

子线索聚类

  1. 医学与临床试验中的子群分析(Senn and Harrell, 1997; Feinstein, 1998; Rothwell, 2005; Wang et al., 2007; Kaufman and MacLehose, 2013; Altman, 2015; Zhang et al., 2015; Gabler et al., 2016; Lipkovich et al., 2017):这条线索是应用动机,强调"事后分析"的统计陷阱,为本文的第一类错误控制提供了现实必要性。
  2. 水平集与密度水平集估计(Polonik, 1995; Tsybakov, 1997; Cavalier, 1997; Scott and Davenport, 2007; Willett and Nowak, 2005; Laloë and Serviel, 2013; Zanette et al., 2018; Dau et al., 2013; Chen et al., 2017; Doss et al., 2018; Qiao and Polonik, 2019; Rodríguez-Casal and Saavedra-Nieves, 2013; Qiao, 2020):这条线索提供了估计目标(超水平集)和技术工具(如逼近论、光滑性假设),但本文的不对称损失和均匀控制要求是新的。
  3. Neyman-Pearson 分类与异常检测(Cannon et al., 2002; Scott and Nowak, 2005; Tong et al., 2008; Xia et al., 2021):这条线索提供了问题框架(在约束下优化另一个目标),但本文的"区域"是连续的、低复杂度的集合,而非分类器,且允许的算法类别更广。
  4. 自适应/非参数自适应方法(如 Bull, 2012; Giné and Nickl, 2010; Picard and Triboulet, 2000; Reeve et al., 2021):这条线索提供了处理未知光滑度的工具(自相似类、自适应置信带),本文在第三节将其用于数据驱动地选择 β 和 λ。

⚠️ 作者的 framing(这是作者的说法)

作者将本文的核心贡献 framing 为:首次在子群选择问题中,同时实现了 (i) 严格的均匀第一类错误控制(对分布类中所有 P 成立),(ii) 在 minimax 意义下的最优 regret 速率,且 (iii) 该速率显式地依赖于区域族的复杂度(通过 κ, γ 刻画)与回归函数的光滑度(β)。作者特别强调,其下界构造(Proposition 14 和 15)揭示了速率中 α 依赖项的必要性——这是由"均匀控制"这一强约束所驱动的,而非算法的次优性。作者还暗示,其算法(基于局部多项式回归和 Holm 校正)是计算上可行的,因为它只需要在多项式级别的超立方体上进行检验。

张力

  • 未见明显对立引用:作者引用的文献之间没有直接矛盾。但存在一个隐含的张力:医学文献(线索 1)倾向于认为"事后子群分析"本质上是危险的,应严格限制;而统计学习文献(线索 2、3)则致力于开发更精细的工具来"安全地"进行这种分析。本文站在后者一边,但通过引入均匀控制来回应前者的担忧。作者没有直接讨论这种张力,而是通过数学框架将其消解。
  • 另一个张力:本文的速率(Theorem 2)在 β ≤ 1 时,第一项为 (log(n/α)/n)^{βκγ/(κ(2β+d)+βγ)}。当 κ 很大(区域族很"胖")或 γ 很大(分离性很强)时,速率变慢。这与"区域族越复杂,估计越难"的直觉一致,但作者没有讨论计算复杂度与统计速率之间的 trade-off——即是否存在一个计算上高效但统计上非最优的算法,其实际表现可能更好。这是一个值得注意的空白。

二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据

  • 可观测数据:\(D = \{(X_1, Y_1), \dots, (X_n, Y_n)\}\),独立同分布地来自 \(P\),其中 \(X_i \in \mathbb{R}^d\) 是协变量,\(Y_i \in [0,1]\) 是响应变量。
  • 边际分布:\(\mu \equiv \mu_P\) 是 \(X\) 在 \(\mathbb{R}^d\) 上的边际分布。
  • 回归函数:\(\eta \equiv \eta_P: \mathbb{R}^d \to [0,1]\),定义为 \(\eta(x) = E_P(Y | X = x)\)。这是要估计的对象,是一个未知的、非随机的函数。
  • 阈值:\(\tau \in (0,1)\),是已知的常数,代表"有效"的临界水平。
  • 区域族:\(\mathcal{A} \subseteq \mathcal{B}(\mathbb{R}^d)\),是候选选择区域的集合,满足 \(\emptyset \in \mathcal{A}\)。这是已知的,其复杂度由 \(\kappa\) 和 \(\gamma\) 刻画(见 Definition 2)。
  • 最优区域:\(A_\tau \equiv A_\tau(P, \mathcal{A}) := \arg\max\{\mu(A) : A \in \mathcal{A} \cap \text{Pow}(X_\tau(\eta))\}\),其中 \(X_\tau(\eta) := \{x \in \mathbb{R}^d : \eta(x) \ge \tau\}\) 是 η 的 τ-超水平集。\(A_\tau\) 是不可观测的(因为它依赖于未知的 η),是我们要逼近的目标。
  • 最优质量:\(M_\tau \equiv M_\tau(P, \mathcal{A}) := \mu(A_\tau)\),是不可观测的标量。
  • 数据驱动的选择集:\(\hat{A} \in \mathcal{A}\),是算法输出,是随机集合。
  • Regret:\(R_\tau(\hat{A}) := M_\tau - E_P\{\mu(\hat{A}) \cdot \mathbb{1}_{\hat{A} \subseteq X_\tau(\eta)}\}\)。注意这里期望是在 \(\hat{A}\) 的随机性上取的,并且只有当 \(\hat{A}\) 完全包含在超水平集内时才计入其质量。这是要最小化的风险。
  • 第一类错误:\(P(\hat{A} \not\subseteq X_\tau(\eta))\),即输出集合包含"坏点"的概率。要求其 ≤ α。
  • 光滑度参数:\(\beta \in (0, \infty)\),\(\lambda \in [1, \infty)\),已知的,用于定义 Hölder 类(Definition 1 和 4)。
  • 复杂度参数:\(\kappa, \gamma > 0\),\(C_{\text{App}} \ge 1\),已知的,用于定义"可逼近"区域族(Definition 2)。
  • 样本量:\(n \in \mathbb{N}\)。
  • 显著性水平:\(\alpha \in (0, 1/2]\),已知的。

第二步:最小内核

问题:我们有一个未知函数 η,它把协变量 X 映射到 [0,1] 上的期望响应。我们想找一个"好"的区域 A(从允许的集合族 A 中选),使得 A 里的所有点都有 η(x) ≥ τ(即"有效"),并且 A 要尽可能大(即覆盖尽可能多的总体质量 µ(A))。

核心困难:我们不知道 η,只有 n 个带噪声的样本 \((X_i, Y_i)\)。如果我们简单地用数据去猜一个区域,很可能因为噪声而把一些 η(x) 略低于 τ 的点也包进来(第一类错误)。要控制这个错误,并且让区域尽量大,就需要在"探索"(找更大的区域)和"保守"(避免坏点)之间权衡。

最小例子(d=1, β=1, κ=1, γ=1): - 设 \(X \sim \text{Unif}([0,1])\),\(\eta(x) = \tau + \lambda \cdot (x - 1/2)\)(一个线性函数,在 \(x=1/2\) 处穿过阈值 τ)。那么 \(X_\tau(\eta) = [1/2, 1]\),\(A_\tau = [1/2, 1]\),\(M_\tau = 1/2\)。 - 我们观察到 n 个点 \((X_i, Y_i)\),其中 \(Y_i = \eta(X_i) + \epsilon_i\),\(\epsilon_i\) 是均值为 0 的噪声。 - 一个朴素算法:估计 \(\hat{\eta}\)(比如局部线性回归),然后选 \(\hat{A} = \{x : \hat{\eta}(x) \ge \tau\}\)。这个集合很可能因为估计误差而在 \(x=1/2\) 附近"抖动",可能包含一些 \(x < 1/2\) 的点(那里 η(x) < τ),导致第一类错误。 - 本文的算法(思想):不直接选 \(\hat{A}\),而是对每个候选超立方体 B 计算一个 p 值,检验"B 是否完全包含在 \(X_\tau(\eta)\) 内"。然后用 Holm 过程校正这些 p 值,保证所有被选中的 B 同时满足"完全包含"的概率 ≥ 1-α。最后,从这些"安全"的超立方体中,选一个并集的 µ-质量最大的作为 \(\hat{A}\)。 - 为什么速率长这样:regret 的第一项 \((n^{-1}\log(n/\alpha))^{\beta\kappa\gamma/(\kappa(2\beta+d)+\beta\gamma)}\) 来自两个 trade-off: 1. 估计误差:为了判断一个超立方体 B 是否"安全",我们需要估计 η 在 B 上的最小值。这个估计的误差随 B 的边长 h 减小而减小(因为 η 更平滑),但随 n 增大而减小。这给出 \(h \sim n^{-1/(2\beta+d)}\) 的最优带宽。 2. 逼近误差:最优集合 \(A_\tau\) 可能不是超立方体的并集,我们需要用超立方体去逼近它。这个逼近误差由 κ 和 γ 控制:κ 刻画了"在 η 接近 τ 的区域,µ 的质量如何随距离衰减",γ 刻画了"η 接近 τ 的区域有多大"。为了达到 µ-误差 ε,需要超立方体的总"表面积" ~ ε^{1/γ},而每个超立方体的边长 ~ ε^{1/κ},所以需要的超立方体数量 ~ ε^{1/γ - 1/κ}。这个数量不能超过 n(否则无法估计),这给出 ε ~ n^{-κγ/(κ-γ)} 的约束。 3. 结合:最优的 h 和 ε 需要平衡估计误差和逼近误差,最终得到上述速率。当 κ 很大(区域族很"胖")或 γ 很大(分离性很强)时,逼近误差项占主导,速率变慢。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在回归设定下,如何构造一个数据驱动的子群选择集合 \(\hat{A}\),使其以概率 ≥ 1-α 完全包含在未知的 τ-超水平集 \(X_\tau(\eta)\) 内(第一类错误控制),同时最大化其 µ-质量(最小化 regret)。
  2. 核心工具/方法:将问题形式化为约束优化;提出基于局部多项式回归和 Holm 多重检验校正的算法 \(\hat{A}_{\text{OSS}}\);利用超立方体逼近和经验过程理论分析其 regret。
  3. 主要结论:确定了该问题在 minimax 意义下的最优 regret 速率(Theorem 2 和 11),该速率由光滑度 β、区域族复杂度 κ、γ 共同决定,形式为 \(\min\{(n^{-1}\log(n/\alpha))^{\beta\kappa\gamma/(\kappa(2\beta+d)+\beta\gamma)} + n^{-1/2}, 1\}\)。同时证明了在未知光滑度时,自适应算法(Theorem 10)仅损失子对数因子。

关键设定与假设

  • Hölder 类(Definition 1 和 4):η 在超水平集 \(X_\tau(\eta)\) 上满足 \(|\eta(x') - \eta(x)| \le \lambda \|x' - x\|_\infty^\beta\)。这比全局 Hölder 假设更弱,允许 η 在超水平集外任意"坏"。β 控制局部光滑度,λ 是 Lipschitz 常数上界。
  • 可逼近区域族(Definition 2):存在常数 κ, γ > 0 和 \(C_{\text{App}} \ge 1\),使得对任意 \(\xi, \Delta > 0\),存在 \(A \in \mathcal{A} \cap \text{Pow}(X_\xi(\omega) \cap X_{\tau+\Delta}(\eta))\) 满足 \(\mu(A) \ge M_\tau - C_{\text{App}}(\xi^\kappa + \Delta^\gamma)\)。这里 \(\omega\) 是 µ 的下密度函数。这个假设刻画了"用低复杂度集合逼近最优集合"的能力:κ 控制 µ-质量对下密度阈值的敏感度,γ 控制对 η 分离度的敏感度。
  • VC 维有限:\(\mathcal{A}\) 的 VC 维 \(V < \infty\),用于控制经验过程的均匀收敛速度。
  • 已知参数:β, λ, κ, γ, \(C_{\text{App}}\) 均已知(第三节讨论自适应选择)。
  • 响应变量有界:\(Y \in [0,1]\),简化 Hoeffding 不等式应用。

主要结果

  • Proposition 1(不可能性):在仅假设 Lipschitz 连续(β=1)但 λ 未知时,任何满足第一类错误控制的算法,其期望 µ-质量都不超过忽略数据的平凡算法(即总是输出 \(\emptyset\))。这证明了"自适应于 λ"在完全一般性下是不可能的,从而为后续假设"λ 已知"或"自相似类"提供了动机。
  • Theorem 2(minimax 速率):在 Hölder 类 + 可逼近区域族上,regret 的 minimax 最优速率为 \(\min\{(n^{-1}\log(n/\alpha))^{\beta\kappa\gamma/(\kappa(2\beta+d)+\beta\gamma)} + n^{-1/2}, 1\}\)。
  • 上界:由算法 \(\hat{A}_{\text{OSS}}\) 实现。算法分两步:① 对每个超立方体 B,用局部多项式回归估计 η 在 B 上的最小值,并构造 p 值;② 用 Holm 过程筛选出"安全"的超立方体,然后选 µ-质量最大的并集。
  • 下界:通过构造两类分布(Proposition 14 和 15)证明。第一类分布(Proposition 14)用 Fano 不等式处理"识别哪个区域是好的"的困难,得到第一项速率;第二类分布(Proposition 15)用 Brown-Low 约束风险不等式处理"估计 η 的局部最小值"的困难,得到 \(n^{-1/2}\) 项。
  • Theorem 6, 8, 9, 10(自适应):在额外假设"自相似类"(Definition 3)下,可以数据驱动地估计 λ 和 β。Theorem 6 给出了 λ 的估计器 \(\hat{\lambda}_{n,\beta,\delta}\) 的误差界;Theorem 8 表明使用 \(2\hat{\lambda}\) 作为输入,算法仍保持第一类错误控制,且 regret 仅损失常数因子;Theorem 9 给出了 β 的估计器 \(\hat{\beta}_{n,\delta}\) 的误差界;Theorem 10 综合两者,表明完全数据驱动的算法 \(\hat{A}''_{\text{OSS}}\) 的 regret 相比已知参数时仅损失 \(f(n)^{4\gamma(7+2d)/d}\) 因子(f(n) 为任意趋于无穷的慢函数)。
  • Corollary 16(HTE 推广):将结果推广到处理组/对照组设定,目标变为寻找处理效应 \(\phi(x) = \eta_1(x) - \eta_0(x)\) 超过阈值 t 的区域。通过构造代理变量 Y,将问题化归为回归设定,得到相同的 minimax 速率。

证明路线与技术技巧

  • 整体路线:
  • 上界:先证明算法 \(\hat{A}_{\text{OSS}}\) 的第一类错误控制(Proposition 4),这依赖于 p 值的有效性(Lemma 3)和 Holm 过程的性质。然后证明 regret 上界(Proposition 5),分为两步:① 用经验过程理论(VC 维)控制 \(\hat{\mu}_n(\hat{A})\) 与 \(\mu(\hat{A})\) 的偏差;② 用可逼近区域族假设控制"最优集合 \(A_\tau\) 与超立方体并集的差距"。
  • 下界:构造两类分布,分别用 Fano 不等式和 Brown-Low 不等式证明 regret 的两个下界项。
  • 关键跳跃点:
  • p 值的构造(Lemma 3):关键在于证明 \(\hat{p}_n(B)\) 是有效的 p 值,即当 B 不完全包含在超水平集内时,\(P(\hat{p}_n(B) \le \alpha) \le \alpha\)。证明利用了 Hoeffding 不等式和 Hölder 条件,将"η 在 B 上的最小值"与"样本均值"联系起来。
  • 下界构造(Proposition 14):难点在于构造的分布既要属于 Hölder 类,又要使得"识别正确的区域"很困难。作者使用了一个巧妙的构造:将超立方体分成 L 个"候选区域",每个区域要么 η = τ + θ(好),要么 η = τ - θ(坏),且好区域只有一个。通过 Fano 不等式,证明任何算法都难以识别出这个好区域。
  • 下界构造(Proposition 15):难点在于构造的分布要使得"估计 η 的局部最小值"很困难,同时又要保持 µ-质量的可区分性。作者使用了一个"阶梯"构造,使得 η 在多个尺度上接近 τ,从而任何算法都难以判断哪些区域是安全的。
  • 技术技巧点名:
  • 局部多项式回归:用于估计 η 在超立方体上的最小值,利用 Hölder 光滑性控制偏差。
  • Holm 过程:用于多重检验校正,保证第一类错误的族控制。
  • VC 维与经验过程:用于控制经验测度与真实测度的均匀偏差。
  • Fano 不等式:用于证明识别困难的下界。
  • Brown-Low 约束风险不等式:用于证明估计困难的下界。
  • 自相似类:用于自适应估计 β 和 λ,通过多尺度分析。

真实例子与应用

  • Example 1(高斯混合):\(X|Y=r \sim N((-1)^{r-1}\nu, 1)\),\(P(Y=0)=P(Y=1)=1/2\)。此时 η(x) = P(Y=1|X=x) 是逻辑斯蒂函数,在 x=0 附近穿过 τ=1/2。作者验证了该分布属于可逼近区域族(κ=γ=1)。
  • Example 2(单调函数):η 在 [0,1]^d 上坐标单调递增,且 \(\eta^{-1}(\tau)\) 是光滑边界。此时最优集合是超水平集,可以用超立方体逼近,κ 和 γ 由边界的光滑性和 µ 的密度决定。
  • Example 3(重尾分布):µ 的密度为 \(g_\kappa(\|x\|_\infty)\),其中 \(g_\kappa\) 在原点附近有奇异行为。这展示了 κ 如何刻画 µ 的"集中程度"。
  • Corollary 16(HTE):在临床试验中,寻找处理效应 \(\phi(x)\) 超过阈值 t 的患者子群。通过构造 \(Y = \frac{1}{2}\{1 + \rho \tilde{Y}\}\),其中 \(\tilde{Y} = T Y_1 + (1-T)Y_0\),将问题化归为回归设定。

🔎 结论是否比证明窄

  • 是的,存在明显差距:
  • 上界 vs 下界:上界(Theorem 2(i))要求 \(\mathcal{A}\) 是 VC 类,且 \(\mathcal{A}\) 包含所有超立方体;下界(Theorem 2(ii))只要求 \(\mathcal{A}\) 包含超立方体。上界中的常数 \(C\) 依赖于 \(d, \kappa, \gamma, \tau, C_{\text{App}}, V\),但下界中的常数 \(c\) 只依赖于 \(d, \beta, \kappa, \gamma, C_{\text{App}}, \epsilon_0\)。因此,上界和下界在常数上并不匹配,只证明了速率的阶数最优,而非常数最优。
  • 自适应:Theorem 10 的自适应结果要求"自相似类"(Definition 3),这是一个比 Hölder 类更强的假设。作者在文中承认,没有这个假设,自适应是不可能的(Proposition 1)。但"自相似类"是否覆盖了实际应用中的大多数情况,文中没有讨论。
  • 计算可行性:算法 \(\hat{A}_{\text{OSS}}\) 需要对所有超立方体计算 p 值,其数量是 \(O(n^{d})\) 的(因为每个超立方体由中心和半径决定)。当 d 较大时,这在实际中是不可行的。作者在文中没有讨论计算复杂度,也没有提出任何近似算法。这是一个重要的空白——理论最优的算法可能无法在中等维度下运行。
  • 第一类错误的定义:文中要求 \(\hat{A} \subseteq X_\tau(\eta)\) 的概率 ≥ 1-α,这是一个逐点(pointwise)保证。但实际应用中,我们可能更关心均匀(uniform)保证,即 \(\inf_{P \in \mathcal{P}} P(\hat{A} \subseteq X_\tau(\eta)) \ge 1-\alpha\)。文中没有明确区分这两种保证,但下界构造(Proposition 14)实际上证明了均匀保证下的最优性。

四、开放问题

  1. 常数最优性:上界和下界的常数不匹配。能否构造更精细的上下界,确定 regret 的精确常数?这需要更精细的局部分解技术。
  2. 计算可行性:算法需要对指数级数量的超立方体进行检验。能否设计一个计算上高效(例如多项式时间)的算法,同时保持 minimax 最优性?这可能需要对区域族施加更强的结构假设(如凸性、单调性)。
  3. 自适应范围的扩展:自相似类假设是否必要?能否在更弱的假设下(如部分自相似)实现自适应?或者,能否证明在更一般的假设下,自适应是不可能的(如通过更精细的 minimax 下界)?
  4. 其他损失函数:本文使用 µ-质量作为 regret。如果改用其他损失,如 Hausdorff 距离下的集合误差,最优速率会如何变化?这需要重新设计算法和分析。
  5. 高维行为:当 d 随 n 增长时,速率如何变化?本文的速率在 d 固定时是最优的,但高维下的 curse of dimensionality 是否不可避免?能否通过稀疏性假设(如 η 只依赖少数坐标)来缓解?
  6. 依赖数据:本文假设样本独立同分布。如果 X 具有时间或空间相关性,或者 Y 是删失的,问题会如何变化?这需要新的集中不等式和逼近论工具。

提示:要确认上述问题是否为真 gap,建议去读同一子领域(如水平集估计、异质性处理效应)近 5 年的论文(例如 Annals of Statistics、JRSS-B 上的相关文章),看是否已有后续工作解决了这些问题。如果多篇论文都指向同一个未解决问题,那它很可能是一个值得投入的真 gap。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论