Distribution-Free Prediction Sets for Regression under Target Shift¶
讲者: Yanlin Tang
会场: Advanced Statistical Learning: Distribution-Free, Scalable and Cost-Efficient Inference
报告题目: Distribution-Free Prediction Sets for Regression under Target Shift
链接: arXiv
来源: JCSDS 2026 · 返回会议总览
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向要解决的根本问题是:当训练数据(源分布)和测试数据(目标分布)的联合分布不同时,如何为新的测试点构建一个有效的、分布自由的预测集(prediction set)。这里的“有效”通常指覆盖概率(coverage probability)在有限样本下被保证(如至少1-α),“分布自由”指不依赖于数据生成机制的具体参数形式。当前成熟度:共形预测(conformal prediction)在独立同分布(i.i.d.)或可交换(exchangeable)数据下已非常成熟,但处理各种分布偏移(distribution shift)是当前最活跃的前沿之一。
发展脉络(history)¶
-
奠基工作:共形预测的提出与基本框架。
- Vovk et al. (2005) 和 Shafer & Vovk (2008) 奠定了共形预测的理论基础,提出了在可交换数据下构造有效预测集的一般框架。
- Lei et al. (2013) 将共形预测与非参数平滑(核密度估计)结合,证明了在光滑性条件下预测集具有渐近效率,同时保持有限样本覆盖保证。
- Lei et al. (2018) 系统性地比较了全共形预测和分裂共形预测(split conformal prediction),并提出了“秩一弃一”(rank-one-out)方法,在计算效率和统计效率之间取得平衡。这些工作确立了共形预测作为分布自由推断的标准工具。
-
主要进展:从可交换数据到分布偏移。
- Tibshirani et al. (2019) 是第一个关键突破,将共形预测推广到协变量偏移(covariate shift) 场景。他们证明了,如果已知测试点和训练点的似然比(likelihood ratio),可以通过加权共形预测(weighted conformal prediction)来校正偏移,保证覆盖。本文引用语境指出,该方法能产生比标准方法更紧凑的预测集,但依赖于已知的似然比。
- Barber et al. (2023) 进一步将共形预测推广到非可交换(non-exchangeable) 数据,通过为样本分配固定权重来缓解覆盖损失。本文引用语境指出,该方法能处理任意分布漂移,但在目标偏移设定下可能过于保守。
- Gibbs & Candès (2021, 2024) 提出了自适应共形推断(ACI),用于在线(online)场景下处理任意时变分布偏移,通过动态调整置信水平来保证长期覆盖。本文引用语境指出,这些方法虽然有效,但需要知道分布变化率,且可能对历史数据过度加权。
-
当前前沿:特定偏移类型下的高效推断。
- 标签偏移(label shift) 是另一个重要的偏移类型,主要研究集中在分类问题。Lipton et al. (2018) 提出了黑盒偏移估计(BBSE),通过匹配源域和目标域的矩或分布来识别偏移。Azizzadenesheli et al. (2019) 提出了正则化学习(RLLS),为标签偏移下的分类器校正提供了泛化界。
- Podkopaev & Ramdas (2021) 首次将共形预测和校准方法应用于分类任务下的标签偏移,通过重加权来恢复覆盖和校准。本文引用语境明确指出,本文的工作是其“互补且更全面的对应物”(complementary and more comprehensive counterpart),因为本文处理的是回归任务。
- Lee et al. (2025) 提出了“双重灵活估计”(doubly flexible estimation),在标签偏移下估计目标分布的参数或泛函,且对偏移模型或回归模型的误设具有鲁棒性。本文引用语境指出,这些方法的目标是推断目标分布的特定成分,而本文的目标是直接构造预测区间。
-
本文的位置: 本文(Tang et al., 2025)填补了回归任务下目标偏移(target shift) 的空白。它结合了加权共形预测(处理非可交换性)和分布匹配(识别偏移),并提出了一个新颖的加权条件密度估计器来构造更高效的预测集。它处理了两种实际场景:目标域完全无标签和部分有标签。
子线索聚类¶
这些被引文献大致落在以下三条子线索上:
- 共形预测的基础与扩展: 关注共形预测本身的理论、算法和在不同数据设定下的推广。包括Vovk et al. (2005)、Shafer & Vovk (2008)、Lei et al. (2013, 2018)、Tibshirani et al. (2019)、Barber et al. (2023)、Gibbs & Candès (2021, 2024)。这条线索的核心是“如何保证覆盖”,方法从可交换性到加权再到自适应。
- 分布偏移的识别与校正: 关注如何从数据中估计出偏移(如似然比、密度比),以便进行后续的推断或预测。包括Lipton et al. (2018)、Azizzadenesheli et al. (2019)、Plessis & Sugiyama (2014)、Zhang et al. (2013)、Nguyen et al. (2016)、Guo et al. (2020)。这条线索的核心是“如何识别偏移”,方法从矩匹配到分布匹配。
- 特定偏移类型下的推断: 将前两条线索结合,解决特定偏移(如标签偏移、目标偏移)下的具体推断问题。包括Podkopaev & Ramdas (2021)(分类+标签偏移)、Lee et al. (2025)(回归+标签偏移)、Cauchois et al. (2024)(任意偏移+鲁棒性)。本文属于此线索,专门处理回归+目标偏移。
这个方向在追问的核心问题¶
- 如何保证覆盖? 在非可交换数据下,如何调整共形预测程序,使得预测集在有限样本下仍能提供(至少近似)的覆盖保证?
- 如何识别偏移? 当目标域标签缺失时,如何仅利用源域标签和目标域协变量来识别出分布偏移的具体形式(如似然比)?
- 如何提高效率? 在保证覆盖的前提下,如何构造更紧凑、信息量更大的预测集?例如,使用条件密度而非简单的残差作为非一致性分数。
- 如何利用部分标签? 当目标域有少量标签时,如何最优地结合源域和目标域信息来提升预测效率?
已知瓶颈: 对于回归任务下的目标偏移,现有方法要么只能处理分类(Podkopaev & Ramdas, 2021),要么只能推断参数而非构造预测集(Lee et al., 2025),要么在任意偏移下过于保守(Barber et al., 2023; Cauchois et al., 2024)。
⚠️ 作者的 framing(必须明确标注成“这是作者的说法”)¶
- 作者把缺口 frame 成什么? 作者将缺口 frame 为:现有工作要么只关注分类(Podkopaev & Ramdas, 2021),要么只关注参数推断(Lee et al., 2025),而没有为回归任务下的目标偏移提供分布自由的预测集。因此,本文是“显然的下一步”:将加权共形预测和分布匹配技术结合起来,专门解决回归中的目标偏移问题。
- 哪些竞争路线被他淡化或回避了?
- 高维协变量问题: 作者在权重估计中使用了高斯径向基函数(RBF),并假设协变量空间维数p是固定的。对于高维p,RBF的逼近误差和计算复杂度会急剧上升。作者在理论部分(Assumption 3)要求平滑度s > p/2,这在高维下非常苛刻。作者没有讨论或回避了高维协变量下的挑战。
- 非线性条件密度估计的精度: 作者使用线性分位数回归作为工作模型来估计条件密度。虽然声称“有效性不依赖于模型的正确设定”,但预测集的效率(长度) 高度依赖于条件密度估计的精度。如果真实关系高度非线性,线性分位数回归的估计可能很差,导致预测集变宽。作者没有深入讨论或比较更灵活的非线性条件密度估计方法(如随机森林、神经网络)。
- 什么明显该被引 / 该存在、却没出现在 intro 里?
- 关于“统计-计算权衡”的文献: 本文的核心挑战之一是识别似然比w(y),这本质上是一个非参数估计问题。在高维或复杂模型下,可能存在统计上可识别但计算上困难的情况。例如,当p(x|y)是复杂的高维分布时,匹配协变量分布可能是一个计算上棘手的问题。作者没有引用任何关于“统计-计算权衡”或“计算约束下的统计推断”的文献,这对于一个关注“识别”和“估计”的论文来说是一个明显的缺失。
- 关于“双重稳健性”的文献: 作者在结论部分(Section 6)提到“双重稳健性”(doubly robust property)是一个未来方向。但Lee et al. (2025) 这篇被引论文已经提出了一个“双重灵活”(doubly flexible)的估计量,它在标签偏移下对偏移模型或回归模型的误设具有鲁棒性。作者在intro中引用了Lee et al. (2025),但并未深入讨论其双重稳健性思想如何能直接应用于本文的预测集构造问题。这暗示了作者可能回避了一个更强大的理论框架。
张力¶
未见明显对立引用。所有被引工作都在不同设定下推进了共形预测或分布偏移的研究,彼此之间是互补关系而非矛盾关系。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
- \(Y\): 单变量响应变量(outcome),是我们要预测的目标。
- \(X \in \mathbb{R}^p\): p维协变量向量。
- \(P(x, y)\): 源分布(source distribution),有大量标签数据。
- \(Q(x, y)\): 目标分布(target distribution),标签稀缺或缺失。
- \(p(\cdot)\), \(q(\cdot)\): 分别表示在分布P和Q下的概率密度函数。
- \(w(y) = q(y) / p(y)\): 似然比权重(likelihood ratio weight),是本文要估计的关键参数。它只依赖于Y。
- \(R(x, y)\): 非一致性分数(nonconformity score),衡量一个点与训练模型的偏离程度。分数越大,越不符合。
- \(\hat{C}(X_{n+1}; \alpha)\): 预测集,以\(1-\alpha\)的置信水平覆盖新观测的\(Y_{n+1}\)。
- \(n_P\): 源分布P的样本量。
- \(n_Q\): 目标分布Q的样本量。
- \(n_0\): 目标分布Q中有标签的样本量。
- \(\alpha\): 用户指定的错误覆盖率(miscoverage level),如0.1。
-
模型:
- 目标偏移(Target Shift)假设:这是核心模型。它假设源分布和目标分布的关系是:
\[p(y) \neq q(y) \quad \text{但} \quad p(x|y) = q(x|y)\]即,两个分布的边际分布不同,但给定Y后X的条件分布相同。这通常出现在“反因果推断”(anti-causal inference)场景,例如用症状(X)推断疾病(Y),疾病的流行率(Y的边际分布)会变化,但症状与疾病的关联机制(X|Y)是稳定的。
- 可观测数据:
- 源分布P:研究者可以观测到完整的配对数据 \(\{(X_i^P, Y_i^P)\}_{i=1}^{n_P}\)。
- 目标分布Q:研究者通常只能观测到协变量 \(\{X_i^Q\}_{i=1}^{n_Q}\),以及一个新的测试点 \(X_{n+1}^Q\)。在“有标签”场景下,还能观测到少量配对数据 \(\{(X_i^Q, Y_i^Q)\}_{i=1}^{n_0}\)。
- 想要但观测不到的量:
- 目标分布Q的联合分布 \(q(x, y)\) 或边际分布 \(q(y)\)。
- 似然比权重 \(w(y) = q(y)/p(y)\)。
- 目标分布下的条件密度 \(q(y|x)\)。
- 目标偏移(Target Shift)假设:这是核心模型。它假设源分布和目标分布的关系是:
第二步:讲最小内核¶
本文的核心思路可以归结为:在目标偏移下,通过估计似然比权重 \(w(y)\),将源分布P下的非一致性分数“加权”到目标分布Q下,从而恢复共形预测的有效性。
最简特例: 假设 \(Y\) 是二值变量(\(Y \in \{0, 1\}\)),且协变量 \(X\) 是一维连续变量。
-
设定:
- 源分布P: \(p(Y=1) = 0.5\), \(p(X|Y=0) \sim N(0,1)\), \(p(X|Y=1) \sim N(2,1)\)。
- 目标分布Q: \(q(Y=1) = 0.8\), 但 \(q(X|Y) = p(X|Y)\) 保持不变。
- 我们有一个新的测试点 \(X_{n+1}^Q = 1.5\),想构造一个90%的预测集(\(\alpha=0.1\))。
-
核心思路(在本文框架下):
- 识别权重: 由于 \(Y\) 是二值的,权重 \(w(y)\) 只有两个值:\(w(0) = q(Y=0)/p(Y=0) = 0.2/0.5 = 0.4\),\(w(1) = q(Y=1)/p(Y=1) = 0.8/0.5 = 1.6\)。本文的方法是通过匹配协变量分布来估计这个权重。在这个特例下,我们可以直接计算。
- 构造非一致性分数: 我们使用一个简单的模型(如线性回归)来预测 \(Y\),然后定义非一致性分数 \(R(x, y) = |y - \hat{y}(x)|\),其中 \(\hat{y}(x)\) 是预测值。在源分布P上,我们训练模型并计算校准集上的分数。
- 计算加权p值: 对于测试点 \(X_{n+1}^Q\),我们考虑一个候选值 \(y\)(比如 \(y=0\) 或 \(y=1\))。我们计算该候选点的非一致性分数 \(R(X_{n+1}^Q, y)\)。然后,我们将其与校准集中所有点的分数进行比较,但比较时每个校准点都被赋予一个权重,这个权重等于该点对应的 \(w(Y_i^P)\)。例如,校准集中一个 \(Y_i^P=1\) 的点,其权重为1.6;一个 \(Y_i^P=0\) 的点,其权重为0.4。测试点本身的权重为 \(w(y)\)。
- 构造预测集: 我们计算加权p值:
\[\hat{p}(y) = \frac{\sum_{i \in \text{Cal}} w(Y_i^P) \cdot \mathbb{I}[R(X_i^P, Y_i^P) \ge R(X_{n+1}^Q, y)] + w(y)}{\sum_{i \in \text{Cal}} w(Y_i^P) + w(y)}\]如果 \(\hat{p}(y) > \alpha\),则 \(y\) 被包含在预测集中。由于 \(Y\) 是二值的,预测集要么是 \(\{0\}\),\(\{1\}\),要么是 \(\{0, 1\}\)。
-
为什么这个例子能说明核心思路?
- 非可交换性被校正: 如果不加权,校准集(来自P)中 \(Y=1\) 的点太少(50%),而测试点(来自Q)更可能是 \(Y=1\)。直接比较分数会导致对 \(Y=1\) 的候选值过于严苛。通过给 \(Y=1\) 的点赋予更高权重(1.6),我们人为地“放大”了它们在P中的代表性,使其与Q的分布相匹配,从而校正了非可交换性。
- 权重估计是关键: 这个例子清晰地展示了,只要我们能准确估计出 \(w(y)\),加权共形预测就能恢复覆盖。本文的主要技术贡献就在于如何在没有目标标签的情况下估计这个 \(w(y)\)。
- 条件密度作为分数: 本文更进一步,使用条件密度 \(q(y|x)\) 作为非一致性分数,这比简单的残差更高效。在这个二值例子中,\(q(y|x)\) 可以通过贝叶斯公式和估计出的 \(w(y)\) 从 \(p(y|x)\) 转换得到,这体现了本文Section 2.2.2的思路。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题: 在回归任务下,当源分布和目标分布之间存在目标偏移(target shift)时,如何构造分布自由的预测集。论文处理了目标域完全无标签和部分有标签两种实际场景。
- 核心工具/方法: 提出了CPUTS(Conformal Prediction Under Target Shift)方法,其核心是:①通过B样条(B-spline)基函数在有限维空间内匹配源域和目标域的协变量分布,来估计似然比权重 \(w(y)\);②使用一个基于分位数过程的加权条件密度估计器来构造更高效的非一致性分数。
- 主要结论: ①在权重估计准确度足够高时,CPUTS能保证渐近的边际覆盖(Theorem 1);②所提出的权重估计器在标准正则性条件下以显式速率收敛到真实权重(Theorem 2);③模拟和真实数据(MIMIC-III)实验表明,CPUTS在保证覆盖的同时,能产生比仅使用源域或仅使用少量目标域标签的共形预测方法更紧凑的预测集。
关键设定与假设¶
- 核心假设:目标偏移(Target Shift):\(p(y) \neq q(y)\) 但 \(p(x|y) = q(x|y)\)。这是整个方法的基础。
- Assumption 1 (权重有限性):似然比权重 \(w(y) = q(y)/p(y)\) 在目标分布下几乎处处有限。这等价于 \(Q \ll P\),即目标分布绝对连续于源分布,确保目标分布的支持集是源分布支持集的子集。
- Assumption 2-4 (函数逼近与正则性):这些假设保证了权重函数 \(w(y)\) 和密度差函数 \(t(x) = q(x) - q_w(x)\) 可以被B样条和高斯径向基函数(RBF)以最优速率逼近,并且相关的Gram矩阵具有良好的条件数。这些是证明权重估计量收敛性的标准技术假设。
- Assumption 5 (维度与样本量关系):要求B样条维度 \(J_n\) 和RBF维度 \(K_n\) 的增长速度不能太快,以确保估计误差项消失。例如,\(K_n J_n \log n_P = o(n_P)\)。
- Assumption 6 (非奇异性):要求一些矩阵(如 \(U, V^\top U^{-1}V\))及其岭正则化版本的特征值有下界,以确保估计量的唯一性和数值稳定性。
相比已有文献的放宽或强化: - 放宽: 相比Tibshirani et al. (2019) 要求已知似然比,本文放宽到估计似然比。 - 强化: 相比Podkopaev & Ramdas (2021) 处理分类,本文处理回归,需要估计无限维的条件密度,技术上更复杂。 - 强化: 相比Lee et al. (2025) 推断参数,本文的目标是构造预测集,需要保证覆盖而非点估计的一致性。
主要结果¶
-
Theorem 1 (覆盖保证):
- 陈述:在Assumption 1下,CPUTS方法构造的预测集满足:
\[P(Y_{n+1} \in \hat{C}(X_{n+1}; \alpha)) \ge 1 - \alpha - \frac{1}{2} \mathbb{E}_{Y \sim P} |\hat{w}(Y) - w(Y)|\]
- 直觉:如果权重估计 \(\hat{w}\) 等于真实权重 \(w\),则覆盖保证是精确的 \(1-\alpha\)。如果估计有误差,覆盖会损失一个与 \(L_1\) 估计误差成比例的项。
- 必要条件:权重有限(Assumption 1)和权重估计的 \(L_1\) 误差可控。
- 解决的技术难点:将加权共形预测的有限样本覆盖保证与权重估计误差联系起来,给出了一个清晰的上界。
- 陈述:在Assumption 1下,CPUTS方法构造的预测集满足:
-
Theorem 2 (权重估计的收敛率):
- 陈述:在Assumptions 2-6下,权重估计量 \(\hat{w}\) 的 \(L_2\) 误差满足:
\[\|\hat{w} - w_0\|_{L_2}^2 = O_p\left(J_n^{-2r} + K_n^{-2s/p} + \frac{K_n J_n \log n}{n_P} + \frac{K_n \log n}{n_Q} + \delta_n^2 + \rho_n^2\right)\]
- 直觉:误差由四部分组成:B样条逼近误差(\(J_n^{-2r}\))、RBF逼近误差(\(K_n^{-2s/p}\))、源域估计误差(\(\frac{K_n J_n \log n}{n_P}\))、目标域估计误差(\(\frac{K_n \log n}{n_Q}\))和正则化误差(\(\delta_n^2, \rho_n^2\))。
- 必要条件:函数光滑性(\(r, s\))、基函数性质、样本量足够大。
- 解决的技术难点:将无限维的分布匹配问题转化为有限维的二次规划问题,并给出了其估计量的收敛率。这个率是显式的,并且通过选择最优的 \(J_n, K_n\) 可以达到非参数最优速率。
- 陈述:在Assumptions 2-6下,权重估计量 \(\hat{w}\) 的 \(L_2\) 误差满足:
证明路线与技术技巧¶
-
整体路线(权重估计部分):
- 问题转化:将估计 \(w(y)\) 转化为一个分布匹配问题:找到一个 \(w(y)\),使得重加权后的源分布 \(q_w(x) = \int w(y) p(x,y) dy\) 与目标分布 \(q(x)\) 尽可能接近。
- 无限维到有限维:用B样条基函数 \(B(y)\) 展开 \(w(y)\),用高斯RBF基函数 \(\psi(x)\) 展开密度差 \(t(x) = q(x) - q_w(x)\)。将分布匹配问题转化为一个关于B样条系数 \(\alpha\) 和RBF系数 \(\beta\) 的优化问题。
- 优化目标:最小化 \(t(x)\) 的 \(L_2\) 范数,即 \(\int t(x)^2 dx\)。通过代数运算,这个目标可以写成关于 \(\alpha\) 的二次型。
- 求解与正则化:得到 \(\alpha\) 的闭式解(依赖于样本矩 \(\hat{V}, \hat{u}\)),并引入岭正则化(\(\delta_n, \rho_n\))和约束(非负、归一化)来保证解的稳定性和合理性。
-
关键跳跃点:
- 从分布匹配到二次规划:将 \(\int t(x)^2 dx\) 展开并利用基函数的性质(如RBF的 \(L_2\) 内积有闭式解),将问题转化为一个关于 \(\alpha\) 的凸二次规划问题。这是整个估计方法的核心。
- 处理约束:权重 \(w(y)\) 必须非负且积分等于1。作者通过将约束施加在B样条系数 \(\alpha\) 上(\(\alpha^\top B(y) \ge 0\) 和 \(\alpha^\top \mathbb{E}_{Y\sim p}[B(Y)] = 1\))来处理,这在实际中通过数值优化实现。
-
技术技巧点名:
- B样条基函数:用于逼近一维权重函数 \(w(y)\)。其紧支撑性质允许对 \(w(y)\) 的局部变化进行灵活建模。
- 高斯径向基函数(RBF):用于逼近高维密度差函数 \(t(x)\)。其 \(L_2\) 内积有闭式解,避免了数值积分。
- 岭正则化(Ridge Regularization):引入 \(\delta_n, \rho_n\) 来保证矩阵求逆的数值稳定性,并防止过拟合。
- 分位数过程(Quantile Process):用于估计条件密度。通过估计一系列分位数,利用密度是分位数函数导数的逆这一关系(\(p(\xi(\tau|x)|x) = 1 / \xi'(\tau|x)\))来构造密度估计器(quotient estimator)。
真实例子与应用¶
- 数据:MIMIC-III临床数据库。响应变量 \(Y\) 是SOFA评分(序贯器官衰竭评估,0-24分),协变量 \(X\) 包括16个生命体征和实验室检查结果。
- 场景:源分布 \(P\) 是拥有私人、政府或自付保险的患者(\(n_P=9580\)),目标分布 \(Q\) 是享受医疗补助或医疗保险的患者(\(n_Q=4500\))。作者通过统计检验确认了目标偏移假设成立(\(p(y)\) 不同,\(p(x|y)\) 相同)。
- 方法应用:作者应用了CPUTS的“有标签”场景(Scenario 2),将部分目标域标签(\(n_0\))与源域数据结合。他们按种族分组进行分析,因为种族不满足目标偏移假设。
- 结果:
- CPUTS和仅使用目标域标签的CP-Q都达到了有效的覆盖概率(约90%)。
- 仅使用源域数据的CP-P由于分布偏移,覆盖概率有偏(如白人组为87.0%,低于名义水平)。
- CPUTS的预测区间长度显著短于CP-Q,尤其是在目标域标签数量较少时。例如,在亚裔群体中,CPUTS在94.4%的测试点上产生了比CP-Q更短的区间。
- 这个例子想说明什么:验证了CPUTS在真实世界数据中的有效性,特别是其在保证覆盖的同时,通过整合源域信息来提升预测效率的能力,尤其是在目标域标签稀缺时优势明显。
🔎 结论是否比证明窄¶
- 是。 Theorem 1 只给出了一个渐近的覆盖下界,并且这个下界依赖于权重估计的 \(L_1\) 误差。作者在结论(Section 6)中明确承认“The method only guarantees asymptotic marginal coverage in Theorem 1, leaving room for improvement.” 这意味着论文没有提供有限样本下的精确覆盖保证,而这是许多共形预测文献(如Lei et al., 2018)的核心卖点。作者将“有限样本保证”这个更强的结论留给了未来工作。
- 另一个窄化点:Theorem 2 的收敛率是在一系列很强的正则性假设(Assumptions 2-6)下证明的。这些假设在实际中很难验证,特别是关于函数光滑性(\(r, s\))和基函数性质的假设。因此,理论结果的实际适用性可能比论文声称的要窄。
四、开放问题¶
-
有限样本覆盖保证:Theorem 1 只提供了渐近覆盖保证。能否在目标偏移下,为CPUTS(或类似方法)提供有限样本的覆盖保证?这可能需要更精细的权重估计误差分析或不同的构造方法。扎根点:Section 6, "The method only guarantees asymptotic marginal coverage in Theorem 1, leaving room for improvement."
-
双重稳健性:Theorem 1 的覆盖误差依赖于权重估计的精度。能否构造一个双重稳健的预测集,使得只要权重估计或条件密度估计中有一个是准确的,覆盖就能得到保证?扎根点:Section 6, "...better properties may be achievable—such as the doubly robust property, where accurate estimation of either the weights or the conditional density would be sufficient."
-
多源数据整合:本文只使用了一个源分布。当有多个具有不同分布的源数据集时,如何最优地整合它们来提升对目标域的预测效率?扎根点:Section 6, "In practice, however, multiple source datasets with different distributions are often available, and integrating them to enhance predictive efficiency is an interesting direction for future work."
-
高维协变量下的计算与统计挑战:本文的权重估计方法依赖于RBF基函数,这在协变量维数 \(p\) 较高时会面临严重的“维数灾难”(逼近误差和计算复杂度)。是否存在更高效的方法(如基于随机森林或深度学习的分布匹配)来估计权重,并能同时提供理论保证?扎根点:Assumption 3 要求 \(s > p/2\),这在高维下非常苛刻。这是一个隐含的开放问题。
Maintained by 陈星宇 · Homepage · Source on GitHub