Causal inference for group-contaminated structured outcomes: observable quotients, lossless reduction and exact randomization inference¶
作者: Usef Faghihi, Amir Saki
主题: 因果推断
相关性: 7/10
链接: https://arxiv.org/abs/2608.11954
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的根本问题是:当结构化结果(如图像、形状、网络)在观测前受到未知、单位特异、且可能与处理或结果相关的变换(如平移、旋转)污染时,如何对内在的潜在结果进行因果推断? 核心挑战在于,观测数据 X = Γ · Y(A) 中的变换 Γ 是未知的、可依赖于处理 A、协变量 C 或内在结果 Y(A) 本身,导致传统的“先配准、后分析”策略可能引入偏差或丢失信息。该方向当前处于从“假设结果已被正确观测”到“处理观测前污染”的过渡阶段,本文是这一过渡中的系统性理论构建。
发展脉络(history)¶
-
奠基工作:潜在结果框架与因果推断基础
- Rubin (1974) [19]:建立了潜在结果框架,定义了因果效应。本文引用它来定义内在潜在结果
Y(a)。这是整个因果推断领域的基石,但未考虑结果在观测前被变换污染的问题。
- Rubin (1974) [19]:建立了潜在结果框架,定义了因果效应。本文引用它来定义内在潜在结果
-
主要进展:结构化结果上的因果推断
- Kurisu et al. (2024) [11]、Bhattacharjee et al. (2025) [1]、Shin et al. (2024) [20]、Raykov et al. (2025) [15]:这些工作将因果推断扩展到非欧几里得空间(如度量空间、函数空间、流形)中的结构化结果。本文指出,它们“generally take the structured outcome as directly observed”(通常假设结构化结果被直接观测到),即假设结果在分析前已被正确配准或对齐。这留下了关键缺口:如果观测本身就受到未知变换污染,这些方法无法直接应用。
- Raykov et al. (2025) [15] 提到的“registration-based functional methods”是预处理步骤,但本文认为这只是一个“related preprocessing problem”,而非因果推断框架本身的一部分。
-
当前 Frontier:处理观测前变换的拓扑与几何方法
- Turner et al. (2014) [24]、Curry et al. (2022) [4]:这些工作研究了拓扑变换(如持续同调变换、欧拉特征变换)的单射性,即它们能否唯一地确定一个形状。本文引用它们来表明“Topological transforms can be injective on specified shape classes when sufficiently rich directional information is available”。这提供了一种思路:通过构造对变换不变的摘要(如拓扑特征)来识别形状。但本文的设定更一般:观测方程本身包含一个潜在的、单位特异的群作用,而目标不是低维摘要,而是完整的可观测轨道。
-
本文的位置:本文声称其贡献是在不受限制的潜在群污染下,对结构化结果进行因果推断的系统性理论综合。它不声称在经典成分(如最大不变量、Blackwell 比较、Haar 测度)上有原创性,而是将它们整合到一个统一的因果框架中,并提供了从理论到算法的完整工作流。
子线索聚类¶
- 因果推断基础:Rubin (1974) [19] 的潜在结果框架。这是所有因果推断工作的共同基础。
- 非欧几里得结果上的因果推断:Kurisu et al. (2024) [11], Bhattacharjee et al. (2025) [1], Shin et al. (2024) [20], Raykov et al. (2025) [15]。这些工作假设结果已被正确观测,专注于处理非欧几里得空间中的估计问题(如 Fréchet 均值、双稳健估计)。
- 形状与拓扑的变换不变摘要:Turner et al. (2014) [24], Curry et al. (2022) [4]。这些工作研究如何构造对变换(如旋转、平移)不变的拓扑特征,并证明其单射性。本文的“最大不变量”概念与此相关,但本文的目标是保留所有可测不变信息,而非仅拓扑摘要。
- 统计实验比较与充分性:Blackwell (1953) [2], Le Cam (1986) [12], Torgersen (1991) [23]。这些是本文“商约化是否统计无损失”问题的理论基础。本文使用 Blackwell 等价性来刻画商约化何时是充分的。
这个方向在追问的核心问题¶
- 可观测性边界:在观测前污染下,内在潜在结果
Y(a)的哪些信息是可被一致恢复的?答案:只有那些在群轨道上为常数的目标(即不变目标)。 - 因果识别:在什么条件下,观测到的商分布
P(M(X) | A, C)能识别其干预分布P(M(Y(a)))?答案:在无混淆性、一致性、正值性等标准假设下,通过调整公式即可识别。 - 统计充分性:将原始观测
X约化为商M(X)是否会丢失关于完整实验{P_θ}的统计信息?答案:仅在特定条件下(如条件 Haar 污染)才无损失。最大不变量不等于充分统计量。 - 算法与推断:如何为具体的数据结构(如格点图像)构造可计算的最大不变量,并基于此进行有效的因果推断(如随机化检验)?
⚠️ 作者的 framing¶
- 作者把缺口 frame 成什么:作者将现有工作的缺口 frame 为“假设结构化结果被直接观测到”,而本文处理的是“观测前受到未知、单位特异、且可能与处理或结果相关的变换污染”这一更现实的设定。作者将本文定位为“theorem-to-algorithm-to-application account”,即从理论到算法再到应用的完整叙述。
- 哪些竞争路线被他淡化或回避了:
- “先配准、后分析”的预处理路线:作者将其归为“a related preprocessing problem”,并暗示其可能不适用于变换依赖于处理或结果的情况。但并未深入讨论配准方法(如图像配准、函数对齐)在因果推断中的局限性,也未与这些方法进行实证比较。
- 基于深度学习的端到端不变特征学习:作者完全未提及。在图像分析中,使用 CNN 或 Transformer 学习对平移、旋转等变换鲁棒的特征是常见做法。本文的“最大不变量”是一种显式、可审计的构造,而深度学习方法是隐式、黑箱的。作者回避了这一竞争路线,可能因为其理论可解释性和可审计性不如本文方法。
- 什么明显该被引 / 该存在、却没出现在 intro 里?
- 关于“群不变性”与“因果推断”的交叉文献:在因果推断中,利用群不变性进行识别和估计是一个活跃的子领域(如 invariant causal prediction, anchor regression)。这些工作通常假设存在一个不变集,其分布在不同环境(干预)下保持不变。本文的设定(变换污染)与这些工作有本质不同,但“群不变性”这一核心概念是共通的。未引用这些文献是一个值得注意的缺失。
- 关于“测量误差”的因果推断文献:本文的模型
X = Γ · Y(A)可以看作是一种特殊的、结构化的测量误差模型。因果推断中处理测量误差的文献(如 IV 方法、代理变量方法)非常丰富。本文的“商约化”策略与这些方法有何联系与区别?作者未提及。
张力¶
未见明显对立引用。所有被引工作都在各自的子领域内发展,没有直接矛盾。本文的贡献在于将它们整合到一个新框架下,而非挑战现有结论。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
A:处理变量,取值于有限集A(如{0, 1})。C:观测到的预处理协变量,取值于标准 Borel 空间C。Y(a):内在潜在结果,即单位在接收处理a后、在受到任何观测前变换之前的原始结构化结果。取值于标准 Borel 空间Y。这是想要但观测不到的量。Γ:未知的、单位特异的群元素,作用于Y。取值于可测群G。这是潜在 / 不可观测的量。X:实际观测到的结果,满足X = Γ · Y(A)。这是可观测的量。M: Y → S:一个 Borel 可测的最大不变量。它将每个y映射到其群轨道的唯一标签M(y)。S是商空间。Q(a) = M{Y(a)}:内在潜在结果的商(轨道标签)。这是想要但观测不到的量。Q = M(X):观测结果的商。这是可观测的量。O_full = (C, A, X):完整实验的观测数据。O_quot = (C, A, Q):商实验的观测数据。
-
模型:
- 数据生成机制:
(C, A, {Y(a)}_{a∈A}, Γ) ~ P,其中P是联合分布。观测到的数据是O = (C, A, X),其中X = Γ · Y(A)。 - 关键假设:
Γ的分布不受限制。它可以依赖于C、A和{Y(a)}。这意味着我们不能假设Γ是随机的、与结果独立的,或服从任何特定分布。这是本文的核心设定,也是与“先配准”方法的关键区别。 - 要估的对象:内在潜在结果
Y(a)的分布,或其任何不变目标τ(Y(a))的分布。由于Y(a)本身不可观测,我们只能希望识别其商Q(a)的分布。
- 数据生成机制:
-
可观测数据:
- 可观测:
C(协变量)、A(处理)、X(变换后的结果)。 - 不可观测:
Y(a)(内在结果)、Γ(变换)、Q(a)(内在结果的商)。注意Q(a)虽不可直接观测,但可通过Q = M(X)间接获得,因为M(X) = M(Γ · Y(A)) = M(Y(A)) = Q(A)。所以Q是可观测的,且等于Q(A)。
- 可观测:
第二步:讲最小内核¶
最简特例:考虑一个最简单的群作用——符号翻转。
-
设定:
- 结果空间
Y = ℝ(实数)。 - 群
G = {+1, -1},作用为乘法:g · y = g * y。即,观测到的结果X要么是内在结果Y(A),要么是其相反数。 - 处理
A ∈ {0, 1},协变量C可忽略(或为常数)。 - 关键:
Γ可以依赖于A和Y(A)。例如,如果Y(1) > 0,则Γ = -1;否则Γ = +1。这意味着变换是“有信息的”。
- 结果空间
-
最大不变量:
- 对于这个群作用,轨道是
{y, -y}。一个最大不变量是M(y) = |y|(绝对值)。因为M(y) = M(z)当且仅当z = y或z = -y。 - 商空间
S = [0, ∞)。
- 对于这个群作用,轨道是
-
可观测数据:
- 我们观测到
X = Γ * Y(A)。例如,如果Y(1) = 5且Γ = -1,则我们观测到X = -5。 - 我们计算
Q = M(X) = |X|。在这个例子中,Q = | -5 | = 5。
- 我们观测到
-
核心思路:
- 可观测性:我们能从
X中恢复Y(A)的什么信息?根据定理 2.1,只有不变目标是可恢复的。τ(y) = |y|是不变的,所以我们可以通过D(X) = |X|来恢复它。但τ(y) = y(符号)不是不变的,所以无法恢复。例如,观测到X = -5,我们无法知道内在结果是5还是-5。 - 因果识别:我们能识别
Q(1) = |Y(1)|的分布吗?可以,只要标准因果假设成立(无混淆性、一致性、正值性)。因为Q = M(X) = |Y(A)| = Q(A),所以P(Q(1) ∈ B) = ∫ P(Q ∈ B | A=1, C=c) dP_C(c)。这个调整公式是有效的,无论Γ的分布如何。 - 统计充分性:将
X约化为Q = |X|是否丢失了关于完整实验{P_θ}的信息?不一定。考虑一个参数化模型:P_θ(Y(1) = 5) = θ,P_θ(Y(1) = -5) = 1-θ。假设Γ的分布是:如果Y(1) = 5,则Γ = -1以概率 1;如果Y(1) = -5,则Γ = +1以概率 1。那么观测到的X总是-5。完整实验O_full的似然是P_θ(X = -5) = 1,与θ无关,所以θ不可识别。商实验O_quot的似然是P_θ(Q = 5) = 1,也与θ无关。两者等价,都无信息。但如果Γ的分布是:Γ = +1以概率 1,则X = Y(A)。此时O_full的似然是P_θ(X = 5) = θ,θ可识别。而O_quot的似然是P_θ(Q = 5) = 1,θ不可识别。因此,商约化丢失了信息。这正是例 3.3 的核心思想:最大不变量不是充分统计量。
- 可观测性:我们能从
总结:这个最小内核清晰地展示了本文的三个核心层次: 1. 可观测性:只有轨道上的常数(如绝对值)是可恢复的。 2. 因果识别:商(如绝对值)的因果效应可以通过标准调整公式识别,不受变换污染影响。 3. 统计充分性:商约化可能丢失信息,需要额外条件(如条件 Haar 污染)才能保证无损失。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在结构化结果(如图像)观测前受到未知、单位特异、且可能与处理或结果相关的群变换污染时,如何刻画可观测信息、进行因果识别,并判断商约化是否统计无损失。
- 核心工具 / 方法:群作用下的最大不变量、Blackwell 实验比较理论、条件 Haar 测度、商忠实重建定理、以及针对格点图像的显式最大不变量构造与配对交换随机化检验。
- 主要结论:① 只有不变目标是可一致恢复的,最大不变量保留所有可测不变信息;② 商约化是统计无损失的当且仅当存在一个无参数的商忠实核(即给定商后的条件分布与参数无关);③ 条件 Haar 污染是导致无损失的一个特例;④ 为格点图像构造了平移和四分之一旋转下的最大不变量,并基于此设计了精确的有限样本随机化检验。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
- 空间假设:
Y,C,S,G都是标准 Borel 空间。G是一个可测群,并通过联合 Borel 映射作用于Y。这是保证可测性和分解定理成立的技术性假设,在统计应用中通常满足。 - 群作用:
G通过等距同构作用于Y(定理 5.1 需要)。对于格点图像,G是半直积Z² ⋊ C₄(整数平移和四分之一旋转)。 - 因果假设(定理 2.5):
- 商一致性:
Q = M(X) = M(Y(A))。这由最大不变量的不变性自动保证,无需额外假设。 - 无混淆性:
Q(a) ⟂⟂ A | C。这是标准假设,在随机化实验中由设计保证。 - 正值性:
P(A=a | C) > 0a.s.。标准假设。
- 商一致性:
- 统计充分性假设(定理 3.2):
- 存在无参数的商忠实核:存在一个与参数
θ无关的 Markov 核K,使得P_θ^full = P_θ^quot K。这是商约化无损失的充要条件。 - 条件 Haar 污染(推论 3.4):
Law_θ(Γ | C, A, Y(A)) = μ_Ga.s.,其中μ_G是紧群G上的归一化 Haar 测度。这是一个充分但不必要的条件,它保证了商忠实核的存在。
- 存在无参数的商忠实核:存在一个与参数
- 图像构造假设(第 6 节):
- 图像空间
X_{q,L}包含q通道、8 位、有限支撑的Z²函数,其边界框不超过L行和列。这保证了平移归一化和有限旋转最小化的可行性。
- 图像空间
- 随机化检验假设(定理 7.1):
- 无干扰:一个单位的潜在结果不受其他单位处理的影响。
- 条件均匀性:在给定所有潜在结果和设计信息后,处理分配向量
Z在{0,1}^B上均匀分布。这是配对随机化实验的设计保证。
相比已有文献的放宽或强化: * 放宽:与 Kurisu et al. (2024) 等假设结果被直接观测的工作相比,本文放宽了“结果已被正确配准”的假设,允许观测前存在未知、有信息的变换。 * 强化:与拓扑变换工作 (Turner et al., 2014) 相比,本文的设定更一般,因为它不要求变换是“无信息的”或可被低维摘要唯一识别。本文的目标是完整的可观测轨道,而非特定拓扑特征。
主要结果¶
定理 2.1 (Sharp observability):一个 Borel 目标 τ: Y → S 可被一致恢复当且仅当它是 G-不变的。这是本文的基石,给出了可观测性的精确边界。
定理 3.2 (Boundary of lossless quotient reduction):商约化是统计无损失的(即 E_full 与 E_quot Blackwell 等价)当且仅当存在一个无参数的商忠实核。这个定理将充分性问题转化为一个关于条件分布是否依赖于参数的问题,是本文的核心理论贡献之一。
推论 3.4 (Conditional-Haar Blackwell equivalence):如果 Γ 在给定 (C, A, Y(A)) 后服从紧群 G 上的 Haar 测度,则商约化是无损失的。这是一个重要的特例,它给出了一个可验证的充分条件(尽管在现实中很难验证)。
定理 6.1 (Lattice rigid-motion canonicalization):为格点图像 X_{q,L} 在 Z² ⋊ C₄ 作用下构造了一个 Borel 可测的最大不变量 c。这是将理论应用于实际图像数据的关键步骤。
定理 7.1 (Finite-sample randomization validity):在配对随机化实验和 Fisher 尖锐零假设下,基于商 Q 的配对交换检验是精确有效的(拒绝概率 ≤ α)。这保证了因果推断的有限样本有效性。
证明路线与技术技巧¶
定理 3.2 的证明路线:
1. 正向 (1) ⇒ (2):如果存在一个与 θ 无关的正则条件分布 K,则 P_θ^full(B) = ∫ K(s, B) P_θ^quot(ds)。由于 K 是给定 O_quot 的条件分布,它必然支持在 T^{-1}({s}) 上,因此是商忠实的。所以 P_θ^full = P_θ^quot K。
2. 反向 (2) ⇒ (1):假设存在无参数的商忠实核 K 使得 P_θ^full = P_θ^quot K。需要证明 K 是 O_full 给定 O_quot 的正则条件分布。通过验证 P_θ^full(B ∩ T^{-1}(D)) = ∫_D K(s, B) P_θ^quot(ds) 即可。这个等式成立是因为 K 的商忠实性保证了它在纤维 T^{-1}({s}) 上的支撑,从而 K(s, B ∩ T^{-1}(D)) = 1_D(s) K(s, B)。
3. 关键跳跃点:证明 K 的商忠实性(即 K(s, T^{-1}({s})) = 1)是连接两个方向的桥梁。没有这个性质,一个任意的反向核可能通过混合不同商值的观测来重构边际分布,从而不是真正的条件分布。
4. 技术技巧:使用了Blackwell 实验比较的标准框架,以及正则条件分布的分解恒等式。
定理 6.1 的证明路线:
1. 平移归一化:对于非零图像 x,找到其支撑边界框的左下角 b(x),然后平移 -b(x),使得边界框的左下角对齐到原点。这消除了所有整数平移。
2. 旋转归一化:对平移归一化后的图像,应用四个四分之一旋转 (0, r)·x,得到四个候选图像 x_r。
3. 字典序最小化:将每个候选图像 x_r 序列化为一个有限向量 κ(x_r)(包含边界框尺寸和所有像素值)。选择使 κ(x_r) 字典序最小的那个 r,并输出对应的候选图像 c(x)。
4. 证明不变性:对于任何 (t, s)·x,其四个旋转候选与 x 的四个旋转候选相同,只是索引被 s 循环移位。因此字典序最小的元素相同,所以 c((t, s)·x) = c(x)。
5. 证明最大性:如果 c(x) = c(y) = z,则存在 (u, r) 和 (v, s) 使得 z = (u, r)·x 且 z = (v, s)·y。因此 y = (v, s)^{-1}(u, r)·x,所以 x 和 y 在同一轨道上。
6. 技术技巧:结合了显式截面(平移归一化)和有限群最小化(四分之一旋转)。对于非紧致群(平移),通过构造一个规范的代表元来避免引入概率测度。
真实例子与应用¶
-
模拟研究(第 8 节):
- 数据:模拟的 28×28 六通道图像,包含 8 个随机化块,每块 2 个单位,每个单位 2 个位点。处理效应是添加一个同心环,强度
η ∈ {0, 0.35, 0.70, 1.00}。 - 方法应用:对每个模拟图像,施加依赖于处理、形态、单位身份和种子的确定性平移和四分之一旋转。然后应用本文的商约化(最大不变量)和配对交换检验。
- 结果:在
η=0(无效应)时,商检验的拒绝率为 0.052(接近名义水平 0.05),而原始像素检验的拒绝率为 1.000(因为变换本身产生了虚假差异)。随着η增加,商检验的势增加到 0.992。 - 说明:验证了商检验在变换污染下的有效性(控制第一类错误)和势(检测真实效应)。同时,原始像素和矩配准方法的诊断性结果(高拒绝率)说明了不处理变换污染的后果。
- 数据:模拟的 28×28 六通道图像,包含 8 个随机化块,每块 2 个单位,每个单位 2 个位点。处理效应是添加一个同心环,强度
-
RxRx1 确认实验(第 9 节):
- 数据:RxRx1 数据集中的 HUVEC 细胞图像,包含 160 个孔、320 个位点。处理是两种不同的 siRNA 试剂。
- 方法应用:对每个位点的图像,施加一个依赖于种子、孔标识、位点、处理和形态分数的确定性变换(平移和四分之一旋转)。然后应用本文的商约化(最大不变量)和配对交换检验。
- 结果:主要对比(siRNA 384 vs siRNA 747)的商检验
p值为 0.0078,拒绝了 Fisher 尖锐零假设。二次对比中,没有一个在 Holm 校正后显著。 - 说明:展示了本文方法在真实生物图像数据上的应用。通过施加已知的、有信息的变换,作者创造了一个“受控的未知变换”实验,从而能够验证方法的有效性。精确的
p值(0.0078)是有限样本有效的。
🔎 结论是否比证明窄¶
- 定理 5.1 (Quotient-law and MMD stability) 的结论是条件性的。它假设存在一个 Lipschitz 商表示
M(满足d_S(M(y), M(z)) ≤ L_M d_G(y, z))。作者在图像构造部分明确指出,字典序规范化器不一定是全局 Lipschitz 的。因此,定理 5.1 不能直接用于证明近似污染实验(表 5)中p值的稳定性。作者诚实地说:“The approximate-action experiment in Table 5 therefore remains an empirical sensitivity analysis; it is not retroactively certified by Theorem 5.1 unless (5.2) is verified on the relevant image class.” 这是一个结论比证明窄的典型例子:定理的结论(稳定性界)只在更强的假设下成立,而这些假设在主要应用场景中未被验证。 - 推论 3.4 (Conditional-Haar Blackwell equivalence) 是一个特例。作者在引言中强调“It is not imposed in the main model.” 这意味着本文的主要理论(可观测性、因果识别)并不依赖于这个强假设。然而,在讨论“统计无损失”时,这个特例是唯一被明确给出的充分条件。对于更一般的、非 Haar 的变换分布,商约化是否无损失是一个开放问题。作者没有给出任何其他可验证的充分条件。
四、开放问题¶
-
非紧致群下的统计充分性:本文的统计充分性理论(定理 3.2)适用于一般群,但唯一给出的可操作充分条件是紧致群上的条件 Haar 污染(推论 3.4)。对于非紧致群(如平移群
Z²),是否存在其他可验证的条件,使得商约化是统计无损失的?这扎根于推论 3.4 的局限性以及第 6 节中处理非紧致平移群时采用“显式截面”而非概率方法的做法。 -
Lipschitz 商嵌入的构造:定理 5.1 的稳定性结论依赖于商表示
M的 Lipschitz 性质。本文的字典序规范化器不满足此性质。能否为格点图像(或更一般的结构化结果)构造一个 Lipschitz 的、可计算的最大不变量? 这扎根于定理 5.1 的条件性以及作者在讨论中明确指出的“Establishing a Lipschitz quotient embedding on a scientifically relevant image class is a separate research problem.” -
与深度学习不变特征的关系:本文的显式最大不变量构造与深度学习中通过数据增强或特定架构(如 CNN)学习的不变特征有何理论联系与区别?后者是否能在某些条件下近似达到“最大不变量”的信息保留能力?这扎根于作者在 framing 中回避了深度学习路线,但这是一个明显的、值得探索的竞争或互补方向。
-
更一般的污染模型:本文假设污染是群作用
X = Γ · Y(A)。如果污染是更一般的、非群结构的变换(如非线性形变、裁剪、遮挡),本文的理论框架(可观测性、商约化)能否推广?这扎根于本文对群结构的依赖(如轨道、最大不变量、Haar 测度)。
Maintained by 陈星宇 · Homepage · Source on GitHub