跳转至

Estimating Causal Effects from Data Generated by Stochastic Algorithms

作者: Susan Athey, Guido Imbens, Zoe Ji
主题: 因果推断
相关性: 7/10
链接: https://arxiv.org/abs/2607.05792


一、领域脉络与小综述

这个方向是什么

本文研究的根本问题是:在推荐系统、生成式AI等场景中,如何利用算法自身固有的随机性来估计内容特征(如回复风格、视频属性)对用户参与度(如点击率、停留时长)的平均因果效应。核心挑战在于:内容是个性化生成的,每个用户看到的内容几乎唯一,且内容特征与用户偏好、其他未观测特征高度相关,导致传统因果推断方法(如基于无混杂假设的回归或匹配)面临严重的混淆偏差。本文提出了一种新的识别策略,通过记录算法在生成内容时考虑的候选集(包括最终展示的和未展示的)以及它们的相对曝光概率,来恢复因果效应的点识别。

发展脉络(history)

  • 奠基工作:利用算法随机化进行离策略评估。Bottou et al. (2013) 在Bing搜索引擎中强制对广告位置进行随机化,以收集数据估计位置效应,并论证了离线评估交互式系统需要因果推理而非预测。Li et al. (2010, 2011) 开发了上下文Bandit算法用于新闻推荐,并展示了通过服务一个均匀随机的流量切片,可以对任何策略进行无偏离线评估。这些工作奠定了“利用算法随机化”这一核心思想的基础,但它们通常需要记录单个动作的边际倾向得分,且假设动作空间有限或可建模。
  • 主要进展:离策略评估与无混杂假设。Dudík et al. (2011) 提出了双重稳健估计量,Wang et al. (2017) 刻画了minimax评估误差。Schnabel et al. (2016); Joachims et al. (2017) 将曝光偏差问题视为缺失非随机(MNAR)结构,通过倾向得分加权进行校正。这些方法在动作空间不大或用户上下文可观测时有效,但都依赖于无混杂假设(即给定观测到的上下文,处理分配与潜在结果独立)。当动作空间极大(如生成式AI)或存在未观测混杂时,这些方法失效。
  • 当前Frontier:处理大动作空间与未观测混杂。Saito and Joachims (2022); Saito et al. (2023) 通过动作的嵌入(embedding)的倾向得分进行重加权,假设奖励仅通过嵌入依赖于动作,这是本文最接近的前身。另一条线是直接面对未观测混杂:Bennett and Kallus (2019) 利用代理变量,Kallus and Zhou (2021); Kallus et al. (2022) 采用敏感性分析,接受部分识别。Hernán and VanderWeele (2011); VanderWeele and Hernan (2013) 研究了多版本处理(compound treatment)问题,指出当版本未被建模时,识别出的量是版本混合效应。
  • 本文的位置:本文提出了一种新的数据范式——记录反事实曝光(LCE),即除了记录展示的内容及其特征,还记录至少一个未展示但本可能展示的候选内容,以及该未展示内容被展示的概率与已展示内容被展示的概率之比。在此数据下,作者证明了即使存在同时影响用户偏好和内容选择对的未观测混杂因子,内容特征的因果效应仍可被点识别。这不同于依赖无混杂假设的方法,也不同于接受部分识别的敏感性分析。本文的识别策略利用了算法内部的随机化,并将其记录为数据的一部分。

子线索聚类

  1. 基于无混杂假设的离策略评估:Schnabel et al. (2016); Joachims et al. (2017); Uehara et al. (2022); Dudík et al. (2011); Wang et al. (2017)。核心是假设给定观测上下文,处理分配是随机的。本文指出这些方法在上下文高维或唯一时面临挑战。
  2. 利用算法随机化进行识别:Bottou et al. (2013); Li et al. (2010, 2011); Langford et al. (2008); Narita et al. (2019)。核心是利用算法中已有的随机化(如Bandit的探索、A/B测试)来构造无偏估计。本文继承并扩展了这一思想,但要求记录更细粒度的数据(候选对及其相对概率)。
  3. 处理多版本处理与复合处理:Hernán and VanderWeele (2011); VanderWeele and Hernan (2013); Tsao et al. (2026)。核心是当名义处理有多个未观测版本时,识别出的效应是版本混合效应。本文的C-TACE estimand在结构上与此类似,但版本分布(即算法生成的内容分布)是已知的(由算法决定),而非需要建模的。
  4. 负采样与曝光偏差:He and McAuley (2016); Ding et al. (2018, 2019); Ma et al. (2024)。核心是利用未曝光项作为训练标签,而非作为因果识别的工具。本文指出这些方法不记录或使用特定对的曝光概率比,也不以内容特征的因果效应为目标。

这个方向在追问的核心问题

  1. 识别问题:在存在未观测混杂时,内容特征的因果效应能否被点识别?需要什么样的数据或假设?
  2. 估计问题:如何构造一个在给定数据下具有良好统计性质(如一致性、渐近正态性、半参数有效性)的估计量?
  3. 解释问题:当内容特征与其它未观测特征高度相关时,“内容特征的因果效应”究竟意味着什么?如何定义一个有意义的、可解释的因果参数?
  4. 数据可行性:所需的额外数据(未曝光项及其概率比)在实际系统中是否可获取、可记录?成本如何?

⚠️ 作者的 framing

  • 作者的缺口框架:作者将现有文献的缺口概括为:要么依赖无混杂假设(在个性化场景下难以成立),要么需要大量随机化实验(成本高、不现实),要么接受部分识别(结论不精确)。作者将自己的工作定位为“显然的下一步”:通过记录两个额外的数据元素(未曝光项和概率比),就能在不依赖无混杂假设的情况下实现点识别,且这些数据在现有系统中易于获取(如LLM的log-probability、推荐系统的候选集)。
  • 被淡化或回避的竞争路线
    • 基于嵌入的倾向得分重加权(Saito and Joachims, 2022):作者承认这是“最接近的前身”,但强调其需要“奖励仅通过嵌入依赖于动作”的假设,而本文不需要。作者没有深入讨论当嵌入空间足够丰富时,该假设是否可能近似成立,以及两种方法在效率上的比较。
    • 敏感性分析(Kallus and Zhou, 2021):作者将其定位为“接受部分识别”,而本文追求点识别。作者没有讨论在LCE数据不可得时,敏感性分析是否是更现实的选择,也没有比较两种方法对未观测混杂的鲁棒性。
  • 什么明显该被引/该存在、却没出现在intro里?:本文没有引用关于统计-计算权衡(statistical-computational tradeoff)的文献。在推荐系统或生成式AI场景中,内容空间极大,计算成本是核心约束。本文提出的方法(如逆概率加权、重放机制)的计算复杂度如何?是否存在计算上更高效但统计上稍弱的替代方案?这是一个值得研究者去查的问题。

张力

未见明显对立引用。各条子线索在假设和设定上不同,但结论并不直接矛盾。例如,基于无混杂假设的方法在假设成立时有效,而本文的方法在假设不成立时仍有效,两者是互补而非对立关系。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号

    • i: 用户/单元索引。
    • A: 所有可能内容的集合(内容空间,可能无限大)。
    • Ai: 用户i单元特定处理集,即算法为i生成的候选内容子集。本文主要考虑|Ai| = 2的情况,即Ai = {Ai(0), Ai(1)}
    • Wi ∈ {0, 1}: 随机分配指示符,决定展示Ai(0)还是Ai(1)
    • Ai = Ai(Wi): 用户i实际展示的内容。
    • Ai^N = Ai(1-Wi): 用户i未展示的候选内容。
    • Yi(a): 用户i在展示内容a时的潜在结果
    • Yi = Yi(Ai): 用户i实际观测结果
    • Yi^N = Yi(Ai^N): 用户i未观测潜在结果(对应未展示内容)。
    • f: A → R^d: 一个从内容空间到d维特征空间的映射函数。
    • Vi = f(Ai): 展示内容的特征向量(可观测)。
    • Vi^N = f(Ai^N): 未展示内容的特征向量(可观测)。
    • Xi: 用户i协变量(如用户画像、历史行为)。
    • h: R^d × R^d → R^p: 处理特征函数(TCF),是一个反对称函数,用于比较两个内容的特征差异。例如,h(v, v') = v - v'
    • τi = Yi - Yi^N: 用户i单元级因果效应
    • τh(δ) = E[τi | h(Vi, Vi^N) = δ]: 条件处理平均因果效应(C-TACE),是本文的核心estimand。
  • 模型

    • 数据生成机制:对于每个用户i,算法首先根据用户上下文Xi和潜在结果Yi(a)(可能相关)生成一个单元特定的候选集Ai = {Ai(0), Ai(1)}。然后,算法随机地从Ai中选择一个内容展示给用户,即Wi是随机分配的。用户根据展示的内容Ai产生结果Yi
    • 关键假设随机分配假设(Assumption 1):给定候选集Ai和潜在结果,Wi的分配是随机的,且概率为1/2(可推广到已知概率)。这个假设是本文所有识别结果的基础。
    • 待估对象:C-TACE τh(δ),即对于特征差异为δ的用户子群,其单元级因果效应τi的平均值。
  • 可观测数据

    • 研究者实际能观测到的是:对于每个用户i,观测到四元组(Yi, Vi, Vi^N, Xi)。即:用户的结果、展示内容的特征、未展示内容的特征、用户协变量。
    • 想要但观测不到的是:用户i的潜在结果Yi(Ai(0))Yi(Ai(1))(只能观测到其中一个),以及分配指示符Wi(因为ViVi^N是观测到的,但不知道哪个对应Wi=0Wi=1)。关键Vi^N是可观测的,这不同于传统因果推断中“缺失”的潜在结果。

第二步:讲最小内核

  • 最简特例:假设内容特征Vi二值的(0或1),例如,Vi=1表示“具体的”回复,Vi=0表示“不具体的”回复。我们关心的TCF是差值:h(v, v') = v - v'。那么h(Vi, Vi^N)只能取三个值:1, 0, -1。

    • h(Vi, Vi^N) = 1:展示的是具体回复(Vi=1),未展示的是不具体回复(Vi^N=0)。
    • h(Vi, Vi^N) = -1:展示的是不具体回复(Vi=0),未展示的是具体回复(Vi^N=1)。
    • h(Vi, Vi^N) = 0:展示和未展示的内容特征相同(都是0或都是1)。
  • 核心思路:在这个特例下,C-TACE τh(1) 就是“对于候选集中一个具体、一个不具体的用户,展示具体回复相对于展示不具体回复的平均因果效应”。定理1告诉我们,这个效应可以直接通过比较观测结果来识别: τh(1) = E[Yi | h(Vi, Vi^N) = 1] - E[Yi | h(Vi, Vi^N) = -1] 即,比较“展示具体、未展示不具体”的用户群的平均结果,与“展示不具体、未展示具体”的用户群的平均结果。为什么成立? 因为随机分配假设保证了,在h(Vi, Vi^N) ≠ 0的用户中,展示具体和不具体内容是等概率的,且与潜在结果无关。因此,这两个用户群在除了展示内容特征不同之外,其他所有方面(包括用户偏好、未观测特征)都是可比的。这个差值就是一个有效的因果效应估计。

  • 最小内核总结:本文的核心数学思想是:通过记录未展示内容的特征,我们可以将每个用户视为一个“微型实验”。在这个实验中,处理(展示哪个内容)是随机分配的。通过比较那些“展示高特征、未展示低特征”和“展示低特征、未展示高特征”的用户群,我们可以直接识别出特征差异的因果效应,而无需担心用户偏好等未观测混杂,因为这些混杂在同一个用户内部是恒定的,在比较中被差分掉了。

三、这篇论文做了什么

  • 三句话

    1. 研究了什么问题:在随机算法(如推荐系统、LLM)生成内容的场景下,如何利用算法自身的随机化来估计内容特征(如回复风格)对用户结果的因果效应,即使存在未观测混杂。
    2. 核心工具/方法:提出了“记录反事实曝光(LCE)”数据范式,要求记录未展示的候选内容及其与展示内容的相对曝光概率。基于此,构造了“伪实验”(pseudo experiment),将原始数据转化为类似标准随机实验的形式,从而通过简单的条件期望比较来识别“条件处理平均因果效应(C-TACE)”。
    3. 主要结论:证明了C-TACE在LCE数据下是可点识别的,且识别不依赖于无混杂假设。进一步,当曝光概率未知时,可以通过重放(replay)算法来估计,并提出了逆抽样(inverse sampling)方法以获得无偏权重。通过线性例子,展示了该方法相对于朴素回归、无混杂回归等方法的优势。
  • 关键设定与假设

    • 随机分配假设(Assumption 1):给定单元特定处理集AiWi的分配是随机的(概率为1/2或已知)。这是整个识别策略的基石。
    • 可重复随机化假设(Assumption 2):当曝光概率未知时,假设算法在给定配置下的随机化过程是可重复的,即重放(replay)得到的样本与原始曝光来自同一分布。这是第9节中估计概率比的基础。
    • 与已有文献的比较:本文的假设比基于无混杂假设的方法(如Schnabel et al., 2016)更弱,因为它不要求观测上下文Xi足以控制混淆。但本文的假设比纯粹的随机实验更强,因为它要求算法内部的随机化是已知且可记录的。与敏感性分析(如Kallus and Zhou, 2021)相比,本文追求点识别,而非部分识别。
  • 主要结果

    • 定理1(基本识别):在随机分配假设下,C-TACE τh(δ) 可以通过比较条件期望E[Yi | h(Vi, Vi^N) = δ]E[Yi | h(Vi, Vi^N) = -δ]来识别。这是最核心的识别结果,简单而强大。
    • 定理2(条件C-TACE识别):在随机分配假设下,给定对称函数g和协变量x,条件C-TACE τh,g(x, γ) 可以通过E[2D^h_i Yi | Xi=x, g(Vi, Vi^N)=γ, D^h_i ≠ 0]来识别,其中D^h_i是伪处理变量(取值为-1, 0, 1)。这为估计异质性效应提供了基础。
    • 定理3(非等概率分配):将识别结果推广到分配概率不为1/2的情况,此时伪处理D^h_i需要根据概率进行加权。
    • 定理4(逆抽样):当曝光概率未知但算法可重放时,通过逆抽样(负二项分布)得到的权重T_i/(2r)是无偏的,代入后仍可识别C-TACE。这解决了实际应用中概率不可得的问题。
  • 证明路线与技术技巧

    • 整体路线
      1. 定义伪实验:基于TCF h,将每个用户映射到一个伪处理D^h_i(-1, 0, 1)。D^h_i = 1表示“展示高特征、未展示低特征”,D^h_i = -1表示“展示低特征、未展示高特征”。
      2. 证明随机化性质:证明在D^h_i ≠ 0的子群中,伪处理D^h_i与伪潜在结果Y^h_i(-1), Y^h_i(1)是独立的(Lemma 2)。这是关键跳跃点:原始数据中的随机化(Wi)被转化为伪实验中的随机化(D^h_i)。
      3. 构造估计量:利用伪实验的随机化性质,C-TACE可以简单地表示为伪处理D^h_i与结果Yi的加权平均,即E[2D^h_i Yi | ...]
      4. 处理未知概率:当概率未知时,通过重放算法来估计。利用逆抽样(Lemma 5)获得无偏的权重估计,并证明其方差可控(Theorem 4)。
    • 关键跳跃点Lemma 2的证明。它需要证明,在原始随机分配假设下,构造出的伪处理D^h_i与伪潜在结果独立。这个证明依赖于一个关键观察:D^h_i的符号完全由h(Vi, Vi^N)决定,而h(Vi, Vi^N)ViVi^N的函数。由于Wi是随机分配的,ViVi^N的标签(哪个是展示的,哪个是未展示的)是随机的,因此h(Vi, Vi^N)的符号也是随机的,且与潜在结果无关。
    • 技术技巧点名
      • 伪实验构造:将原始数据转化为标准随机实验形式的核心技巧。
      • 逆概率加权:在处理非等概率分配时使用。
      • 逆抽样(Inverse Sampling):利用负二项分布的无偏性来估计概率的倒数,避免了固定样本量估计带来的偏差。
      • 重叠修剪(Overlap Trimming):通过修剪极端倾向得分(qi接近0或1)来控制方差,这与处理极端倾向得分的标准做法一致。
  • 真实例子与应用

    • 线性例子(Section 10):本文通过一个详细的线性数据生成过程(DGP)来阐明C-TACE的含义,并比较其与几种常见方法的优劣。这个例子虽然不是真实数据,但非常具有启发性。
      • 数据/场景:模拟了一个推荐系统,为每个用户从候选集中随机展示一个“推销文案”(pitch)。文案有两个特征:具体性(concreteness)和故事性(story)。用户有对具体性的偏好(可观测)和一个未观测特质。结果变量是用户是否批准贷款。
      • 方法应用:展示了如何应用C-TACE估计量(即比较h(Vi, Vi^N) > 0< 0的用户群的平均结果)来估计具体性的因果效应。
      • 结果
        • 与朴素回归比较:朴素回归(仅用展示内容的特征)会因混淆(用户偏好)而产生偏差。C-TACE无偏(Figure 2)。
        • 与无混杂回归比较:当存在未观测混杂时,即使控制了可观测协变量,无混杂回归仍有偏差。C-TACE因在用户内部做差分,不受未观测混杂影响(Figure 3)。
        • 与负样本比较:展示了不同负样本构造方式(如仅用成功案例、用候选集、用目录随机抽样)的偏差来源,强调了C-TACE的正确性(Section 10.6)。
        • 异质性分析:展示了如何区分真实的异质性(如交互效应)和由特征捆绑导致的虚假异质性(Figure 4)。
        • 安慰剂检验:展示了如何利用未展示内容的特征进行安慰剂检验,以检测是否存在未观测混杂(Figure 6)。
    • LLM评估例子(Section 11):提出了一个应用场景:比较两个LLM的性能。通过随机展示其中一个LLM的回复,并记录另一个LLM的回复作为未曝光项,可以利用本文方法估计“回复风格”等特征对用户评分的影响。这是一个将方法应用于实际问题的具体构想。
  • 🔎 结论是否比证明窄

    • 论文的结论是C-TACE在LCE数据下可被点识别。这个结论在随机分配假设下是严格证明的。然而,论文在引言和结论中多次暗示,LCE数据在现有系统中“易于获取”。这个“易于获取”的论断需要谨慎对待。例如,对于LLM,需要记录未展示的回复及其log-probability,这需要额外的API调用和存储成本。对于推荐系统,需要记录候选集和相对概率,这在许多生产系统中并非标准实践。因此,“易于获取”是一个关于数据可行性的论断,而非一个数学结论。论文在第9节讨论了如何通过重放来估计概率,但这又引入了新的假设(可重复随机化假设)。因此,结论的适用范围严格受限于数据是否满足LCE范式的要求。

四、开放问题

  1. 效率与半参数有效性:本文的C-TACE估计量(E[2D^h_i Yi | ...])是简单的矩估计。它的半参数效率界是什么?是否存在更高效的估计量(如双重稳健估计量)?这个问题扎根于论文的定理2,该定理给出了一个识别公式,但未讨论其效率性质。对于熟悉效率理论的研究者,这是一个自然的后续问题。
  2. 多个TCF的联合推断:论文第7节讨论了多个TCF的情况,并指出当两个伪处理完全相关时,无法识别条件效应。那么,在更一般的设定下,如何对多个C-TACE进行联合推断?如何构造一个同时估计多个特征效应的系统?这个问题扎根于Section 7的讨论,特别是关于E[τi | h1 > 0, D^{h,2}_i = d]对于d = -1, 1不可识别的结论。
  3. 自适应数据下的推断:论文的识别依赖于随机分配假设,但实际中算法可能是自适应的(如Bandit算法),其分配概率随时间变化。虽然论文引用了Hadad et al. (2021)和Zhan et al. (2021)的工作,但并未将本文的方法与自适应数据下的推断问题结合起来。如何将LCE数据与自适应重加权技术结合,以在自适应收集的数据上进行有效推断?这个问题扎根于论文的Related Literature部分对自适应数据文献的讨论。
  4. C-TACE与结构因果效应的桥梁:论文的C-TACE是一个“算法相关”的estimand,它平均了算法实际产生的特征捆绑。在什么条件下,C-TACE可以近似或等于一个更“结构”的因果效应(如保持其他特征不变时改变一个特征的效应)?论文的线性例子(Section 10)对此有所讨论,但未给出一般性条件。这个问题扎根于Section 10.2Section 13中对C-TACE解释的讨论。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论