Debiased Inference for AI-Generated Data without Gold-Standard Labels: Identification via Multiple Imperfect Measurements¶
作者: Naoki Egami, Sooahn Shin
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2608.18294
一、领域脉络与小综述¶
这个方向是什么¶
本子方向的核心问题是:当研究者使用AI(如大语言模型LLM)生成的变量(如文本情感、主题分类)作为下游统计分析(如回归、均值比较)的关键变量时,如何校正因AI测量误差(非随机、非经典)导致的偏差,从而获得有效的统计推断。当前成熟度:这是一个快速发展的交叉领域,连接了测量误差模型、半参推断和AI应用,但大多数现有方法仍依赖于金标准标签(人工标注),而本文试图在无金标准标签的条件下解决该问题。
发展脉络(history)¶
- 奠基工作:经典测量误差与非参数潜变量模型。早期工作如Kruskal (1977) 和 Allman, Matias and Rhodes (2009) 建立了通过CP分解(Candecomp/Parafac)识别离散潜变量的理论基础,其核心是条件独立假设:多个不完美测量在给定真实标签下独立。Dawid and Skene (1979) 将该结构应用于众包标注的EM估计。这些工作奠定了“用多个代理变量替代不可观测真实标签”的识别策略,但未涉及下游推断的偏差校正。
- 主要进展:基于金标准标签的半参校正方法。Robins, Rotnitzky and Zhao (1994) 和 Chernozhukov et al. (2018) 发展了双稳健(doubly robust)和去偏机器学习(DML)框架,为下游推断中的测量误差校正提供了半参工具。Egami et al. (2023) 的DSL和Angelopoulos et al. (2023) 的PPI将这一框架应用于AI生成数据,假设研究者控制金标准标签的抽样设计,从而无需对AI测量误差做任何假设。这些方法有效但依赖金标准标签。
- 当前frontier:放松金标准标签的假设。近期工作开始探索无金标准标签的路径。Battaglia et al. (2024) 假设测量误差与抽样误差同阶并随样本量衰减。Chen, Rambachan and Tamer (2026) 利用外部校准的得分和事件限制推导部分识别区间,允许代理变量间的任意依赖。本文(Egami & Shin, 2026)则回到非参数潜变量模型传统,通过放宽条件独立假设(允许以观测特征为条件)和引入半参效率理论,在无金标准标签下实现点识别和有效推断。
- 本文的位置:本文是“无金标准标签”路线上的一个关键进展。它通过将经典CP分解识别与半参去偏估计(特别是Zhou and Tchetgen Tchetgen, 2024; Guo, Shpitser and Ogburn, 2026)结合,首次将多个不完美测量的框架推广到一般下游分析(不仅限于因果效应),并系统处理了条件独立假设的可行性和诊断。
子线索聚类¶
- 基于金标准标签的校正方法:DSL (Egami et al., 2023)、PPI (Angelopoulos et al., 2023)、MAR-S (Carlson and Dell, 2025) 等。核心:利用已知抽样设计的金标准标签,通过双稳健或控制变量法校正偏差,对AI测量误差无假设。
- 基于代理变量的识别方法:经典潜变量模型 (Kruskal, 1977; Allman, Matias and Rhodes, 2009)、众包模型 (Dawid and Skene, 1979; Zhang et al., 2016)、张量方法 (Anandkumar et al., 2014)。核心:通过条件独立假设,利用多个代理变量识别潜变量分布,但通常不直接处理下游推断。
- 因果推断中的代理变量方法:Proximal causal inference (Miao, Geng and Tchetgen Tchetgen, 2018; Zhou and Tchetgen Tchetgen, 2024; Guo, Shpitser and Ogburn, 2026)。核心:利用负对照(negative control)变量处理未观测混杂或潜变量,发展半参效率理论。本文直接借鉴了Zhou and Tchetgen Tchetgen (2024) 和 Guo, Shpitser and Ogburn (2026) 的桥函数(bridge function)构造和Neyman正交性思想。
这个方向在追问的核心问题¶
- Q1(识别):在无金标准标签时,如何从多个不完美测量中识别下游目标参数(如回归系数)?需要什么假设?
- Q2(估计与推断):如何构造一个一致且渐近正态的估计量,使得其收敛速度不受第一阶段潜变量模型估计误差的拖累(即实现Neyman正交性)?
- Q3(假设评估):条件独立假设在AI标注场景下是否合理?如何设计测量过程使其更可信?如何诊断其违反?
- Q4(效率):增加不完美测量的数量是否总能提升下游推断的效率?最优组合方式是什么?
⚠️ 作者的framing¶
- 作者把缺口frame成什么:作者将现有方法(DSL/PPI)的“金标准标签依赖”视为主要瓶颈,而将经典潜变量模型的“无条件条件独立假设”视为过于严格。因此,本文的“显然的下一步”是:在保留条件独立假设核心结构的同时,通过允许以丰富的观测特征(如文本嵌入)为条件来放松该假设,并利用半参理论将其与一般下游分析连接。作者强调DMM与DSL/PPI是互补的,而非替代。
- 哪些竞争路线被淡化或回避:作者淡化了Battaglia et al. (2024) 的“测量误差与抽样误差同阶”假设路径,以及Chen, Rambachan and Tamer (2026) 的部分识别路径。作者明确说DMM是“点识别”而后者是“部分识别”,但未深入比较两种路径在应用中的优劣(例如,当条件独立假设严重违反时,部分识别可能更稳健)。
- 什么明显该被引/该存在、却没出现在intro里:作者未引用关于“测量误差模型中的非参数识别与效率”的综述性工作,如Schennach (2016, 2022) 的《Annual Review of Economics》文章(虽然正文引了,但intro未突出)。此外,关于“高维协变量下条件独立假设的检验”的计量经济学文献(如关于条件矩检验的文献)未被提及,而这与本文Section 5的诊断工具直接相关。
张力¶
未见明显对立引用。各子线索的工作在各自假设下自洽,主要张力在于“是否依赖金标准标签”和“条件独立假设的强弱”之间的权衡,作者将其frame为互补关系。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
- 符号:
- \(X^*_i \in \{0,1\}\):第 \(i\) 个单元的真实标签(潜变量,不可观测)。这是下游分析的目标变量。
- \(Y_i\):下游分析中的因变量(可观测)。
- \(W_i\):下游分析中的协变量(可观测)。
- \(\widetilde{X}_i = (X^{(1)}_i, \ldots, X^{(J)}_i)\):\(J\) 个不完美代理变量(可观测),每个 \(X^{(j)}_i \in \{0,1\}\)。例如,来自不同LLM的标注结果。
- \(D_i\):辅助的输入或标注层面信息(可观测),如文本嵌入、标注任务难度。用于放宽条件独立假设。
- \(\widetilde{D}_i = (D_i, W_i, Y_i)\):用于条件独立假设的完整条件集。
- \(\beta \in \mathbb{R}^{d_\beta}\):下游分析中感兴趣的有限维参数。
- \(\psi^F(Y, X^*, W; \beta)\):全数据矩函数(full-data moment function)。如果 \(X^*\) 可观测,\(\beta^*\) 是 \(E[\psi^F(Y, X^*, W; \beta)] = 0\) 的唯一解。
- \(\eta^*_{j,a}(d) = \Pr(X^{(j)} = 1 \mid X^* = a, \widetilde{D}=d)\):条件分类率(conditional classification rate),即第 \(j\) 个代理变量的真阳性率(\(a=1\))或假阳性率(\(a=0\))。这是需要识别的关键“ nuisance function”。
- \(M_j(\widetilde{D}; \eta^*) = \frac{X^{(j)} - \eta^*_{j,0}(\widetilde{D})}{\eta^*_{j,1}(\widetilde{D}) - \eta^*_{j,0}(\widetilde{D})}\):单代理桥函数(single-proxy bridge function)。其关键性质:\(E[M_j \mid X^*, \widetilde{D}] = X^*\)。
-
\(H^R(\widetilde{X}, \widetilde{D}; \eta^*)\):稳健桥函数(robust bridge function),由多个 \(M_j\) 的多项式组合而成,满足 \(E[H^R \mid X^*, \widetilde{D}] = X^*\) 且具有Neyman正交性。
-
模型:
- 数据生成机制:假设存在一个潜变量 \(X^*\),研究者无法直接观测。研究者能观测到 \(J \ge 3\) 个代理变量 \(X^{(j)}\),这些代理变量在给定 \(X^*\) 和 \(\widetilde{D}\) 下条件独立(Assumption 3.1)。每个代理变量的误差结构由条件分类率 \(\eta^*_{j,a}(\widetilde{D})\) 完全刻画,这些分类率可以随代理变量 \(j\) 和单元 \(i\)(通过 \(\widetilde{D}\))变化。
-
下游模型:研究者指定一个矩条件 \(E[\psi^F(Y, X^*, W; \beta)] = 0\) 来定义目标参数 \(\beta^*\)。该矩条件可以是线性回归、逻辑回归等,且不要求模型正确设定(misspecification下 \(\beta^*\) 解释为总体投影参数)。
-
可观测数据:
- 可观测:\(\{Y_i, W_i, \widetilde{X}_i, D_i\}_{i=1}^n\)。即下游因变量、协变量、多个代理变量、辅助信息。
- 不可观测(潜变量):\(X^*_i\)。这是下游分析真正需要的变量,但被误差污染。
- 关键区分:研究者“想要但观测不到”的是 \(X^*\)。所有推断必须基于可观测数据,通过假设(条件独立)和识别策略(CP分解)来“恢复” \(X^*\) 在下游矩函数中的作用。
第二步:讲最小内核¶
最简特例:\(J=3\) 个代理变量,均为二值,且 \(\widetilde{D}\) 为空集(即经典无条件条件独立假设)。下游分析为线性回归:\(Y_i = \beta_0 + \beta_1 X^*_i + \epsilon_i\),目标估计 \(\beta_1\)。
在这个特例下,核心问题退化为: - 识别:如何从三个二值代理变量 \(X^{(1)}, X^{(2)}, X^{(3)}\) 的联合分布中,识别出每个代理的误分类率 \(\eta^*_{j,a}\)? - 估计:如何利用识别的 \(\eta^*_{j,a}\) 构造一个关于 \(\beta_1\) 的无偏矩估计,且该估计对 \(\eta^*_{j,a}\) 的估计误差不敏感?
核心思路(CP分解 + 稳健桥函数): 1. 识别(CP分解):在无条件条件独立假设下,三个代理变量的联合分布可以写成一个三阶张量(tensor)的CP分解形式(公式3.4)。Kruskal (1977) 的定理保证,只要每个代理的误分类率矩阵的Kruskal秩之和 \(\ge 2K^* + 2 = 6\)(这里 \(K^*=2\),每个代理的Kruskal秩为2,和为6),该分解在排列和缩放意义下唯一。因此,\(\eta^*_{j,a}\) 可以从可观测的联合分布中识别出来。 2. 构造桥函数:对于每个代理 \(j\),定义单代理桥函数 \(M_j = (X^{(j)} - \eta^*_{j,0}) / (\eta^*_{j,1} - \eta^*_{j,0})\)。可以验证 \(E[M_j \mid X^*] = X^*\)。但直接用单个 \(M_j\) 替换 \(X^*\) 进行下游回归,会导致估计量对 \(\eta^*_{j,a}\) 的估计误差敏感(一阶偏差)。 3. 稳健组合(Neyman正交性):为了消除一阶偏差,本文使用三个代理的桥函数组合成稳健桥函数 \(H^R = M_1 M_2 + M_1 M_3 + M_2 M_3 - 2 M_1 M_2 M_3\)。可以证明: - 无偏性:\(E[H^R \mid X^*] = X^*\)。 - 局部稳健性:当用估计的 \(\hat{\eta}\) 代替真值 \(\eta^*\) 时,\(E[\hat{H}^R \mid X^*=1]\) 的偏差是 \(\hat{\eta}\) 估计误差的二阶项(乘积项),而非一阶项。这意味着,只要 \(\hat{\eta}\) 以 \(n^{-1/4}\) 速率收敛,下游参数 \(\beta_1\) 的估计就能达到 \(\sqrt{n}\) 收敛。 4. 下游推断:用 \(H^R\) 替换 \(X^*\) 构造去偏矩函数:\(\psi^{DMM} = (1-H^R) \psi^F(Y, 0; \beta) + H^R \psi^F(Y, 1; \beta)\)。对于线性回归,这等价于用 \(H^R\) 作为工具变量进行回归。由于 \(H^R\) 是 \(X^*\) 的无偏代理且具有Neyman正交性,求解 \(n^{-1} \sum \psi^{DMM} = 0\) 得到的 \(\hat{\beta}^{DMM}\) 是 \(\beta^*\) 的一致且渐近正态估计。
这个最小内核揭示了论文的核心数学贡献:通过精心设计的桥函数组合,将经典潜变量模型的识别结果(CP分解)与半参效率理论(Neyman正交性)无缝连接,使得在无金标准标签的情况下,也能对下游参数进行 \(\sqrt{n}\) 速率的有效推断。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在无金标准标签的条件下,如何利用多个(\(J \ge 3\))不完美的AI测量(如不同LLM的标注)对下游统计参数(如回归系数)进行有效的点估计和推断。
- 核心工具/方法:结合了非参数潜变量模型的CP分解识别结果(Kruskal, 1977; Allman, Matias and Rhodes, 2009)与半参推断中的稳健桥函数和Neyman正交性(Zhou and Tchetgen Tchetgen, 2024; Guo, Shpitser and Ogburn, 2026),提出了DMM(Debiased inference with Multiple imperfect Measurements)框架。
- 主要结论:在放宽的条件独立假设(允许以观测特征为条件)下,DMM估计量是一致且渐近正态的,其收敛速度不受第一阶段条件分类率估计的拖累(只需 \(n^{-1/4}\) 速率),从而支持有效的置信区间构造。模拟和实证验证表明,DMM能显著降低偏差并恢复名义覆盖水平,且增加足够信息量的代理变量可提升效率。
关键设定与假设¶
- Assumption 3.1(条件独立假设):\(X^{(1)} \perp \!\!\! \perp \cdots \perp \!\!\! \perp X^{(J)} \mid X^*, \widetilde{D}\),其中 \(\widetilde{D} = (D, W, Y)\)。这是核心假设,比经典的无条件条件独立假设(仅给定 \(X^*\))更弱,因为它允许代理变量共享由 \(\widetilde{D}\) 捕捉的误差来源(如文本难度)。相比已有文献:经典潜变量模型(Dawid and Skene, 1979)假设无条件独立;本文通过引入 \(\widetilde{D}\) 使其更适用于AI标注场景。
- Kruskal秩条件(Result 1):存在一个三分割,使得三个块的条件概率矩阵的Kruskal秩之和 \(\ge 2K^* + 2\)。对于二值 \(X^*\) 且每个代理都有信息量(即 \(\eta^*_{j,1} \neq \eta^*_{j,0}\)),该条件自动满足(和为6)。这是CP分解唯一性的关键。
- 锚定规则(Anchoring rule):需要指定一个规则来消除CP分解的排列模糊性,例如假设某个锚定代理的真阳性率大于假阳性率(\(\eta^*_{j^\dagger,1} > \eta^*_{j^\dagger,0}\))。这是一个温和的、在实践中通常成立的条件。
- 正则性条件(Theorem 3.2):包括参数空间的紧致性、矩函数的Lipschitz性质、雅可比矩阵的非奇异性、以及条件分类率对比度(\(\eta^*_{j,1} - \eta^*_{j,0}\))一致有界远离零。这些是半参推断的标准条件。
主要结果¶
- Theorem 3.1(识别):在Assumption 3.1和Kruskal秩条件下,条件分类率 \(\eta^*_{j,a}(\widetilde{D})\) 和下游参数 \(\beta^*\) 均可从可观测数据分布中识别。证明思路:先通过CP分解识别 \(\eta^*\),再构造稳健桥函数 \(H^R\),最后证明 \(E[\psi^{DMM}(\widetilde{X}, \widetilde{D}; \beta, \eta^*)] = E[\psi^F(Y, X^*, W; \beta)]\),从而 \(\beta^*\) 是 \(E[\psi^{DMM}] = 0\) 的唯一解。
- Theorem 3.2(渐近性质):假设第一阶段条件分类率估计的 \(L_2\) 误差 \(\delta_n = o_p(1)\),则DMM估计量 \(\hat{\beta}^{DMM}\) 一致。若进一步 \(\delta_n = o_p(n^{-1/4})\),则 \(\sqrt{n}(\hat{\beta}^{DMM} - \beta^*) \rightsquigarrow N(0, A_0^{-1} \Omega_0 A_0^{-\top})\)。关键:\(n^{-1/4}\) 速率要求远慢于 \(\sqrt{n}\),允许使用灵活的机器学习方法估计 \(\eta^*\)。证明的核心是Proposition 3.1:稳健桥函数的条件偏差是二阶的(\(O(\delta_n^2)\)),结合交叉拟合(cross-fitting)控制经验过程项,从而得到 \(\sqrt{n}\) 收敛。
- 效率讨论(Section 3.3末尾):推导了DMM估计量的渐近方差表达式,并给出了增加代理变量改善效率的充分必要条件(公式B.3)。核心发现:增加一个代理变量当且仅当其单代理桥函数的条件方差 \(\kappa_{J+1,a}(d)\) 小于某个由现有代理决定的阈值 \(\bar{\kappa}_{J,a}(d)\) 时,才能提升效率。因此,更多代理并不机械地提升效率,低质量代理可能有害。
证明路线与技术技巧(理论型)¶
- 整体路线:
- 识别阶段:利用CP分解(Kruskal, 1977)从 \(J \ge 3\) 个代理变量的联合分布中识别条件分类率 \(\eta^*_{j,a}(\widetilde{D})\)。这是经典结果,本文直接引用。
- 桥函数构造:基于识别的 \(\eta^*\),构造单代理桥函数 \(M_j\),然后通过特定系数(3和-2)组合成稳健桥函数 \(H^R\)。该组合的设计是为了消除一阶偏差。
- 去偏矩函数:用 \(H^R\) 替换 \(X^*\) 构造 \(\psi^{DMM}\),并证明其无偏性(Theorem 3.1)。
-
渐近分析:使用交叉拟合(cross-fitting)将第一阶段 \(\eta\) 的估计与第二阶段 \(\beta\) 的估计分离。证明的关键是Lemma A.1和Lemma A.2,它们量化了由 \(\hat{\eta}\) 估计误差引起的 \(\psi^{DMM}\) 的偏差是二阶的(\(O(\delta_n^2)\))。然后通过标准Z-估计理论证明 \(\hat{\beta}^{DMM}\) 的 \(\sqrt{n}\) 收敛和渐近正态性(Theorem 3.2)。
-
关键跳跃点:
- 从识别到推断的跳跃:经典潜变量模型只解决识别问题,不解决下游推断中的偏差校正。本文的关键跳跃是构造了具有Neyman正交性的稳健桥函数 \(H^R\),使得下游估计对第一阶段误差不敏感。这个跳跃借鉴了Zhou and Tchetgen Tchetgen (2024) 和 Guo, Shpitser and Ogburn (2026) 在因果推断中的工作。
-
从 \(J=3\) 到 \(J>3\) 的跳跃:当 \(J>3\) 时,如何组合所有代理变量?本文采用对称的pair和triple平均(公式3.7),并证明其Neyman正交性。这需要处理组合数增长带来的技术细节,但核心思想与 \(J=3\) 一致。
-
技术技巧点名:
- CP分解(Candecomp/Parafac decomposition):用于识别潜变量模型,是本文识别策略的基石。引用Kruskal (1977) 和 Allman, Matias and Rhodes (2009)。
- 桥函数(Bridge function):构造一个可观测变量的函数,其条件期望等于潜变量。这是连接潜变量和可观测矩函数的关键工具。
- Neyman正交性(Neyman orthogonality):通过精心设计桥函数的组合系数(3和-2),使得去偏矩函数对第一阶段nuisance function的估计误差的一阶导数为零。这是实现 \(\sqrt{n}\) 收敛的核心。
- 交叉拟合(Cross-fitting):用于控制经验过程项,避免对函数类施加Donsker条件,使得可以使用灵活的机器学习方法估计 \(\eta^*\)。引用Chernozhukov et al. (2018)。
- 二阶偏差分析(Second-order bias analysis):Lemma A.1和A.2的核心,证明稳健桥函数的条件偏差是第一阶段误差的乘积项,因此是二阶小量。
真实例子与应用¶
- 模拟研究(Section 6.1):
- 数据/场景:基于Fowler et al. (2021) 的政治广告语气研究。真实标签是广告是否“Promote”,下游分析是逻辑回归,目标系数是“Facebook平台”的效应。使用真实协变量和专家标签校准数据生成过程,确保条件独立假设成立。
- 方法应用:生成多个不完美代理变量(模拟不同LLM的标注),比较DMM、朴素多数投票和不可达的Oracle估计量。
- 结果:DMM的偏差始终接近0(0.002-0.003),95%置信区间覆盖接近名义水平(0.946-0.962)。朴素多数投票偏差大(0.085-0.226),覆盖极差(0-0.538)。增加信息量大的代理变量可提升DMM效率,使其RMSE接近Oracle。
-
说明的问题:验证了在条件独立假设满足时,DMM的理论性质在有限样本下成立,且优于朴素方法。
-
实证验证(Section 6.2):
- 数据/场景:基于Pan and Chen (2018) 的中国官员腐败举报研究。真实标签是举报是否涉及“市级官员不当行为”,下游分析是逻辑回归,目标系数是该标签对“举报是否被上报”的效应。使用真实LLM标注(GPT-4.1, GPT-4, Llama-4)作为代理变量。
- 方法应用:DMM不使用任何专家标签,DSL使用500个随机抽样的专家标签,朴素方法直接使用单个LLM标注。
- 结果:DMM的估计值(-0.844)和置信区间覆盖了专家标签基准(-1.039),覆盖率为0.862。DSL的估计值(-1.279)也覆盖基准,覆盖率为0.981。三个朴素估计均严重偏离基准,覆盖率在0.154到0.572之间。
- 说明的问题:在真实世界(条件独立假设可能近似成立但非精确)中,DMM仍能提供比朴素方法更可靠的推断,其性能接近使用金标准标签的DSL方法。
🔎 结论是否比证明窄¶
- 窄结论:Theorem 3.2的渐近正态性要求 \(\delta_n = o_p(n^{-1/4})\),这是一个关于第一阶段估计收敛速率的条件。论文在模拟中使用了参数化的逻辑回归模型,该模型自然满足此条件。但在“更一般”的设定中(如使用深度神经网络估计 \(\eta^*\)),是否总能达到 \(n^{-1/4}\) 速率?论文未提供具体的高维或非参数nuisance函数类的收敛性分析,而是将其作为“高层次条件”(high-level condition)留给用户。因此,结论的适用范围在理论上受限于该速率条件,而论文并未证明该条件在哪些具体的非参数设定下必然成立。
- 泛泛claim:论文在Introduction中声称“DMM estimator is consistent and asymptotically normal, enabling valid inference for a wide range of downstream statistical analyses”。这个claim在Theorem 3.2的假设下是成立的,但“wide range”依赖于矩函数 \(\psi^F\) 的灵活性。论文给出了线性回归和逻辑回归的例子,并声称可推广到大多数MLE。然而,对于更复杂的矩条件(如分位数回归、GMM),其理论性质(如Neyman正交性是否保持)并未被显式证明,而是隐含在“general moment estimator”的框架下。这是一个合理的推广,但严格来说,论文的证明是针对特定形式的矩函数(公式2.2)进行的。
四、开放问题(点到为止,扎根具体语句)¶
-
条件独立假设的检验与放松:论文Section 5提供了诊断工具,但承认“failure to reject the null hypothesis... does not imply the validity of the conditional independence assumption”(Section 5.2)。扎根于:Section 5.2末尾。一个开放问题是:能否发展出更严格的、具有统计保证的检验方法,或者提出比条件独立更弱的、但仍能实现点识别的假设(例如,允许某种形式的弱依赖)?
-
效率改进与最优桥函数:论文给出了增加代理变量改善效率的阈值条件(公式B.3),但未提供如何选择最优桥函数(即最优权重组合)的通用方法。扎根于:Section 3.3末尾“It is straightforward to allow for different weights...”。一个开放问题是:在给定一组代理变量后,如何构造一个达到半参效率界(semiparametric efficiency bound)的DMM估计量?这可能需要求解一个关于桥函数权重的优化问题。
-
多类别与高维潜变量的扩展:论文Section 4.2讨论了多类别扩展,但指出“Multicategory latent outcomes consequently require richer proxy supports”(Section 4.2)。扎根于:Section 4.2。一个开放问题是:当潜变量类别数 \(K^*\) 很大或潜变量为高维时,Kruskal秩条件变得非常苛刻。能否利用结构假设(如稀疏性、低秩结构)来放松识别条件,并发展相应的计算可行的估计方法?
-
与计算-统计权衡的潜在联系:论文的核心是“用多个不完美测量替代一个完美测量”,这本质上是一种“计算-数据”的权衡。扎根于:论文的整个动机。一个开放问题是:在AI标注场景下,获取更多不完美测量(如调用不同LLM)的计算成本与获取少量金标准标签的成本之间,是否存在一个最优的资源配置策略?这可以形式化为一个统计-计算权衡问题,类似于“信息-计算缺口”(information-computation gap)的实证版本。
Maintained by 陈星宇 · Homepage · Source on GitHub