Disentangling network dependence among multiple variables¶
讲者: Zhejia Dong (Brown University)
会场: Advances in Causal Inference and Machine Learning for Complex Data
报告题目: Design and Analysis for Valid Causal Inference with Network-Dependent Data
链接: arXiv
来源: JCSDS 2026 · 返回会议总览
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向要解决的根本问题是:当两个变量(如暴露X和结局Y)都受到同一个社会网络的结构性依赖(即网络自相关)影响时,如何正确推断它们之间的统计关联,避免因共享依赖结构而产生的虚假关联(spurious association)。该问题的核心挑战在于,网络依赖的结构不像时间序列或空间数据那样有明确的、随距离单调衰减的规律,而是由未知的“传输过程”(transmission process)决定,且研究者通常只能观测到网络的一个快照(snapshot),缺乏动态信息。当前该方向的成熟度较低——大多数现有方法要么只处理单个变量的自相关,要么从其他领域(如GWAS、时间序列)借用工具,但缺乏对网络依赖独特性的系统讨论和比较。
发展脉络(history)¶
奠基工作:网络自相关(network autocorrelation)的概念最早由 Dow et al. (1982, 1984) 提出,他们将其称为“Galton's problem”,并建立了网络自相关模型(NAM)的基本框架,用于在回归中处理因网络连接导致的观测非独立性。几乎同时,Yule (1926) 在时间序列中发现了“无意义相关”(nonsense correlation)现象,即两个独立但强自相关的时间序列会表现出虚假的统计关联——这为后来理解网络中的类似问题埋下了伏笔。
主要进展:在遗传学领域,Kang et al. (2008, 2010) 和 Zhou & Stephens (2012) 将线性混合模型(LMM)引入GWAS,用亲缘关系矩阵(kinship matrix)作为随机效应的协方差结构,以校正由群体结构和亲缘关系导致的虚假关联。这一方法后来被 Matthews et al. (2024) 和 Landon et al. (2018) 直接应用于网络数据,用于校正网络非独立性。与此同时,Lee & Ogburn (2021) 正式证明了网络依赖可以导致虚假关联和无效推断,并开发了基于空间自相关检验的统计检验方法,这是该子方向的一个关键转折点——它首次将“网络依赖导致虚假关联”作为一个独立的、需要专门处理的问题提出。
当前frontier:近期的工作开始尝试用更复杂的概率图模型来刻画网络依赖。Ogburn et al. (2020, 2024) 和 Tchetgen Tchetgen et al. (2021) 将链图模型(chain graph)和马尔可夫随机场引入网络因果推断,允许对(Y, X)的联合分布进行因子分解,从而处理更一般的依赖结构。Wu & Bhattacharya (2024) 和 Menzel (2025) 则进一步考虑了潜在混杂和均衡状态下的因果推断。这些工作代表了当前的前沿,但正如本文作者所指出的,它们“只能捕捉高度特定的依赖结构,在实践中可能不成立”。
本文的位置:本文(Dong, Zigler & Lee, 2025)位于上述脉络的“方法比较与适应性分析”节点。它没有提出全新的模型,而是首次系统比较了两种来自不同领域的现有方法(预白化与网络自相关模型)在网络依赖场景下的适用性,并揭示了它们各自隐含的关于“传输过程”和“交互水平”的假设。本文的独特贡献在于:它把“选择哪种方法”这个问题,从技术细节层面提升到了“研究者必须对数据生成机制做出明确假设”的层面。
子线索聚类¶
这些被引文献大致落在三条子线索上:
-
网络自相关模型(NAM)及其变体:这是最经典的一条线。Dow et al. (1982, 1984) 奠基,Leenders (2002) 系统讨论了权重矩阵W的选择,Dittrich et al. (2017, 2020) 发展了贝叶斯估计方法,Fujimoto et al. (2011) 将其扩展到双模网络。这条线的核心是:用Y = ρWY + βX + ε 来建模Y的自相关,但通常不处理X的自相关。Matthews et al. (2024) 的模拟评估表明,NAM可以部分缓解虚假关联,但无法将假阳性率降至理想水平(0.05以下)。
-
线性混合模型(LMM)与亲缘关系矩阵:这条线来自GWAS,核心是用随机效应来捕捉个体间的遗传相似性。Kang et al. (2008, 2010) 和 Zhou & Stephens (2012) 开发了高效的LMM算法(EMMA/GEMMA),Astle & Balding (2009) 和 Sul et al. (2018) 提供了理论综述。本文将其视为一种“预白化”的特例——通过构造方差-协方差矩阵V(如V = σ₀²I + σ₁²A + σ₂²A²)来同时校正X和Y的依赖。
-
因果推断与链图模型:这是更近期的、更雄心勃勃的路线。Ogburn et al. (2020, 2024) 和 Tchetgen Tchetgen et al. (2021) 试图在因果框架下处理网络干扰和依赖,但正如本文所指出的,这些方法“只能捕捉高度特定的依赖结构”。这条线目前更侧重于因果效应的识别,而非本文关注的“关联推断”本身。
这个方向在追问的核心问题¶
- 如何定义网络“距离”?是直接用邻接矩阵A(一阶依赖),还是用测地距离(geodesic distance),还是用更高阶的A^m?不同的定义对应着不同的依赖衰减假设。
- 如何建模“传输过程”?变量是通过直接接触(如t=1时的直接传播)传播,还是经过多轮交互达到均衡?这个选择直接决定了方差-协方差矩阵V的结构。
- 如何识别“共享依赖结构”?当X和Y都依赖同一个网络时,它们的依赖结构是完全相同的、部分重叠的,还是完全不同的?现有方法大多假设完全相同。
- 如何保证推断的有效性?当V被错误指定时,假阳性率会膨胀到何种程度?是否存在对V的误设具有稳健性的方法?
⚠️ 作者的framing¶
作者把缺口frame成:“尽管网络依赖导致的虚假关联已被认识,但现有文献缺乏对现有方法(预白化与NAM)在网络设定下适用性的系统比较。每种方法都隐含地假设了特定的传输过程和交互水平,而研究者通常没有意识到这些假设。” 因此,本文的定位是“方法论的澄清与比较”,而非“提出新方法”。
被淡化或回避的竞争路线: - 因果推断的链图模型路线(Ogburn et al., 2020; Tchetgen Tchetgen et al., 2021)被作者在讨论中提及,但被描述为“只能捕捉高度特定的依赖结构”,从而被边缘化。作者没有深入讨论这些方法是否可能比本文比较的两种方法更灵活或更稳健。 - 基于马尔可夫随机场的联合建模(Wu & Bhattacharya, 2024; Menzel, 2025)同样被一笔带过,作者没有解释为什么这些方法不适合本文的“关联推断”目标。
什么明显该被引/该存在、却没出现在intro里: - 关于“统计-计算权衡”的文献:当网络规模n很大时,计算V⁻¹或(I-ρA)⁻¹的代价极高。本文的Theorem 2虽然通过谱分解简化了MLE,但并未讨论当n很大(如n>10⁵)时的计算可行性。相关文献(如关于稀疏矩阵求逆、随机化算法、低秩近似)未被引用。 - 关于“网络依赖的检验”的文献:本文假设“网络依赖的存在是已知的”,但如何检验网络依赖是否存在本身就是一个活跃的研究领域(如Lee & Ogburn, 2020的检验)。本文没有讨论“如果网络依赖很弱,是否还需要校正”的问题。 - 关于“多重检验”的文献:在GWAS中,同时检验数百万个SNP时,LMM的校正效果如何?本文的模拟只考虑了单次检验,未讨论多重比较场景。
张力¶
未见明显对立引用。被引工作之间没有出现“在相同条件下得出相反结论”的情况。但存在一种隐含的张力:NAM的支持者(如Dittrich et al., 2017)认为NAM可以充分处理网络依赖,而Lee & Ogburn (2021) 和 Matthews et al. (2024) 的模拟表明NAM只能部分缓解虚假关联。这种张力不是直接对立,而是“充分性”与“部分有效性”之间的差距。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
符号: - n:网络中的节点数(样本量)。 - i, j:节点索引,i, j = 1, ..., n。 - A:n×n邻接矩阵,A_ij = 1表示节点i和j之间有边(网络连接),否则为0。本文假设A对称(无向网络)。 - Y = (Y₁, ..., Yₙ)ᵀ:n维随机向量,代表每个节点的“结局”变量(如健康状况、行为)。 - X = (X₁, ..., Xₙ)ᵀ:n维随机向量,代表每个节点的“暴露”变量(如基因型、干预)。 - β:标量参数,代表X对Y的线性效应(本文关注的是关联而非因果,β是回归系数)。 - V:n×n方差-协方差矩阵,Var(Y) = V。本文的核心是V的指定。 - κ, α:标量参数,控制直接传输过程中邻居和自身的影响强度。 - ρ:标量参数,网络自相关模型(NAM)中,控制Y的自相关强度。 - t:离散时间步,代表“交互水平”(level of interactions)。t=1表示只发生了一轮交互,t→∞表示达到均衡。 - ε:n维独立同分布噪声向量,通常ε_i ~ N(0, σ²)。 - W:n×n权重矩阵,在NAM中用于定义Y_i如何依赖于Y_j。常见选择是A或其行归一化版本。 - σ₀², σ₁², ..., σ_d²:标量方差分量,用于构造V = σ₀²I + σ₁²A + ... + σ_d²A^d。 - λ₁, ..., λₙ:A的特征值。 - U:A的特征向量矩阵,满足A = UDUᵀ,D = diag(λ₁, ..., λₙ)。
模型: - 直接传输过程(Direct Transmission Process):这是本文用来生成网络依赖的核心模型。在t=1时: Y¹ = κA Y⁰ + αY⁰ + ε¹ 其中Y⁰_i ~ N(0,1)独立,ε¹_i ~ N(0,1)独立。这个模型假设每个节点的值在t=1时受到其邻居的初始值(通过κA Y⁰)和自身初始值(通过αY⁰)的影响。 - 均衡传输过程(Equilibrium Transmission Process):这是NAM隐含的模型。当t→∞时,直接传输过程收敛到: Y = (I - ρA)⁻¹ (βX + ε) 这个模型假设Y已经经历了无限多轮交互,达到了均衡状态。
可观测数据: - 研究者实际能观测到的是: - 网络结构A(邻接矩阵),通常通过调查、传感器或数字足迹获得。 - 每个节点的一个快照值:Y_i 和 X_i(例如,一次横截面调查中每个人的体重和运动量)。 - 没有时间序列信息:研究者不知道Y和X经历了多少轮交互才达到当前状态。 - 想要但观测不到的是: - 传输过程的参数(κ, α, ρ)——这些需要从数据中估计。 - 交互水平t——研究者不知道当前观测对应的是t=1、t=3还是t→∞。 - 初始值Y⁰——这些是潜在变量,不可观测。
第二步:讲最小内核¶
最简特例:d=1,直接传输过程,t=1,且X与Y独立生成
这是支撑整篇论文的最小内核。在这个特例下,所有复杂的一般性设定都被剥去,只剩下最核心的数学问题。
设定: - 网络有n个节点,邻接矩阵A对称。 - X和Y都是n维随机向量,且独立生成(即X和Y之间没有真实关联,β=0)。 - X和Y都遵循相同的直接传输过程,且t=1: Y¹ = κA Y⁰ + αY⁰ + ε¹ X¹ = κA X⁰ + αX⁰ + δ¹ 其中Y⁰_i, X⁰_i ~ N(0,1)独立,ε¹_i, δ¹_i ~ N(0,1)独立,且所有初始值和噪声相互独立。 - 研究者观测到的是:A, Y¹, X¹。
核心命题: 即使X和Y是独立生成的(β=0),由于它们共享相同的网络依赖结构,X¹和Y¹之间会出现虚假的统计关联。具体地,如果直接用简单线性回归Y¹ = βX¹ + error,估计出的β̂会显著不为0(即假阳性率高于名义水平)。
为什么会出现虚假关联? 因为Var(Y¹) = κ²A² + 2ακA + (α²+1)I(Theorem 1)。这个方差结构不是对角矩阵——Y¹_i和Y¹_j是相关的,即使i和j不是直接邻居(因为A²项捕捉了长度为2的路径)。同样,X¹也有完全相同的方差结构。因此,Y¹和X¹的样本协方差 Cov̂(Y¹, X¹) 会系统地偏离0,即使总体协方差为0。这种偏差源于两个独立但同分布的非对角随机向量之间的“偶然”对齐。
证明思路(Theorem 1的证明): Var(Y¹) = Var(κA Y⁰ + αY⁰ + ε¹) = (κA + αI) Var(Y⁰) (κA + αI)ᵀ + Var(ε¹) = (κA + αI)(κA + αI)ᵀ + I (因为Var(Y⁰)=I, Var(ε¹)=I) = κ²AAᵀ + 2ακA + (α²+1)I = κ²A² + 2ακA + (α²+1)I (因为A对称,AAᵀ=A²)
关键洞察:即使只有一轮交互(t=1),方差结构也涉及A²,即二阶邻居。这意味着,即使两个节点没有直接连接,只要它们共享一个共同邻居,它们的Y值就会相关。因此,用A(只捕捉一阶邻居)来构造V是不够的——必须包含A²。
这个特例如何推广到一般情形? - 当t=2时,V会涉及A⁴(因为Y² = κA Y¹ + αY¹ + ε²,而Y¹本身已经包含A²项)。 - 当t→∞时,V = σ² Σ_{q=0}^{∞} (ρA)^q,即所有阶的A都参与。 - 因此,选择V的阶数d,本质上等价于对交互水平t做出假设。d=2对应t=1,d=4对应t=2,d=∞对应t→∞(均衡)。
这个最小内核告诉读者:本文的全部技术工作,本质上是在回答一个问题——给定一个网络A,如何选择一个合适的V(即选择合适的d),使得预白化后的X和Y不再有虚假关联? 而答案取决于研究者对“交互水平t”的信念。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:当两个变量X和Y都受到同一个社会网络的依赖结构影响时,如何正确推断它们之间的统计关联,避免因共享网络依赖而产生的虚假关联(spurious association)。
- 核心工具/方法:系统比较了两种现有方法——预白化(pre-whitening) 和网络自相关模型(NAM)——在网络设定下的适用性。对于预白化,提出了基于高阶邻接矩阵(A, A², ..., A^d)构造方差-协方差矩阵V的一般框架,并给出了在直接传输过程(t=1)下V的精确形式(Theorem 1)以及MLE的谱分解优化算法(Theorem 2)。对于NAM,揭示了其隐含的“均衡传输过程”假设。
- 主要结论:两种方法在各自的假设下都能有效降低虚假关联的假阳性率,但对假设违反高度敏感。预白化在直接传输过程(t=1)下表现良好,但在均衡过程下失效;NAM在均衡过程下表现良好,但在直接传输过程下失效。这强调了研究者必须根据对“传输过程”和“交互水平”的先验知识来选择方法。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
- 核心假设1(共享依赖结构):X和Y具有相同的方差-协方差结构V。这是预白化方法有效的前提——如果X和Y的依赖结构不同,用同一个V去白化两者会引入偏差。本文的模拟中,X和Y是独立同分布生成的,满足此假设。
- 核心假设2(传输过程已知或可指定):研究者知道(或愿意假设)X和Y是通过哪种传输过程生成的。预白化要求指定V的阶数d(即假设t已知或可近似),NAM要求假设过程已达到均衡(t→∞)。
- 核心假设3(无因果干扰):X和Y之间的关联是“统计关联”而非“因果效应”,且X的传输过程不受Y影响,反之亦然。本文明确声明“传输过程在一个变量内部不受其他变量影响”(Section 2.3)。
- 核心假设4(A对称):Theorem 1和Theorem 2都假设A是对称的(无向网络)。对于有向网络,作者在Remark 1中简要提及需要用到AAᵀ,但未深入讨论。
- 核心假设5(高斯性):Theorem 1和Theorem 2都假设Y⁰和ε服从高斯分布,从而Y也服从高斯分布。这简化了似然函数的推导,但在非高斯场景下,MLE可能不再是最优的。
相比已有文献的放宽或强化: - 放宽:相比GWAS中LMM通常只使用A(亲缘关系矩阵),本文允许使用A的高阶项(A², ..., A^d),从而捕捉更复杂的依赖结构。 - 强化:相比NAM通常只假设Y有自相关(X被视为固定),本文明确要求X和Y有相同的依赖结构,这是一个更强的假设。
主要结果¶
Theorem 1(方差-协方差矩阵的精确形式): - 陈述:在直接传输过程(t=1)下,若A对称且Y⁰_i ~ N(0,1)独立,则Var(Y¹) = κ²A² + 2ακA + (α²+1)I。 - 直觉:即使只有一轮交互,方差结构也涉及A²(二阶邻居)。这意味着依赖不仅存在于直接相连的节点之间,也存在于共享共同邻居的节点之间。 - 必要条件:A对称,Y⁰和ε独立同分布且方差为1。 - 解决的技术难点:将“传输过程”与“方差结构”联系起来,给出了一个可计算的、解析的表达式。
Theorem 2(MLE的谱分解优化): - 陈述:当V = σ₀²I + σ₁²A + ... + σ_d²A^d且A对称时,MLE的似然函数可以通过A的特征分解简化为: l = -n/2 ln(2π) - 1/2 Σᵢ ln(σ₀² + σ₁²λᵢ + ... + σ_d²λᵢ^d) - 1/2 Zᵀ(σ₀²I + σ₁²D + ... + σ_d²D^d)⁻¹Z 其中Z = Uᵀ(Y - βX),D = diag(λ₁, ..., λₙ)。 - 直觉:通过谱分解,将n×n矩阵的求逆问题转化为n个标量的倒数问题,计算复杂度从O(n³)降至O(n)。 - 必要条件:A可对角化(对称矩阵保证可对角化)。 - 解决的技术难点:避免了每次迭代中计算V⁻¹的O(n³)开销,使得MLE在n较大时仍然可行。
模拟结果(Table 1): - 预白化(X, Y)在直接传输过程(t=1)下:假阳性率(rejection rate)接近名义水平0.05(如弱依赖时β_OLS=0.058, dCorr=0.086)。这验证了Theorem 1的正确性。 - 预白化在均衡传输过程下:假阳性率随依赖强度增加而急剧上升(如强依赖时β_OLS=0.684, dCorr=0.652)。这是因为V = σ₀²I + σ₁²A + σ₂²A² 是对真实V = σ² Σ (ρA)^q 的严重误设。 - NAM(β_NAM)在均衡传输过程下:假阳性率接近0.05(如弱依赖时0.060, 强依赖时0.060)。这验证了NAM在均衡假设下的有效性。 - NAM在直接传输过程下:假阳性率高于0.05(如弱依赖时0.178, 强依赖时0.172)。这是因为NAM假设的均衡结构(涉及所有阶A^q)与真实的t=1结构(只涉及A和A²)不匹配。 - 预白化使用NAM的V(X_NAM, Y_NAM):在均衡过程下表现良好,但在直接传输过程下表现差。这进一步证实了V的指定必须与真实传输过程匹配。
证明路线与技术技巧¶
整体路线(以Theorem 1和Theorem 2为例):
-
Theorem 1的证明:
- 步骤1:写出Y¹的表达式:Y¹ = (κA + αI)Y⁰ + ε¹。
- 步骤2:利用方差公式Var(Y¹) = Var((κA+αI)Y⁰) + Var(ε¹),因为Y⁰和ε¹独立。
- 步骤3:代入Var(Y⁰)=I和Var(ε¹)=I,得到Var(Y¹) = (κA+αI)(κA+αI)ᵀ + I。
- 步骤4:利用A对称,展开得到κ²A² + 2ακA + (α²+1)I。
-
Theorem 2的证明:
- 步骤1:对A进行谱分解:A = UDUᵀ。
- 步骤2:利用UᵀU=I,将A^m表示为UD^mUᵀ。
- 步骤3:将V = σ₀²I + σ₁²A + ... + σ_d²A^d 重写为 V = U(σ₀²I + σ₁²D + ... + σ_d²D^d)Uᵀ。
- 步骤4:计算V⁻¹ = U(σ₀²I + σ₁²D + ... + σ_d²D^d)⁻¹Uᵀ,其中括号内是对角矩阵,求逆只需取倒数。
- 步骤5:计算|V| = Πᵢ (σ₀² + σ₁²λᵢ + ... + σ_d²λᵢ^d)。
- 步骤6:将V⁻¹和|V|代入高斯对数似然函数,得到简化形式。
关键跳跃点: - Theorem 1:认识到即使只有t=1,方差结构也涉及A²。这个跳跃并不难,但它是整个论文的基石——它揭示了“一阶邻接矩阵不足以捕捉网络依赖”。 - Theorem 2:认识到谱分解可以将矩阵求逆问题对角化。这个跳跃在GWAS文献中已有先例(如Sul et al., 2018),但本文将其推广到了V包含A的高阶项的情况。
技术技巧点名: - 谱分解(Eigendecomposition):Theorem 2的核心技巧。将A的特征分解用于简化V的求逆和行列式计算。 - Neumann级数(Neumann Series):在Section 4.2中,用于将(I - ρA)⁻¹展开为Σ (ρA)^q,从而揭示NAM的方差结构涉及所有阶的A。 - MLE(最大似然估计):用于估计预白化中的方差分量(σ₀², ..., σ_d²)和NAM中的参数(ρ, β, σ²)。
真实例子与应用¶
本文为纯理论/无实证例子。论文的“真实数据”部分只有模拟研究(Section 5),没有使用任何真实世界的数据集(如Framingham Heart Study、Facebook网络等)。模拟研究使用了Erdős–Rényi随机图(n=500, 边数=500),生成了两种传输过程下的数据,并比较了不同方法的假阳性率。这个模拟的目的是验证理论结果(Theorem 1)并展示方法对假设违反的敏感性,而非展示在真实数据上的表现。
🔎 结论是否比证明窄¶
是,存在多处“结论比证明窄”的情况:
-
Theorem 1的适用范围被过度泛化:Theorem 1严格证明了在t=1且A对称的条件下,V = κ²A² + 2ακA + (α²+1)I。但作者在Section 3.3中将其推广为一般形式V = σ₀²I + σ₁²A + ... + σ_d²A^d,并声称“对于任意d,这个形式可以捕捉m阶依赖”。这个推广没有被证明——作者没有证明对于t>1或更一般的传输过程,V是否仍然可以表示为A的多项式形式。作者自己也承认(Section 3.3):“the specific transmission processes that result in V in (3) for d > 2 remain unknown to us.” 这是一个重要的诚实声明,但读者需要注意:V = Σ σ_m² A^m 只是一个启发式假设,并非从任何传输过程中推导出来的。
-
Theorem 2的优化仅适用于对称A:Theorem 2的谱分解技巧依赖于A的对称性。对于有向网络(A不对称),该技巧不直接适用。作者在Remark 1中提到了有向网络需要用到AAᵀ,但未给出完整的理论或算法。
-
模拟只覆盖了两种极端情况:模拟只考虑了t=1(直接传输)和t→∞(均衡)两种极端情况。现实中的网络依赖很可能介于两者之间(如t=2或t=3)。对于这些中间情况,两种方法的表现如何?论文没有回答。作者在Section 3.3中提到了“three degrees of influence rule”和“six degrees of separation rule”,暗示d=6或d=10可能足够,但这只是推测,没有模拟验证。
-
“预白化”的有效性依赖于V的精确指定:论文的模拟显示,当V被正确指定时(t=1下用V = σ₀²I + σ₁²A + σ₂²A²),预白化效果很好。但论文没有讨论当V被部分正确指定时(如用了A和A²但漏了A³)的效果。在实际应用中,研究者几乎不可能知道真实的V,因此“V被正确指定”是一个很强的假设。
-
NAM的“均衡假设”未被检验:论文假设NAM适用于均衡过程,但没有讨论如何检验“数据是否已达到均衡”。在模拟中,研究者知道数据是从均衡过程生成的,但在真实应用中,这是一个无法验证的假设。
四、开放问题(点到为止)¶
-
部分重叠的依赖结构:论文假设X和Y具有完全相同的依赖结构V。但在实际中,X和Y可能只共享部分网络依赖(例如,Y受朋友影响,X受同事影响)。如何建模和处理部分重叠的依赖结构?(扎根于Section 6:“it is common for X and Y to share the same network dependence structure, though they may only partially overlap.”)
-
利用多个协变量估计V:在GWAS中,可以利用成千上万个SNP来估计亲缘关系矩阵。在网络研究中,通常只有少量协变量可用。如何利用少量协变量(加上A)来更准确地估计V?(扎根于Section 6:“an important avenue for exploration is how to leverage the typically small set of covariates, in addition to A, to better learn about shared dependence structures.”)
-
非对称网络与有向依赖:Theorem 1和Theorem 2都假设A对称。对于有向网络(如Twitter的关注关系),依赖结构如何建模?是否存在类似Theorem 1的解析结果?(扎根于Remark 1:“If the adjacency matrix is asymmetric, capturing the full dependence structure may require considering high-order adjacency matrix, its transpose matrix Aᵀ, and their product.”)
-
模型选择:如何确定d?:论文建议d的选择可以基于“degrees of separation”规则(如d=6或d=10),但这只是启发式。是否存在数据驱动的模型选择方法(如交叉验证、信息准则)来确定V中应包含A的最高阶数?(扎根于Section 3.3:“The choice of d is subjective, and researchers may determine the value of d based on their substantive knowledge.”)
Maintained by 陈星宇 · Homepage · Source on GitHub