跳转至

Deep Transformation Model

讲者: Tong Wang
会场: 半监督学习与高维数据
报告题目: Deep Transformation Model
链接: arXiv
来源: JCSDS 2026 · 返回会议总览


一、领域脉络与小综述

这个方向是什么

这个子方向的核心问题是:如何利用深度神经网络(DNN)进行非参数回归,同时保证模型对“模型误设”和“异常值”具有鲁棒性,并能进行高维变量选择? 当前,DNN在非参数回归中已取得巨大成功,但大多数方法(如基于平方损失的最小二乘估计)对模型误设和重尾误差敏感。本文试图将经典统计中的“秩回归”思想与DNN结合,提出一个更鲁棒、更灵活的框架。该方向的成熟度处于“方法提出与理论奠基”阶段,已有一些鲁棒DNN的工作,但将秩基损失与DNN结合并建立完整理论的工作尚属首次。

发展脉络(history)

  1. 奠基工作:非参数回归与DNN的收敛速度

    • Schmidt-Hieber (2017):首次系统证明了基于ReLU激活函数的稀疏连接DNN在非参数回归中能达到最优收敛速度(忽略对数因子),为DNN的理论奠定了基础。其框架涵盖了许多结构约束(如广义可加模型)。
    • Bauer & Kohler (2019):证明了在光滑性条件和回归函数结构限制下,基于多层前馈神经网络的估计量能够规避维度诅咒。其证明依赖于新的逼近理论。
    • Jiao et al. (2023):将DNN回归的收敛速度推广到预测变量支撑在近似低维流形上的情形,并显著改进了现有误差界(多项式依赖于维度而非指数)。
  2. 主要进展:鲁棒DNN与变量选择

    • 鲁棒DNN:Shen et al. (2021) 研究了重尾误差下DNN回归的非渐近上界,是鲁棒DNN的代表性工作。Padilla et al. (2020) 和 Shen et al. (2024) 则推导了分位数回归的收敛速度。
    • DNN变量选择:Scardapane et al. (2017) 提出了对网络模块或整个网络应用组Lasso。Feng & Simon (2017) 提出了稀疏输入神经网络,通过组Lasso惩罚第一层权重实现特征选择。Luo & Halabi (2023) 则提出了使用组凹正则化的框架。Dinh & Ho (2020) 证明了自适应组Lasso对解析深度网络具有选择一致性。
  3. 当前Frontier与本文位置

    • 当前前沿是:如何将经典统计中已被证明有效的鲁棒方法(如秩回归、分位数回归)与DNN的灵活性结合,并建立完整的理论(可识别性、收敛速度、变量选择一致性)。
    • 本文的位置:本文是这一前沿的直接推进。它首次将“最大秩相关(MRC)”估计与DNN结合,提出了“深度变换模型”。与现有鲁棒DNN(如基于分位数或Huber损失)不同,本文的损失函数基于秩,对模型误设(尤其是单调变换)具有天然鲁棒性。同时,它通过DReLU近似解决了秩损失的计算难题,并建立了从可识别性到变量选择一致性的完整理论。

子线索聚类

  1. DNN非参数回归的收敛速度:关注在给定光滑性假设下,DNN估计量的收敛速度。代表工作:Schmidt-Hieber (2017), Bauer & Kohler (2019), Jiao et al. (2023)。这些工作通常使用平方损失。
  2. 鲁棒DNN:关注在重尾误差或异常值下,DNN估计量的性质。代表工作:Shen et al. (2021)(重尾误差),Padilla et al. (2020)(分位数回归)。本文属于此线索,但使用了全新的秩基损失。
  3. DNN变量选择:关注如何通过正则化(如组Lasso)实现DNN的特征选择。代表工作:Scardapane et al. (2017), Feng & Simon (2017), Luo & Halabi (2023), Dinh & Ho (2020)。本文在此线索上,将组Lasso应用于秩基损失,并建立了选择一致性。

这个方向在追问的核心问题

  1. 如何突破模型误设? 现有DNN模型(如基于平方损失或交叉熵损失)本质上对应特定的参数模型(线性回归、逻辑回归),当真实模型偏离这些假设时,性能会下降。
  2. 如何在高维下进行可靠的变量选择? DNN的“黑箱”特性使得特征选择更具挑战性。现有方法(如LassoNet)虽然有效,但缺乏像经典统计中那样严格的选择一致性理论。
  3. 如何建立鲁棒DNN的完整理论? 虽然已有一些鲁棒DNN的工作,但其理论(如收敛速度、变量选择一致性)往往不如基于平方损失的DNN完善。

⚠️ 作者的framing

  • 作者把缺口frame成什么? 作者将现有DNN的缺口定位为“对模型误设和异常值敏感”,并声称他们的“深度变换模型”通过使用秩基损失和DReLU近似,提供了一个“更鲁棒、更灵活”的替代方案。他们强调,该模型包含许多流行模型作为特例,因此对模型误设不那么敏感。
  • 哪些竞争路线被他淡化或回避了? 作者淡化了其他鲁棒DNN方法(如基于分位数或Huber损失)的竞争力。在模拟中,他们与NN-LAD、NN-Cauchy、NN-Huber进行了比较,但声称自己的方法在更复杂的模型(M2-M6)下表现更好。他们回避了与更复杂的鲁棒DNN架构(如GANs)的直接比较。
  • 什么明显该被引/该存在、却没出现在intro里? 作者没有引用任何关于“深度生存分析”中处理右删失数据的通用框架(如DeepSurv, Cox-Time),尽管他们自己的方法也处理了生存数据。此外,他们没有引用任何关于“秩基损失在DNN中应用”的先前尝试(如果存在的话),这暗示了他们的方法是首创的。

张力

未见明显对立引用。所有被引工作都在各自的子方向上推进,没有出现彼此矛盾或在略不同条件下得相反结论的情况。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号

    • X:p维预测变量向量,X ∈ R^p
    • Y:响应变量,可以是连续、分类或生存时间。
    • f*目标函数,一个从XR的未知函数,是我们要估计的核心对象。f*(X)是“单指标”。
    • D:一个非退化的递增函数,将R映射到Y的支撑集。
    • F:一个关于每个坐标都严格递增的二元函数。
    • ϵ随机误差项,独立于X
    • f_θ:一个由参数θ(权重和偏置)参数化的前馈神经网络(FNN)。
    • U_n(f):基于样本的秩目标函数,衡量Yf(X)之间的秩相关性。
    • S_ω(u)双ReLU (DReLU) 函数,用于平滑近似指示函数I(u > 0)
    • ω_n:DReLU的平滑参数,随样本量n趋于0。
    • λ_n:变量选择的惩罚参数。
    • W_0,q:神经网络第一层权重矩阵的第q列,连接第q个预测变量。
  • 模型

    • 数据生成机制由非参数变换模型描述: Y = D ◦ F (f*(X), ϵ)
    • 这个模型非常灵活。例如,如果DF是恒等映射,它就是标准回归模型Y = f*(X) + ϵ。如果f*(X) = X^T β,它就是单指标模型。如果Y是生存时间,它可以对应加速失效时间(AFT)模型。
    • 要估的对象:目标函数f*。我们通过一个DNN f_θ来逼近它。
  • 可观测数据

    • 研究者能观测到的是n个独立同分布的样本:{(X_i, Y_i)}_{i=1}^n
    • 对于生存数据,观测到的是{(X_i, Y_i, Δ_i)}_{i=1}^n,其中Y_i = min(T_i, C_i)是观测时间,Δ_i = I(T_i ≤ C_i)是删失指示符。
    • 想要但观测不到的量:目标函数f*本身,以及误差项ϵ。模型假设ϵ独立于X,但它的分布是完全未知的。

第二步:讲最小内核

本文的核心思路可以用一个最简特例来理解:f*是线性函数时,问题退化为经典的“最大秩相关(MRC)估计”,但用DNN来估计它。

  • 最简特例:假设f*(X) = X^T β*,其中β*是未知的p维参数。模型变为Y = D ◦ F (X^T β*, ϵ)。我们想估计β*
  • 核心思路:我们不直接拟合YX之间的关系,而是最大化YX^T β之间的秩相关性。具体来说,我们最大化: U_n(β) = (1/(n(n-1))) Σ_{i≠j} I(Y_i > Y_j) I(X_i^T β > X_j^T β) 这个目标函数只关心YX^T β的排序是否一致。如果Y_i > Y_jX_i^T β > X_j^T β,则贡献1;否则贡献0。
  • 为什么这能处理模型误设? 因为U_n(β)只依赖于YX^T β的秩,而不依赖于DF的具体形式。只要DF是严格递增的,Y的秩就完全由f*(X) = X^T β*的秩决定(加上随机误差ϵ)。因此,即使DF非常复杂(例如,Y = exp(X^T β* + ϵ)),最大化秩相关性仍然能一致地估计出β*(的方向)。
  • 计算困难与DReLU:目标函数U_n(β)包含指示函数I(·),不可微,无法直接用梯度下降优化。本文的关键想法是用一个可微的DReLU函数S_ω(u)来近似I(u > 0)S_ω(u)是一个分段线性函数,其形状像一个“山丘”,当ω很小时,它非常接近I(u > 0),但又是可微的(除了两个拐点)。这样,我们就可以用随机梯度下降来优化近似的目标函数U_{n, ω}(β)
  • 推广到DNN:当f*不是线性函数时,我们只需将X_i^T β替换为一个DNN f_θ(X_i)。整个框架和思路完全不变:最大化Yf_θ(X)之间的秩相关性,并用DReLU来近似指示函数。

一句话总结:本文的核心数学任务是用DNN来最大化一个秩相关目标函数,并通过DReLU近似使其可计算。这个任务的关键在于证明,即使目标函数被近似,估计量仍然能一致地逼近真实的目标函数f*,并达到最优的收敛速度。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:提出了一个“深度变换模型”,用于在DNN框架下进行鲁棒的非参数回归和变量选择,该模型对模型误设和重尾误差不敏感。
  2. 核心工具/方法:使用秩基损失函数(最大秩相关)作为目标函数,并引入双ReLU (DReLU) 函数来平滑近似指示函数,从而使得目标函数可微,便于使用随机梯度下降进行优化。对于变量选择,采用组Lasso惩罚作用于第一层权重。
  3. 主要结论:建立了目标函数f*可识别性;推导了在固定p和发散p两种情况下,秩估计量和DReLU估计量的收敛速度(达到n^{-β/(2β+p)}量级);证明了基于组Lasso的惩罚估计量具有变量选择一致性(第一层权重中,与重要变量相连的权重非零,与噪声变量相连的权重趋于0)。模拟和真实数据分析展示了其相对于现有方法的优势。

关键设定与假设

  • 模型Y = D ◦ F (f*(X), ϵ)DF是未知的严格递增函数,ϵ独立于X。这比标准回归模型Y = f*(X) + ϵ更灵活。
  • 目标函数U_n(f) = (1/(n(n-1))) Σ_{i≠j} I(Y_i > Y_j) I(f(X_i) > f(X_j))。这是最大秩相关(MRC) 的DNN版本。
  • DReLU近似S_ω(u) = σ(u/ω + 1/2) - σ(u/ω - 1/2)。这是一个分段线性函数,用于近似I(u > 0)。相比Sigmoid或正态分布函数,它计算更简单,且与ReLU激活函数兼容。
  • 假设
    • Condition 1 (可识别性)f*属于一个紧致、Lipschitz连续的函数类,且没有两个函数是彼此的严格递增变换。这确保了f*是唯一的最大化U(f)的。
    • Condition 2 (支撑条件)X的第一个坐标的条件密度处处为正。这是MRC估计的标准条件。
    • Condition 3 (变异性)f*的差异能导致Y条件分布的差异。这排除了误差项是奇异分布的情况。
    • Condition 5 (光滑性)f*属于Hölder类H^β。这是非参数回归的标准假设。
    • Condition 7 (稀疏性)f*只依赖于p_s个重要变量。这是高维变量选择的标准假设。
    • Condition 8 (Lojasiewicz不等式):参数空间中的距离与目标函数值的差异之间存在多项式关系。这是一个技术性假设,用于建立参数水平的收敛速度,对ReLU型网络是合理的。

主要结果

  1. 可识别性 (Lemma 1 & 2):在Conditions 1-3下,目标函数f*U(f)的唯一最大化元。对于DReLU近似的U_ω(f),其最大化元f*_ωω→0时收敛到f*。这保证了估计问题的良定性。
  2. 收敛速度 (Theorem 1 & 2, 固定p)
    • 对于秩估计量ˆf_θ,在Conditions 1-6下,其超额风险E[U(f*) - U(ˆf_θ)]的收敛速度为O(n^{-β/(2β+p)} log^3 n)。这是非参数回归的最优收敛速度(忽略对数因子)。
    • 对于DReLU估计量ˆf_{θ, ω_n},在更弱的条件下(不需要Condition 6),其收敛速度为O(n^{-β/(2β+2p)} log^3 n),比秩估计量稍慢。这是因为DReLU近似引入了额外的误差项ω_n
  3. 收敛速度 (Theorem 3 & 4, 发散p)
    • 在稀疏性假设(Condition 7)下,当p ≪ n^{1/2}时,两个估计量的超额风险都能收敛到0。收敛速度随p增大而减慢,但p的容忍度(p ≪ n^{1/2})与许多高维方法一致。
  4. 变量选择一致性 (Theorem 5 & 6)
    • 对于惩罚秩估计量ˆf_{θ, λ_n},其超额风险收敛到0。
    • 更重要的是,与噪声变量相连的第一层权重ν(ˆθ_{λ_n})的L2范数收敛到0,而与重要变量相连的权重则非零。这证明了变量选择的一致性。该结果依赖于Lojasiewicz不等式(Condition 8)和网络权重的有界性假设。

证明路线与技术技巧

  • 整体路线
    1. 逼近误差:首先证明,存在一个DNN f_θ,可以足够好地逼近真实的目标函数f*。这依赖于DNN对Hölder光滑函数的逼近理论(Bauer & Kohler, 2019; Jiao et al., 2023)。网络深度L和宽度W的选择(公式10, 16)就是为了保证逼近误差为O((NM)^{-2β/p})
    2. 估计误差:然后,证明经验目标函数U_n(f)(或其DReLU版本U_{n, ω}(f))在函数类F_θ上一致地收敛到其期望U(f)。这依赖于经验过程理论,特别是对由指示函数或DReLU函数组成的函数类的覆盖数进行界定。
    3. 权衡:最后,通过平衡逼近误差和估计误差,选择最优的网络规模(M, N)和DReLU参数ω_n,得到最终的超额风险上界。
  • 关键跳跃点
    • 处理指示函数的不可微性:这是最大的难点。作者通过引入DReLU函数S_ω来绕过。证明的关键在于,需要量化DReLU近似带来的偏差(E[U(f*) - U_ω(f*)] ≤ ω_n),并证明在DReLU下,经验过程的收敛速度仍然可控。
    • 建立变量选择一致性:这需要从“函数水平”的收敛(超额风险)深入到“参数水平”的收敛(第一层权重)。作者使用了Lojasiewicz不等式(Condition 8)来桥接这个鸿沟。该不等式保证了,如果目标函数值接近最优,那么网络参数也必然接近某个最优参数集Θ。然后,通过组Lasso惩罚的性质,可以证明与噪声变量相连的权重会收缩到0。
  • 技术技巧点名
    • DReLU函数:用于平滑近似指示函数,是本文的核心技术贡献。它比Sigmoid或正态分布函数更简单,且与ReLU网络兼容。
    • 覆盖数(Covering Number):用于控制经验过程的复杂度。作者需要计算由DReLU函数和FNN组成的复合函数类的覆盖数。
    • Lojasiewicz不等式:用于建立参数水平的收敛速度,是证明变量选择一致性的关键工具。
    • 组Lasso惩罚:用于实现变量选择,利用了其“全有或全无”的性质。

真实例子与应用

本文分析了五个真实数据集,展示了方法的实用性: * Energy Prediction Data:连续响应,26个预测变量。方法识别出6个重要变量(如青少年房间湿度)。 * Communities and Crime Data:连续响应,120个预测变量。识别出5个重要变量。 * METABRIC Data:右删失生存数据,488个预测变量(482个基因+6个临床变量)。识别出3个重要变量。 * South German Credit Data:二分类响应,37个输入变量。识别出6个重要变量。 * Wiki4HE Data:二分类响应,50个输入变量。识别出2个重要变量。

这些例子想说明什么? 1. 广泛适用性:方法能处理连续、生存、二分类等多种数据类型。 2. 变量选择能力:在高维(p=488)和低维(p=26)场景下都能进行有意义的变量选择。 3. 预测性能:在预测误差(MSE, LAD等)和秩相关性(Spearman, C-index)上,与多种基线方法(NN-LSE, NN-LAD, MRC等)相比,具有竞争力或更优的表现。特别是在复杂模型下,优势更明显。

🔎 结论是否比证明窄

  • Theorem 2 (DReLU收敛速度) 的结论是O(n^{-β/(2β+2p)}),比Theorem 1 (秩估计量) 的O(n^{-β/(2β+p)})慢。作者在Remark中承认了这一点,并指出在相同条件下可以达到相同速度。但证明中确实显示DReLU近似会引入一个额外的ω_n项,导致速度损失。
  • Theorem 6 (变量选择一致性) 的证明依赖于Condition 8 (Lojasiewicz不等式)网络权重的有界性假设。作者声称这些假设对ReLU网络是合理的,但并未给出严格的证明,只是引用了相关文献(Bolte et al., 2010; Pham, 2012)并指出“this condition is sensible”。因此,结论的严格性依赖于这些假设的成立。
  • 模拟和数据分析中,作者对DReLU估计量ˆf_{θ, ω_n}的变量选择结果没有给出理论保证(Theorem 6只针对秩估计量ˆf_{θ, λ_n})。作者在文中提到“The theoretical results for the penalized DReLU estimator ... are analogous, can be derived following similar steps, and are omitted here.” 这相当于一个conjecture,而非严格证明。

四、开放问题

  1. DReLU估计量的变量选择一致性:本文只证明了秩估计量的变量选择一致性(Theorem 6)。对于计算上更可行的DReLU估计量,其变量选择一致性的严格证明是缺失的(作者声称“类似可证”,但未给出)。扎根点:Section 4.2末尾:“The theoretical results for the penalized DReLU estimator ... are analogous, can be derived following similar steps, and are omitted here.”
  2. 收敛速度的最优性:本文得到的收敛速度n^{-β/(2β+p)}是否是最优的?对于秩基损失,其minimax最优速度是否与平方损失相同?这是一个开放的理论问题。扎根点:Theorem 1的结论。
  3. 更一般的网络结构:本文的变量选择依赖于对第一层权重的组Lasso惩罚。对于更复杂的网络结构(如残差连接、卷积层),如何定义“组”并进行有效的变量选择?扎根点:Section 4.1的讨论。
  4. 计算-统计权衡:本文的方法在理论上需要p ≪ n^{1/2}才能保证收敛。这是否是秩基损失在DNN下的固有局限?是否存在计算上更高效的方法(如利用随机矩阵理论或低度多项式屏障)来突破这一限制?扎根点:Theorem 3 & 4的条件“provided that p ≪ n^{1/2}”。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论