How Fast Do Signatures Learn? Statistical Theory and Applications for Path Regression¶
作者: Blanka Horvath, Wen Su, Wu Su, Binnan Wang, Ruixun Zhang
主题: 非参数 / 半参数
相关性: 7/10
链接: https://arxiv.org/abs/2607.17865
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的核心问题是路径回归(path regression)中的统计学习理论。具体而言,设定为路径值协变量(如 Ito 扩散的连续路径)与标量响应之间的回归问题。路径值协变量是无限维对象,直接分析困难。一个自然的策略是将其转化为有限维特征,而路径签名(path signature)提供了一种通过迭代积分构造的、有序的路径特征层级结构。签名的通用逼近定理(universal approximation theorem)保证了任何连续路径泛函都可以被签名的线性泛函逼近。然而,该定理是定性的:它保证了存在性,但没有量化逼近误差随截断阶数增加而衰减的速度。本文的核心贡献就是填补这个缺口:为截断签名建立 L² 逼近率,证明其 minimax 最优性,并将该率传播到三种统计学习流程(Signature-OLS、Signature-LASSO、Signature-Logistic)中,建立它们的一致性。
发展脉络(history)¶
-
奠基工作:签名的数学基础
- Chen (1957):引入迭代积分理论,奠定了签名的代数基础。
- Lyons (1998):在粗糙路径理论(rough path theory)中将签名发展为核心对象。
- Hambly and Lyons (2010)、Boedihardjo et al. (2016)、Chevyrev and Lyons (2016):研究了签名的单射性和律刻画性质,证明了时间增广路径的签名可以唯一确定路径本身(公式 (2))。这些工作为签名在统计和机器学习中的应用提供了理论基础。
-
主要进展:签名在机器学习中的应用
- Levin et al. (2013)、Király and Oberhauser (2019)、Kidger et al. (2019)、Morrill et al. (2021)、Chevyrev and Oberhauser (2022):将签名用作流回归、核方法、深度学习架构、神经粗糙微分方程和随机过程律推断的特征。这些工作展示了签名的实践有效性。
- Fermanian (2022) 和 Guo et al. (2025):这是与本文最直接相关的统计框架。Fermanian (2022) 研究了使用截断签名的函数线性回归;Guo et al. (2025) 建立了稀疏有限级表示下签名回归的 LASSO 一致性。本文作者明确指出,他们的贡献与这两篇工作的区别在于:第一,他们推导了截断签名的 L² 逼近率,而 Fermanian (2022) 和 Guo et al. (2025) 将截断签名模型视为精确的,没有建模有限级逼近误差;第二,Fermanian (2022) 研究有界变差路径,Guo et al. (2025) 研究布朗运动和 OU 过程,而本文研究一般 Ito 扩散;第三,本文同时发展了 Signature-OLS、Signature-LASSO 和 Signature-Logistic 框架。
-
当前 Frontier 与本文位置
- 当前的前沿是量化签名逼近的统计性质。尽管签名在应用中广泛使用,但其统计收敛理论仍然有限。本文直接切入这个缺口:将签名的通用逼近定理从定性结果提升为定量结果,并证明其 minimax 最优性。本文的位置是为签名路径回归提供定量基础,并展示其在真实数据预测任务中的有效性。
子线索聚类¶
- 签名的数学基础:Chen (1957), Lyons (1998), Friz and Victoir (2010), Hambly and Lyons (2010), Boedihardjo et al. (2016), Chevyrev and Lyons (2016)。这一簇关注签名的代数、几何和概率性质,如单射性、律刻画和粗糙路径理论。
- 签名在机器学习中的应用:Levin et al. (2013), Király and Oberhauser (2019), Kidger et al. (2019), Morrill et al. (2021), Chevyrev and Oberhauser (2022), Lyons et al. (2020), Cuchiero et al. (2023), Bayraktar et al. (2024), Bayer et al. (2025)。这一簇将签名作为特征用于各种预测和决策问题,强调实践有效性。
- 签名回归的统计理论:Fermanian (2022), Guo et al. (2025), 本文 (Horvath et al., 2026)。这一簇研究签名回归的统计性质,如一致性和收敛率。本文是其中第一个量化逼近误差并证明 minimax 最优性的工作。
这个方向在追问的核心问题¶
- 逼近率:截断签名的逼近误差如何随截断阶数 K 衰减?这个率是否最优(minimax)?
- 统计一致性:当使用截断签名特征进行回归时,估计量是否一致?逼近误差如何影响统计误差?
- 逼近-估计权衡:如何选择截断阶数 K 以平衡逼近误差(K 越大误差越小)和估计误差(K 越大特征维度越高,估计越困难)?
- 稀疏性:在什么条件下,路径泛函的签名表示是稀疏的?LASSO 能否恢复这种稀疏结构?
已知瓶颈:签名的维度随截断阶数 K 呈指数增长(d_K ≍ (d+1)^K),这导致在高维路径或高截断阶数下,估计误差会迅速增大。因此,如何选择 K 或进行特征选择是核心瓶颈。
⚠️ 作者的 framing¶
作者将缺口 frame 成:“经典通用逼近定理是定性的,它保证了逼近但不量化速度。一旦截断签名用于回归,这个缺失的率就变得至关重要。” 因此,本文的“显然的下一步”就是量化这个率,并将其传播到统计学习流程中。
被淡化或回避的竞争路线: * 随机 Taylor 展开:作者在 Remark 中提到了 Cuchiero et al. (2023) 给出的 SDE 解的 L² 界 O(T^{K+1}),并指出这种界对短时间逼近有用,但不能提供固定时间区间上的大 K 收敛率。作者通过这个对比,凸显了他们的结果(固定时间区间上的多项式率)的独特性。 * 函数型数据分析(FDA):作者在引言中提到“经典函数型数据方法提供了通用的基展开,但它们不能自动编码轨迹的非交换时间顺序”。这暗示了签名相对于传统 FDA 方法(如 FPCA)的优势,但并未深入比较两者在特定问题上的统计效率。
什么明显该被引 / 该存在、却没出现在 intro 里? * 没有提及与签名逼近率相关的、来自逼近论或调和分析的更一般性结果。例如,对于一般路径(非扩散),是否存在类似的逼近率?作者将研究范围限定在 Ito 扩散的平滑泛函类上,这是一个合理的起点,但 intro 没有讨论这个类之外的挑战。 * 没有提及与计算复杂度相关的文献。签名特征维度指数增长,其计算成本(尤其是高阶签名)是实际应用中的一个关键问题。虽然作者在 LASSO 部分讨论了稀疏性,但没有从计算-统计折衷的角度进行讨论。
张力¶
未见明显对立引用。被引工作之间没有彼此矛盾或在略不同条件下得相反结论的情况。它们共同构成了一个从数学基础到应用再到统计理论的渐进发展脉络。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
X = {X_t}_{t∈[0,T]}:一个 d 维的连续时间随机过程(路径),是协变量。Ẋ_t = (t, X_t^⊤)^⊤:时间增广路径,用于消除时间重参数化的歧义。Z:标量响应变量。Y = E[Z | F_T^X] = f_0(Ẋ):条件均值,是路径Ẋ的一个未知泛函f_0。ε = Z - Y:噪声,满足E[ε | F_T^X] = 0。S(Ẋ)_T:路径Ẋ在时间T的完整签名,是一个无限维对象,包含所有阶的迭代积分。S(Ẋ)_T^{≤K}:截断签名,只包含阶数不超过 K 的签名分量,是一个有限维向量。s_K(Ẋ) ∈ ℝ^{d_K}:截断签名向量,d_K是其维度(通常d_K ≍ (d+1)^K)。K:截断阶数,是控制逼近精度的超参数。L_K^0:在给定截断阶数 K 下,最优的线性系数向量,定义为L_K^0 = argmin_{L_K} E[(f_0(Ẋ) - s_K(Ẋ)^⊤ L_K)^2]。ξ_K^X(f_0) = f_0(Ẋ) - s_K(Ẋ)^⊤ L_K^0:逼近残差,是真实泛函f_0与其在签名特征空间上的 L² 投影之间的误差。n:样本量。{(Z_i, X_i)}_{i=1}^n:i.i.d. 观测样本。γ:平滑度参数,刻画目标泛函f_0的平滑性。Q:逼近误差的衰减指数,满足E[(ξ_K^X(f_0))^2] = O(K^{-Q})。在本文的主要结果中,Q = 2γ。
-
模型:
- 路径
X是一个 d 维 Ito 扩散,满足 SDE:dX_t = b(t, X_t) dt + σ(t, X_t) dB_t,其中B_t是 q 维标准布朗运动,b和σ是全局 Lipschitz 且有界的。 - 目标泛函
f_0属于一个平滑扩散-泛函类U_{γ,R},其形式为Y = F_h(X) = Σ_{a=0}^d ∫_0^T h_a(t, X_t) ◦ dẊ_t^a,其中h = (h_0, ..., h_d)是平滑的确定性系数函数,H_γ(h) ≤ R。这个类包含了通过时间积分和 Stratonovich 积分生成的平滑系数泛函。 - 响应变量
Z由Z = f_0(Ẋ) + ε生成,ε是均值为 0 的噪声。
- 路径
-
可观测数据:
- 研究者可以观测到
n个 i.i.d. 的样本对{(Z_i, X_i)}_{i=1}^n。 - 对于每个样本
i,可以观测到完整的路径X_i(或其离散化观测),并据此计算出截断签名s_K(Ẋ_i)。 - 想要但观测不到的是:真实的条件均值泛函
f_0、逼近残差ξ_K^X(f_0)、以及噪声ε。这些是只能通过假设和估计来处理的潜在量。
- 研究者可以观测到
第二步:讲最小内核¶
本文的核心思路可以浓缩为一个最简特例:一维标准布朗运动 B_t 上的线性泛函回归。
-
最简特例设定:
- 路径
X = B是一维标准布朗运动 (d=1)。 - 时间区间
[0, T]固定。 - 目标泛函是一阶 Wiener 混沌中的元素:
Y = f_0(Ẅ) = ∫_0^T g(t) dB_t,其中g(t)是一个平滑的确定性函数(属于 Sobolev 空间W^{γ,2}([0,T]))。 - 响应
Z = Y + ε。 - 我们使用时间增广布朗运动
Ẅ_t = (t, B_t)的截断签名s_K(Ẅ)作为特征。
- 路径
-
在这个特例下,核心问题退化成什么?
- 逼近问题:
Y的 L² 投影到s_K(Ẅ)张成的空间上,其误差ξ_K^B(Y)是多少? - 根据引理 A.2(签名-混沌关系),
s_K(Ẅ)张成的空间与阶数不超过 K 的 Wiener 混沌的交集,恰好是核函数为次数不超过 K-1 的多项式的随机积分。也就是说,s_K(Ẅ)的一阶混沌部分由形如∫_0^T p(t) dB_t的随机变量张成,其中p(t)是次数 ≤ K-1 的多项式。 - 因此,
Y在s_K(Ẅ)上的 L² 投影,就是Y在由{∫_0^T t^j dB_t}_{j=0}^{K-1}张成的空间上的 L² 投影。 - 所以,逼近误差
E[(ξ_K^B(Y))^2]就等于用次数不超过 K-1 的多项式p(t)来逼近核函数g(t)的 L² 逼近误差:E[(ξ_K^B(Y))^2] = inf_{p ∈ P_{K-1}([0,T])} ∫_0^T (g(t) - p(t))^2 dt。
- 逼近问题:
-
证明怎么走?为什么成立?
- 逼近率:根据经典的多项式逼近理论,对于一个 γ 阶 Sobolev 光滑的函数
g,用 K-1 次多项式逼近的 L² 误差是O(K^{-2γ})。因此,E[(ξ_K^B(Y))^2] = O(K^{-2γ})。 - Minimax 最优性:对于 Sobolev 球
{g: ||g||_{W^{γ,2}} ≤ R},多项式逼近的 minimax 率就是K^{-2γ}。因此,这个率是紧的,无法被任何其他基于截断签名的线性方法一致地改进。 - 统计一致性:对于 Signature-OLS,估计误差是
O_P(d_K/n),其中d_K ≍ 2^K。总预测误差是O_P(2^K/n + K^{-2γ})。为了达到一致性,需要2^K/n → 0且K^{2γ}/2^K → ∞。第一个条件要求K不能太大(否则特征维度爆炸),第二个条件要求K不能太小(否则逼近误差主导)。这个权衡就是本文的核心。
- 逼近率:根据经典的多项式逼近理论,对于一个 γ 阶 Sobolev 光滑的函数
-
这个特例揭示了什么?
- 签名在路径空间上扮演了多项式的角色。截断签名相当于一个多项式基。
- 逼近率完全由目标泛函的平滑度
γ决定,这与经典的非参数回归理论完全对应。 - 本文的一般情形(Ito 扩散、更复杂的泛函类)只是这个特例的“加壳”:通过 Malliavin 分析、局部化、Itô-Stratonovich 转换等技术,将一般问题约化到类似于布朗运动-多项式逼近的框架中。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:本文研究了路径回归中,使用截断签名作为特征时的逼近误差率和统计学习理论,具体针对 Ito 扩散的平滑系数泛函类。
- 核心工具/方法:核心工具包括路径签名的代数性质(shuffle identity)、扩散过程的 Malliavin 分析(用于处理一般扩散)、经典的多项式逼近理论(Jackson 定理)、以及高维统计的集中不等式(用于 LASSO 分析)。
- 主要结论:建立了截断签名的 L² 逼近率
O(K^{-2γ})并证明其 minimax 最优;将该率传播到 Signature-OLS(渐近正态性)、Signature-LASSO(支持恢复一致性)和 Signature-Logistic(潜在得分一致性)中,揭示了逼近-估计权衡。
关键设定与假设¶
- 路径模型:
X是 d 维 Ito 扩散(公式 8),漂移和扩散系数全局 Lipschitz 且一致有界(公式 9)。这是一个比有界变差路径(Fermanian, 2022)或布朗运动(Guo et al., 2025)更一般的设定。 - 目标泛函类:
U_{γ,R}(定义 2)。泛函形式为F_h(X) = Σ ∫ h_a ◦ dẊ^a(公式 10),系数函数h_a满足各向异性的混合平滑度条件H_γ(h) ≤ R(公式 11)。这个类比所有连续路径泛函窄,但覆盖了许多实际中出现的累积和路径依赖量。 - Signature-OLS 假设(Assumption 1):
- (i) 总体 Gram 矩阵
Σ_K = E[s_K s_K^⊤]的特征值有界且远离 0 和 ∞。这是标准非退化条件。 - (ii) 逼近误差
E[(ξ_K^X(f_0))^2] = O(K^{-Q})。这是来自 Section 3 的逼近率输入。相比已有文献,Fermanian (2022) 和 Guo et al. (2025) 没有这个假设,因为他们将模型视为精确的。
- (i) 总体 Gram 矩阵
- Signature-LASSO 假设(Assumption 2):
- (i) Irrepresentable 条件:
||(Σ_K)_{A_0^c A_0} (Σ_K)_{A_0 A_0}^{-1}||_∞ ≤ 1-η。这是 LASSO 支持恢复的经典充分条件(Zhao and Yu, 2006; Wainwright, 2009)。相比已有文献,Guo et al. (2025) 也使用了类似条件,但本文将其与逼近误差传播结合。 - (ii) 同 Assumption 1(ii)。
- (iii) 噪声
ε是 sub-Gaussian 的。 - (iv) 活跃集
A_0的 Gram 矩阵(Σ_K)_{A_0 A_0}特征值有界。相比 OLS,这里不要求整个Σ_K可逆。
- (i) Irrepresentable 条件:
- Signature-Logistic 假设(Assumption 3):
- (i) 逻辑 Hessian 矩阵
H_K(L)在L_K^0附近局部非退化,且Σ_K有上界。这是逻辑回归的标准条件。 - (ii) 同 Assumption 1(ii)。
- (i) 逻辑 Hessian 矩阵
主要结果¶
-
定理 1(签名逼近率):对于
(X, h) ∈ U_{γ,R},E[|ξ_K^X(Y)|^2] = O(K^{-2γ}),且这个率在U_{γ,R}上是 minimax 最优的。这是本文最核心的理论贡献,将定性逼近定理定量化。- 直觉:平滑度
γ越高,逼近越快。K的作用类似于经典非参数回归中的多项式阶数。 - 必要条件:目标泛函属于
U_{γ,R}类。 - 解决的技术难点:如何将一般 Ito 扩散的逼近问题约化到布朗运动-多项式逼近的框架。作者通过局部化(将路径限制在一个紧集上)、多项式逼近(Jackson 定理)、以及控制尾部误差(利用扩散系数的有界性和指数尾界)来解决。
- 直觉:平滑度
-
定理 2(Signature-OLS 一致性):在 Assumption 1 下,若
d_K^2/n → 0且K^Q / d_K^2 → ∞,则ŝf_K(ẋ) - f_0(ẋ) = o_P(1)。在更强的条件下,有渐近正态性。- 直觉:
d_K^2/n → 0确保估计误差消失;K^Q / d_K^2 → ∞确保逼近误差相对于估计波动可忽略。 - 关键洞察:由于
d_K指数增长,在多项式逼近率Q=2γ下,K^Q / d_K^2无法发散到无穷。这意味着不能使用所有签名坐标。作者指出了两条出路:更强的平滑度(指数衰减率)或特征选择(LASSO)。
- 直觉:
-
定理 3(Signature-LASSO 支持恢复):在 Assumption 2 下,若
q_K M_ψ^{2K} max(√(log d_K / n), (log d_K)^K / n) → 0,则P(supp(ŝL_K) ⊆ A_0) → 1,且系数估计一致。- 直觉:LASSO 的成功依赖于活跃集大小
q_K而非总特征数d_K。只要活跃集增长不太快,即使d_K远大于n,也能恢复支持集。 - 关键洞察:逼近率指数
Q没有出现在选择率中,这表明在多项式逼近率下,LASSO 提供了一个比 OLS 更可行的框架。
- 直觉:LASSO 的成功依赖于活跃集大小
-
定理 4(Signature-Logistic 一致性):在 Assumption 3 下,若
d_K^2/n → 0且d_K K^{-Q} → 0,则ŝf_K(ẋ) - f_0(ẋ) = O_P(√(d_K/n) + √(d_K) K^{-Q/2}) = o_P(1)。- 直觉:逻辑回归的误差由估计误差
√(d_K/n)和逼近误差√(d_K) K^{-Q/2}共同决定。
- 直觉:逻辑回归的误差由估计误差
证明路线与技术技巧(理论型)¶
-
定理 1 证明路线(5 步):
- 局部化:构造一个高概率事件
A_K = {sup_{t∈[0,T]} ||X_t||_∞ ≤ m_K},其中m_K = K^β增长得比K慢。在这个事件上,路径被限制在一个紧集D_K内。 - 多项式逼近:在紧集
D_K上,用 Jackson 定理将系数函数h_a逼近为多项式p_{a,K},逼近误差为O(K^{-γ})。 - 签名实现:证明由多项式系数
p_{a,K}生成的泛函Y_K是一个阶数不超过 K 的签名泛函(即Y_K ∈ S_K(X))。这一步利用了 shuffle identity 将多项式写成签名的线性组合。 - 控制局部化事件上的误差:在事件
A_K上,计算Y - Y_K的 L² 误差,利用 Itô-Stratonovich 转换、Itô 等距和 BDG 不等式,得到O(K^{-2γ})的界。 - 控制尾部误差:在事件
A_K^c上,利用扩散系数的有界性、BDG 不等式和指数尾界,证明尾部误差是o(K^{-2γ})。 - Minimax 最优性:通过构造一个一维布朗运动的子类(
Y = ∫ g(t) dB_t),将问题约化到经典的多项式逼近 minimax 下界,证明K^{-2γ}不可改进。
- 局部化:构造一个高概率事件
-
关键跳跃点:
- 从布朗运动到一般 Ito 扩散:布朗运动的签名-混沌关系(引理 A.2)是清晰的。对于一般扩散,作者通过局部化、Itô-Stratonovich 转换和 Malliavin 分析,将问题约化到在局部化紧集上对系数函数进行多项式逼近。这个跳跃的核心是证明,在局部化事件上,扩散路径的签名逼近误差可以由系数函数的逼近误差控制。
- 处理 Stratonovich 积分:目标泛函使用 Stratonovich 积分(满足 shuffle identity),但 Itô 积分在计算上更直接。引理 A.1 证明了对于布朗运动,两种签名张成相同的线性空间,这允许在证明中灵活切换。
-
技术技巧点名:
- Jackson 逼近定理:用于在紧集上对平滑函数进行多项式逼近,得到
O(K^{-γ})的误差。 - Shuffle identity:用于将多项式(系数函数的逼近)写成签名坐标的线性组合。
- Itô-Stratonovich 转换:用于处理 Stratonovich 积分,将其分解为 Itô 积分和二次变差修正项。
- Burkholder-Davis-Gundy (BDG) 不等式:用于控制随机积分的矩。
- 指数尾界 / 子高斯尾界:用于控制局部化事件的补集上的误差。
- Irrepresentable 条件:用于 LASSO 的支持恢复证明。
- 子 Weibull 尾界(引理 A.4):用于证明签名坐标的 tail bound,这是高维分析的基础。
- Jackson 逼近定理:用于在紧集上对平滑函数进行多项式逼近,得到
真实例子与应用¶
本文包含三个真实数据应用,分别对应三种统计学习流程:
-
外汇波动率预测(Signature-OLS + LASSO):
- 数据:12 个主要美元货币对的一分钟汇率数据(2013-2023)。
- 方法:使用过去 22 个交易日的日内路径的 Level-3 截断签名作为特征,先通过 LASSO 选择特征,再使用 OLS 进行预测(post-selection OLS)。
- 结果:Signature-OLS 在 12 个货币对上的 RMSE 和 R² 均优于 HAR 族基准模型,平均 RMSE 降低 7.9%。这个例子想说明:签名特征能捕捉到标准波动率摘要(如已实现波动率、半方差)所丢弃的日内路径有序交互信息,从而提升预测性能。
-
电池寿命预测(Signature-LASSO):
- 数据:241 个锂离子电池的早期 HPPC 脉冲路径数据。
- 方法:使用 Level-3 截断签名作为特征,比较 OLS、Ridge 和 LASSO 的表现。
- 结果:Signature-LASSO 表现最佳(Test MAE=188.9, R²=0.529),远优于手工特征(Handcrafted-LASSO, Test MAE=310.4, R²=0.099)。Signature-OLS 严重过拟合(Test R²=-2.599)。这个例子想说明:签名特征表示能力强,但在高维小样本下必须配合正则化(如 LASSO)才能获得稳定的预测性能,验证了稀疏回归的理论。
-
癫痫检测(Signature-Logistic):
- 数据:CHB-MIT 头皮 EEG 数据库,22 名患者的短时 EEG 窗口。
- 方法:使用 Level-2 截断签名作为特征,使用弹性网络逻辑回归(Signature-Logistic (EN))。
- 结果:Signature-Logistic (EN) 在平衡准确率(95.8%)和 AUC(98.6%)上均优于手工特征基准(Handcrafted + RF: B-ACC=82.1%, AUC=96.8%),且在所有 22 名患者上均优于 RF。这个例子想说明:签名特征能有效处理极端类别不平衡的二元分类问题,且其性能优势在阈值和患者层面都是稳健的。
🔎 结论是否比证明窄¶
- 是。定理 1 的逼近率
O(K^{-2γ})是针对平滑扩散-泛函类U_{γ,R}严格证明的。这个类虽然比所有连续路径泛函窄,但作者在结论和讨论中有时会使用更宽泛的语言,如“为签名路径回归提供定量基础”。读者需要意识到,对于不属于U_{γ,R}的泛函(如涉及障碍、停时、占据时间的非平滑泛函),该逼近率不一定成立。作者在结论中也明确指出了这一点:“approximation theory could be extended to more general path functionals, including barriers, stopping rules, occupation times...”。 - Signature-LASSO 的结论(定理 3)依赖于irrepresentable 条件。这是一个充分但不必要的条件,且在实践中难以验证。作者在 Remark 中引用了 Guo et al. (2025) 的工作,指出该条件在相关布朗运动签名下成立,但并未在本文的一般设定下验证。因此,结论的适用范围受限于这个假设。
- Signature-Logistic 的结论(定理 4)要求
d_K^2/n → 0,这排除了d_K随n线性增长或更快增长的高维情形。这与 LASSO 的结论形成对比,后者允许d_K远大于n。
四、开放问题¶
- 更一般的路径泛函:本文的逼近理论能否扩展到障碍、停时、占据时间等非平滑路径依赖量?作者在结论中明确将其列为开放问题(Section 7, “approximation theory could be extended to more general path functionals, including barriers, stopping rules, occupation times...”)。这是一个扎根于本文结论窄化的具体问题。
- 结构化、选择和稀疏化的签名词典:由于签名坐标数量随维度和截断阶数快速增长,需要更锐利的理论来指导如何构建结构化、经过选择和稀疏化的签名词典(Section 7, “sharper theory is needed for structured, selected, and sparsified signature dictionaries”)。这是一个扎根于本文局限性(维度灾难)的开放问题。
- 相依样本下的统计理论:本文假设 i.i.d. 样本。将统计分析扩展到相依样本(如弱相依函数型数据)是一个自然的方向(Section 7, “extending the statistical analysis to dependent samples”)。作者引用了 Hörmann and Kokoszka (2010) 作为起点。
- 自适应特征选择:本文的 LASSO 分析依赖于 irrepresentable 条件。能否开发出不依赖该条件的、自适应的特征选择方法,并建立其理论性质?这是一个扎根于 LASSO 证明假设的开放问题。
Maintained by 陈星宇 · Homepage · Source on GitHub