Nonparametric inference for density-dependent McKean--Vlasov diffusions¶
作者: Denis Belomestny, Ekaterina Morozova
主题: 非参数 / 半参数
相关性: 6/10
链接: https://arxiv.org/abs/2609.01166
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的核心问题是:如何从独立同分布的横截面观测数据中,非参数地估计一个多变量 McKean-Vlasov 扩散过程的密度依赖漂移系数及其平稳密度。这里的“密度依赖”是指漂移项直接依赖于过程本身的点态概率密度(而非其矩、核函数或累积分布函数),这使得问题在数学上具有奇异性——漂移关于测度的弱拓扑不连续。观测数据是多个独立粒子在同一时刻的样本(横截面数据),而非单个粒子的长轨迹。这是一个结合了非线性扩散过程、非参数统计和逆问题的交叉子方向,目前处于从“存在性与唯一性”等概率论基础向“统计推断”过渡的阶段,非参数估计的理论(尤其是最优速率)才刚刚开始建立。
发展脉络(history)¶
-
奠基工作:McKean-Vlasov SDE 的提出与概率论基础
- McKean [1966] 和 Sznitman [1991] 建立了 McKean-Vlasov SDE 的框架,作为平均场极限的标准模型。这些工作奠定了过程的概率论基础(存在性、唯一性、传播混沌),但未涉及统计推断。
- Kasonga [1990] 首次将极大似然理论引入大规模相互作用系统,为后续的统计工作提供了起点。
-
主要进展:从参数/半参数到非参数,从轨迹到横截面
- 参数与半参数方法:Belomestny et al. [2023b] 和 Genon-Catalot & Larédo [2024] 分别研究了半参数和参数设定下的估计问题。后者针对遍历的 McKean-Vlasov SDE,利用长时间连续观测路径进行推断,证明了估计量的相合性与渐近正态性。这些工作依赖于参数化假设,限制了模型的灵活性。
- 非参数方法(轨迹数据):Della Maestra & Hoffmann [2022] 和 Comte & Genon-Catalot [2023] 将非参数估计引入相互作用粒子系统。前者基于固定时间窗口内整个粒子系统的轨迹,构建了自适应核估计器,并证明了其在各向异性 Hölder 类上的 minimax 最优性。后者则针对漂移线性于空间、依赖于两个未知确定性函数的模型,提出了投影估计器。这些工作通常需要观测整个系统的演化轨迹。
- 非参数方法(横截面数据):Belomestny & Orlova [2025] 是本文最直接的先驱。他们研究了漂移依赖于累积分布函数的守恒律 McKean-Vlasov SDE,并利用 ODE 诱导的似然框架和深度神经网络筛,从横截面数据中实现了非参数估计。这证明了从横截面数据推断非线性扩散的可行性,但其依赖的是 CDF,而非点态密度。
-
当前 Frontier 与本文位置
- 当前 Frontier:将非参数推断推广到漂移依赖于点态密度(Nemytskii 型)的更奇异模型。这需要处理漂移关于测度的不连续性,以及由此产生的逆问题稳定性分析。Grube [2024] 和 Bogachev et al. [2024] 等概率论工作为这类方程的解的存在性和正则性提供了理论基础。
- 本文的位置:本文是首次对密度依赖的 McKean-Vlasov 扩散进行非参数估计并给出minimax 最优速率的工作。它建立在 Belomestny & Morozova [2026] 对 Ornstein-Uhlenbeck 势下该模型遍历性质的分析之上,并将 Belomestny et al. [2023a] 的 ReQU 神经网络逼近理论应用于统计推断。它填补了从“CDF 依赖”到“点态密度依赖”的关键空白,并处理了由此产生的“端点自适应逼近”和“非线性逆稳定性”等新挑战。
子线索聚类¶
- 概率论与 PDE 基础:关注 McKean-Vlasov 方程(特别是 Nemytskii 型)的解的存在性、唯一性、正则性和遍历性。代表工作:McKean [1966], Sznitman [1991], Grube [2024], Bogachev et al. [2024], Barbu & Roeckner [2024], Belomestny & Morozova [2026]。
- 统计推断(参数/半参数):在参数或半参数假设下,利用轨迹或横截面数据估计模型参数。代表工作:Kasonga [1990], Belomestny et al. [2023b], Genon-Catalot & Larédo [2024], Sharrock et al. [2023]。
- 统计推断(非参数):在非参数假设下,利用轨迹或横截面数据估计漂移或密度函数。代表工作:Della Maestra & Hoffmann [2022], Comte & Genon-Catalot [2023], Belomestny & Orlova [2025], 本文。
- 神经网络逼近理论:为统计估计提供函数逼近工具。代表工作:Schmidt-Hieber [2020](ReLU 网络),Belomestny et al. [2023a](分段多项式激活网络,本文所用 ReQU 的基础)。
这个方向在追问的核心问题¶
- 可识别性与估计速率:从横截面数据中,能以多快的速率恢复密度依赖的漂移系数?该速率受哪些因素(如势函数的光滑性、密度范围、空间维度)影响?
- 逆问题的稳定性:从平稳密度到漂移系数的映射是“求导”操作,本质上是病态的。如何利用光滑性假设(如 Hölder 类)来稳定这个逆问题,并建立从 KL 散度到系数 L² 损失的插值不等式?
- 端点效应:由于漂移系数在低密度区域(空间尾部)不可识别,估计问题天然是“局部”的。如何设计逼近方法(如分级网格)来最优地处理端点附近的逼近误差?
- 计算与统计的权衡:神经网络筛提供了灵活性,但其复杂度(如网络宽度、深度、非零参数个数)如何影响统计速率?是否存在一个最优的复杂度选择?
⚠️ 作者的 framing¶
- 作者把缺口 frame 成什么:作者将现有非参数工作(Della Maestra & Hoffmann [2022], Comte & Genon-Catalot [2023])定位为处理“更平滑的泛函”(如矩、核函数)或需要“轨迹观测”。他们将 Belomestny & Orlova [2025] 定位为处理“CDF 依赖”的模型。因此,本文的“显然的下一步”就是处理“点态密度依赖”这一更奇异、更困难的情形,并声称这是首次为该模型建立非参数 minimax 最优估计理论。
- 哪些竞争路线被他淡化或回避了:
- 核/样条方法:作者完全采用了神经网络筛,没有与经典的核估计或样条方法进行任何理论或数值比较。虽然神经网络在逼近高维或复杂函数时有优势,但本文通过势函数将问题降为一维,核/样条方法在一维问题中通常非常有效且理论成熟。作者回避了“为什么神经网络是必要的”这一关键问题。
- 其他非参数方法:作者没有讨论或引用任何基于局部多项式、正交级数或其他非神经网络筛的估计方法。这给人一种印象,即神经网络是唯一可行的工具。
- 什么明显该被引 / 该存在、却没出现在 intro 里?:本文的速率
(log n / n)^{β/(2β+3)}与一维非参数回归中 Hölder 类函数的 minimax 速率n^{-β/(2β+3)}在形式上非常相似(除了对数因子)。作者没有明确讨论或引用这个经典的类比,这可能会让读者好奇:这个速率是否本质上就是“从密度到系数”的逆问题将回归速率“降级”的结果?此外,关于“端点自适应”的文献(如自适应核估计、边界核)没有被引用,尽管本文的核心技术挑战之一就是处理端点。
张力¶
未见明显对立引用。所有被引工作都在各自的设定下推进,没有出现对同一问题得出相反结论的情况。主要的“张力”存在于不同设定之间(如轨迹 vs. 横截面,CDF 依赖 vs. 密度依赖),但这更多是问题复杂度的递进,而非结论的矛盾。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
X_t:d维随机过程,在时间t的状态。p_t(x):X_t在时间t的 Lebesgue 密度。V(x):已知的d维势函数(confining potential),例如V(x) = 1 + ||x||^2 / 2。Ξ(r):未知的密度依赖漂移系数(interaction function),是ℝ⁺ → ℝ⁺的函数。这是要估计的目标。W_t:d维标准布朗运动。π_Ξ(x):对应于系数Ξ的平稳密度。n:样本量(独立粒子的个数)。X_1, ..., X_n:可观测的独立同分布样本,来自平稳分布π_{Ξ₀},其中Ξ₀是真实系数。β:Hölder 光滑性参数,Ξ₀ ∈ ℋ^β。𝜅, K:Ξ的上下界常数,0 < 𝜅 ≤ Ξ(r) ≤ K < ∞。a_0:真实平稳密度的最大值,a_0 = max_x π_{Ξ₀}(x)。I = [r⁻, r⁺]:一个紧区间,I ⋐ (0, a_0),是系数Ξ可被识别的内部区域。𝑔_𝜉(r) = ∫₁ʳ (u 𝜉(u))⁻¹ du:一个从系数到其原函数的映射。𝑞_𝜉(s) = 𝑔_𝜉⁻¹(𝜇_𝜉 - s):平稳密度在能量坐标s = V(x)下的表示。𝑚_V(s):势函数V的余面积因子(coarea factor),描述能量水平集{x: V(x)=s}的面积。
-
模型:
- 数据生成机制由 McKean-Vlasov SDE 描述:
dX_t = -Ξ(p_t(X_t)) ∇V(X_t) dt + √2 dW_t - 这是一个非线性扩散:漂移项不仅依赖于当前位置
X_t,还依赖于整个过程的密度p_t在该点的值。 - 在平稳状态下,密度
π_Ξ满足零通量条件,并可通过求解一个一阶 ODE 得到(见 Proposition 3.4)。
- 数据生成机制由 McKean-Vlasov SDE 描述:
-
可观测数据:
- 可观测:
n个独立同分布的d维向量X_1, ..., X_n,每个都来自平稳分布π_{Ξ₀}。 - 想要但观测不到:我们无法观测到过程的路径
{X_t},也无法观测到密度p_t本身。我们只能通过样本X_i来推断Ξ₀。此外,Ξ₀在密度趋于 0 的区域(即r → 0)是不可识别的,因为那里没有数据。
- 可观测:
第二步:讲最小内核¶
本文的核心数学困难可以浓缩为一个一维非线性逆问题。
最简特例:考虑一维情况 (d=1),并假设势函数是 Ornstein-Uhlenbeck 势 V(x) = 1 + x²/2。此时,∇V(x) = 2x。模型变为:
dX_t = -2 Ξ(p_t(X_t)) X_t dt + √2 dW_t
核心思路:
1. 降维:作者证明,平稳密度 π_Ξ(x) 可以写成 π_Ξ(x) = q_Ξ(V(x)),其中 q_Ξ(s) 是一个一维函数。这意味着,尽管原始问题是 d 维的,但平稳密度的结构完全由一维函数 q_Ξ 决定。因此,观测 X_i 的似然等价于观测其能量 S_i = V(X_i) 的似然。问题从估计一个 d 维函数 π_Ξ 简化为估计一个一维函数 q_Ξ。
-
从
q_Ξ到Ξ的逆问题:q_Ξ满足一个简单的 ODE(公式 3.5):q'_Ξ(s) = - q_Ξ(s) Ξ(q_Ξ(s))这个 ODE 告诉我们,Ξ可以从q_Ξ的导数中恢复出来:Ξ(r) = - (log q_Ξ)'(s) |_{s = q_Ξ⁻¹(r)}换句话说,估计Ξ等价于先估计q_Ξ,然后对其求导并进行变量变换。 -
最小内核问题:现在,核心的数学问题变成了: > 给定来自
q_Ξ₀(s)的n个独立样本S_i = V(X_i),如何以最优速率估计Ξ₀(r) = - (log q_Ξ₀)'(q_Ξ₀⁻¹(r))?这是一个典型的逆问题,因为从
q_Ξ到Ξ的映射涉及求导,这是一个病态操作(会放大噪声)。作者的关键想法是: * 正向映射:定义一个从系数Ξ到其平稳密度π_Ξ的映射F: Ξ → π_Ξ。这个映射是“平滑”的(包含一次积分操作)。 * 在正向空间做逼近:作者不直接逼近Ξ,而是先构造一个神经网络筛𝒳_m来逼近Ξ,然后通过F映射到密度空间。他们证明,如果Ξ的逼近误差在某种“前向范数”||𝒜(Ξ_m - Ξ₀)||下很小,那么对应的密度π_{Ξ_m}就会很接近真实密度π₀。 * 逆问题稳定性:为了从密度的接近程度反推系数的接近程度,作者利用Ξ的 Hölder 光滑性假设,建立了一个插值不等式(Lemma A.4):||Ξ_m - Ξ₀||_{L²(I)} ≲ KL(π₀ || π_{Ξ_m})^{β / (2(β+1))}这个不等式表明,如果 KL 散度以速率n^{-2(β+1)/(2β+3)}收敛,那么系数的 L² 损失将以(n^{-2(β+1)/(2β+3)})^{β/(2(β+1))} = n^{-β/(2β+3)}收敛。这正是本文得到的速率。
一句话总结:本文的核心是在一个一维非线性逆问题中,通过先在前向(密度)空间中进行最优逼近,再利用光滑性假设稳定逆向(系数)映射,从而得到 minimax 最优的估计速率。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:从独立同分布的横截面观测数据中,非参数地估计多变量密度依赖 McKean-Vlasov 扩散的漂移系数
Ξ及其平稳密度π_Ξ。 - 核心工具/方法:利用已知势函数
V将问题降为一维,构建基于稀疏 ReQU 神经网络的筛极大似然估计器(sieve MLE),并采用端点自适应分级逼近(endpoint-adapted graded approximation)技术。 - 主要结论:对于 Hölder 光滑性为
β的系数,估计器对平稳密度的 KL 散度达到(b_n log n / n)^{2(β+1)/(2β+3)}的收敛速率,对漂移系数的 L² 损失达到(b_n log n / n)^{β/(2β+3)}的速率(b_n至多为对数因子)。通过 Assouad 下界证明该速率在 minimax 意义下最优(至多差对数因子)。
关键设定与假设¶
- Assumption 3.1 (势函数
V):V是C²的、强制的(coercive),且e^{-aV}可积。其水平集测度m_V(s)在紧区间上有界且远离 0。这保证了平稳密度的存在性和尾部指数衰减。 - Assumption 3.3 (系数类):
Ξ有界(0 < 𝜅 ≤ Ξ ≤ K)且 Lipschitz 连续。这是保证 ODE 解唯一性和稳定性的基本条件。 - Hölder 光滑性:真实系数
Ξ₀ ∈ ℋ^β([0, U], H),β > 1。这是获得非参数收敛速率的必要条件。 - 内部性条件 (3.2):
Ξ₀的值域与筛的边界[𝜅, K]保持一个正距离η₀。这是一个技术性假设,确保筛的“夹紧”操作不会影响逼近精度。 - Assumption 4.1 (势函数的增长):
m_V(s)至多以多项式速度增长(1+s)^α。这控制了低密度区域(r → 0)的测度行为,是端点自适应分析的基础。 - Assumption 6.4 (内部能量区间):对于目标区间
I,其对应的能量区间S_I是紧的且远离V的临界值。这保证了在I上,m_V有界且远离 0,从而可以建立从 KL 散度到系数 L² 损失的插值不等式。
相比已有文献:与 Belomestny & Orlova [2025] 相比,本文的假设更严格(需要 β > 1 和内部性条件),这是因为点态密度依赖的逆问题更不稳定。与 Della Maestra & Hoffmann [2022] 相比,本文不需要观测整个轨迹,但需要更强的光滑性假设来补偿信息量的减少。
主要结果¶
- Theorem 6.2 (密度速率):在给定假设下,筛 MLE
bΞ_n对应的平稳密度π_{bΞ_n}的 KL 散度满足:KL(π₀ || π_{bΞ_n}) = O_ℙ( (b_n log n / n)^{2(β+1)/(2β+3)} )其中b_n = O(1)(紧支撑情形)或b_n ≲ log n(非紧支撑情形)。这是通过平衡逼近误差m^{-2(β+1)}和随机误差m log n / n得到的,最优的m ≍ (n / (b_n log n))^{1/(2β+3)}。 - Theorem 6.7 (系数速率):在相同假设下,对于任意内部区间
I ⋐ (0, a₀),系数估计的 L² 损失满足:||bΞ_n - Ξ₀||_{L²(I)} = O_ℙ( (b_n log n / n)^{β/(2β+3)} )这个速率是通过将 Theorem 6.2 的 KL 散度速率代入插值不等式(Lemma A.4)得到的。 - Theorem 7.2 (Minimax 下界):对于系数类
𝔛^β(J),存在常数C_risk > 0,使得:inf_{bΞ_n} sup_{ξ ∈ 𝔛^β(J)} 𝔼_ξ ||bΞ_n - ξ||²_{L²(I)} ≥ C_risk n^{-2β/(2β+3)}这证明了 Theorem 6.7 中的速率(忽略对数因子)是 minimax 最优的。下界是通过 Assouad 引理构造的,其中关键的一步是 Lemma 7.1,它将相邻系数的 KL 散度与它们的原函数差G的 L² 范数联系起来。
证明路线与技术技巧¶
整体路线:
1. 降维与似然:利用 Proposition 3.4 将 d 维问题转化为一维能量 S = V(X) 的密度 q_Ξ(s) 的估计问题。似然函数 ℒ_n(ξ) 等价于基于 S_i 的似然。
2. 筛构造与逼近:构造一个稀疏 ReQU 神经网络筛 𝒳_m(公式 4.1-4.2)。关键 Lemma 4.2 证明,存在一个筛元素 ξ_m,它不仅在 L∞ 范数下以 m^{-β} 逼近 Ξ₀,更重要的是,它在前向范数 ||𝒜(ξ_m - Ξ₀)||_{L²(ν₀)} 下以 m^{-(β+1)} 逼近。这个“额外的一阶”逼近是通过在分级网格上构造满足矩消失条件(公式 4.6)的校正项实现的。
3. Oracle 不等式:Proposition 5.5 给出了一个关于 KL 散度的快速 Oracle 不等式。它通过截断(A_M)、离散化(ε-net)和局部化 KL-Bernstein 不等式(Lemma 5.1),将 MLE 的 KL 风险分解为逼近误差、随机复杂度和截断误差之和。
4. 正向速率:Proposition 6.1 证明,由 Lemma 4.2 构造的 ξ_m 对应的 KL 散度 KL(π₀ || π_{ξ_m}) 以 m^{-2(β+1)} 速率收敛。这验证了 Oracle 不等式中的逼近项。
5. 逆向速率:Theorem 6.7 利用插值不等式(Lemma A.4)将 KL 散度速率转化为系数 L² 损失速率。这个不等式依赖于 Ξ 的 Hölder 光滑性,是连接正向和逆向估计的桥梁。
6. Minimax 下界:Theorem 7.2 通过 Assouad 引理证明下界。构造一个由局部化 bump 函数组成的系数立方体,使得相邻系数的 L² 距离为 b^{β+1/2},而它们的 KL 散度为 b^{2β+3}。平衡这两个量得到最优带宽 b ≍ n^{-1/(2β+3)},从而得到下界 n^{-2β/(2β+3)}。
关键跳跃点:
* 从 L∞ 逼近到前向范数逼近:Lemma 4.2 的核心是,仅仅在 L∞ 下逼近 Ξ₀ 是不够的,因为前向映射 F 会放大误差。通过在分级网格上构造满足矩消失条件的校正项,作者实现了前向范数下的“超收敛”(super-convergence),即从 m^{-β} 提升到 m^{-(β+1)}。这是获得最优密度速率的关键。
* 从 KL 散度到系数 L² 损失的插值:Lemma A.4 是连接两个速率的桥梁。它利用 s'_ξ(r) = -1/(r ξ(r)) 这一关系,将系数差 ||ξ - Ξ₀||_{L²(I)} 与 s_ξ - s₀ 的导数联系起来。然后,通过一个标准的 Sobolev 插值不等式(Lemma A.3),将导数的 L² 范数用函数本身的 L² 范数(由 KL 散度控制)和其高阶光滑范数(有界)来控制。
技术技巧点名:
* ReQU 激活函数:σ(z) = (z⁺)²。选择它是因为其输出是二次的,便于构造满足矩消失条件的多项式校正项,且其导数(线性)在逆问题分析中需要用到。
* 端点自适应分级逼近:使用非均匀网格 r_{j,m} = U (j/m)^θ,其中 θ > (2β+2)/(2β+1)。这使得靠近 0 的网格单元非常小,从而控制了低密度区域(r → 0)的逼近误差,该区域的前向范数权重很大。
* 局部化 KL-Bernstein 不等式 (Lemma 5.1):这是获得 1/n 而非 1/√n 随机阶的关键。它利用似然比的有界性,将经验过程的波动与 KL 散度本身联系起来,从而在 Oracle 不等式中吸收掉波动项。
* Assouad 下界:用于证明 minimax 最优性。通过构造一个高维参数立方体,将多元估计问题分解为一系列二元假设检验问题,从而得到风险的下界。
真实例子与应用¶
- 数据/场景:模拟数据。考虑 Ornstein-Uhlenbeck 势
V(x) = 1 + ||x||²/2和三个不同的真实漂移系数Ξ₀:常数 (Ξ₀,₁=1)、分段二次型 (Ξ₀,₂) 和有理函数 (Ξ₀,₃)。样本从对应的平稳分布中通过拒绝采样生成。 - 方法应用:使用一个非常简单的 ReQU 网络(
q=1,即NN(2, (1,3,1), 10, 1))作为筛。通过最小化网格上的 ISE(积分平方误差)来选择网络复杂度q。然后,通过求解 ODE 和归一化条件来计算每个候选ξ对应的似然,并优化得到bΞ_n。 - 结果:
- 图 1 显示,对于
n=10000, d=2,估计的曲线与真实曲线非常接近,误差不超过 0.05。 - 表 1 显示,ISE 随样本量
n增加而快速下降,且随维度d增加而下降(这可能是由于高维下密度更集中,估计更容易)。 - 图 2 在对数坐标下展示了 ISE 随
n的变化。对于属于筛的Ξ₀,₁和Ξ₀,₂,误差衰减速率接近n⁻¹(参数速率),而对于不属于筛的Ξ₀,₃,衰减速率明显更慢,符合非参数速率的预期。
- 图 1 显示,对于
- 例子想说明什么:验证了所提出的筛 MLE 方法在实际中的可行性,并展示了当真实系数属于筛时(参数情形)和不属于筛时(非参数情形)不同的收敛行为。数值结果与理论预测(
Ξ₀,₁和Ξ₀,₂的n⁻¹速率,Ξ₀,₃的更慢速率)定性一致。
🔎 结论是否比证明窄¶
- 结论:Theorem 6.7 声称系数估计的 L² 损失达到
(b_n log n / n)^{β/(2β+3)}的速率。 - 证明的窄处:这个结论依赖于 Lemma A.4 中的插值不等式,而该不等式要求
Ξ₀和ξ都具有β阶 Hölder 光滑性,并且ξ的模a_ξ必须大于r⁺(即估计区间I的上界)。Theorem 6.7 的证明中,通过 Lemma A.5 保证了当 KL 散度足够小时,a_{bΞ_n}会足够接近a₀,从而满足条件。这意味着该结论是一个高概率事件,且需要样本量n足够大,使得 KL 散度低于某个阈值。作者没有给出这个阈值与n的具体关系,只是说“存在C_mode使得ℜ ≤ C_mode蕴含该不等式”。这是一个典型的“足够大n”的渐近论证,没有给出有限样本的显式保证。 - 泛化 claim:作者在摘要和引言中声称该速率是“minimax 最优的”。这个 claim 是准确的,因为 Theorem 7.2 的下界是在一个更窄的系数类
𝔛^β(J)上证明的,而 Theorem 6.7 的上界是在一个更宽的类上成立的。因此,上界和下界匹配,证明了最优性。然而,下界的构造依赖于一个特定的局部参数类,并未覆盖所有可能的β-Hölder 函数。这是 Assouad 下界的标准做法,但严格来说,它只证明了在该特定子类上的 minimax 下界,而非整个 Hölder 类。
四、开放问题¶
- 自适应选择筛大小
m:Theorem 6.2 的最优m依赖于未知的光滑性参数β。如何构造一个数据驱动的准则(如 Lepski 方法、交叉验证)来自适应地选择m,使得估计器在不事先知道β的情况下达到最优速率?扎根点:Theorem 6.2 的证明中m的选择依赖于β。 - 放宽对势函数
V的假设:本文假设V完全已知。如果V未知或仅部分已知(例如,包含未知参数),问题会如何变化?能否同时非参数地估计V和Ξ?扎根点:整个降维和似然框架都建立在V已知的基础上(Section 3)。 - 扩展到更一般的 Nemytskii 型依赖:本文的漂移形式为
-Ξ(p_t(X_t)) ∇V(X_t)。能否将方法推广到更一般的 Nemytskii 型漂移,例如b(x, p_t(x)),其中b对x和p的依赖都是非线性的?扎根点:引言中提到了 Nemytskii 型,但本文的模型是其中一种特殊形式。 - 计算效率与统计最优性的权衡:本文使用的 ReQU 网络筛在理论上达到了最优统计速率,但其数值优化(求解非凸的 MLE)的计算成本如何?是否存在计算上更高效(如凸优化)但统计上次优的方法?这直接关联到研究者的“统计-计算权衡”兴趣。扎根点:本文的数值实验使用了非常简单的网络(
q=1),对于更复杂的网络,优化可能变得困难。作者没有讨论计算复杂度。
Maintained by 陈星宇 · Homepage · Source on GitHub