跳转至

Gaussian Approximation for Two-Timescale Linear Stochastic Approximation

讲者: Vladimir Ulyanov
会场: Recent Advances in Network Analysis
报告题目: Non-Asymptotic Gaussian Approximation for Two-Timescale Stochastic Approximation
链接: arXiv
来源: JCSDS 2026 · 返回会议总览


一、领域脉络与小综述

这个方向是什么

双时间尺度随机逼近(Two-Timescale Stochastic Approximation, TTSA)是一类更新两个相互依赖变量的迭代算法,其中一个变量(快尺度)的步长衰减比另一个(慢尺度)更快。这类算法在强化学习的离策略策略评估中至关重要,例如GTD和TDC方法。该子方向要解决的根本问题是:如何量化TTSA估计量的正态逼近精度(即Berry-Esseen型界),从而为构造置信区间等统计推断提供非渐近保证。当前成熟度:渐近正态性(CLT)已建立(Konda & Tsitsiklis 2004; Mokkadem et al. 2006),但非渐近速率直到近年才被研究,且主要集中在平均迭代和Wasserstein距离(Kong et al. 2025)。本文进一步在更精细的凸距离下给出速率,并首次处理最后迭代和马尔可夫噪声。

发展脉络(history)

  • 奠基工作:Borkar (1997) 提出TTSA框架并证明几乎必然收敛。Konda & Tsitsiklis (2004) 给出线性TTSA的渐近收敛率(\(E[\|\theta_k-\theta^*\|^2]=O(\beta_k)\))和渐近正态性(\(\beta_k^{-1/2}(\theta_k-\theta^*) \xrightarrow{d} N(0,\Sigma_\theta)\))。这是后续所有工作的基础。

  • 主要进展:Mokkadem et al. (2006) 将CLT推广到非线性TTSA,并引入Polyak-Ruppert平均,证明平均迭代也渐近正态且达到最优\(\sqrt{n}\)速率。非渐近误差界方面:Dalal et al. (2018, 2020) 首次给出有限时间界(带投影),Kaledin et al. (2020) 改进了线性TTSA的MSE界(\(E[\|\theta_k-\theta^*\|^2] \approx \beta_k \text{Tr}\Sigma_\theta\)),并处理了马尔可夫噪声。Kwon et al. (2024) 研究常数步长下的收敛到平衡分布。Doan (2024) 在强单调非线性TTSA下得到\(O(1/k)\)的MSE率。

  • 当前frontier:非渐近CLT/正态逼近。Kong et al. (2025) 首次给出平均迭代在Wasserstein-1距离下的非渐近CLT,速率为\(n^{-1/4}\)(对应凸距离\(n^{-1/8}\))。Samsonov et al. (2024) 对单时间尺度LSA给出凸距离\(n^{-1/4}\)。本文在此基础上,首次对TTSA最后迭代给出非渐近正态逼近速率,并首次处理马尔可夫噪声下的TTSA正态逼近,且凸距离速率提升至\(n^{-1/4}\)(鞅差)和\(n^{-1/6}\)(马尔可夫)。

  • 本文的位置:本文是Kong et al. (2025) 的直接推广和补充:将Wasserstein距离改进为凸距离(更精细),从平均迭代扩展到最后迭代,从鞅差噪声扩展到马尔可夫噪声。同时,本文也借鉴了单时间尺度LSA的非渐近CLT技术(Mou et al. 2020; Samsonov et al. 2024; Wu et al. 2025)。

子线索聚类

  1. 渐近理论:Konda & Tsitsiklis (2004)(线性TTSA渐近CLT)、Mokkadem et al. (2006)(非线性TTSA渐近CLT及平均)、Hu et al. (2024)(马尔可夫噪声下渐近CLT)。这些工作建立了极限分布,但不提供收敛速率。

  2. 非渐近误差界(MSE/高概率):Dalal et al. (2018, 2020)(首次有限时间界,带投影)、Kaledin et al. (2020)(线性TTSA的MSE界,鞅差和马尔可夫)、Haque et al. (2023)(改进MSE界,与渐近协方差匹配)、Kwon et al. (2024)(常数步长下的几何收敛)、Doan (2024)(非线性TTSA的\(O(1/k)\) MSE)。这些工作关注估计误差的矩或概率界,但不涉及分布逼近。

  3. 非渐近正态逼近(CLT速率):Kong et al. (2025)(平均迭代,Wasserstein距离,鞅差)、本文(平均迭代和最后迭代,凸距离,鞅差和马尔可夫)。此外,单时间尺度LSA的正态逼近工作(Mou et al. 2020; Samsonov et al. 2024; Wu et al. 2025)提供了关键技术工具。

核心问题与已知瓶颈

  • 核心问题:① TTSA估计量的分布与高斯分布之间的非渐近距离(凸距离)以多快的速率收敛?② 时间尺度分离(步长指数\(a<b\))如何影响这个速率?③ 当噪声是马尔可夫链(而非鞅差)时,速率是否退化?

  • 已知瓶颈:在本文之前,最后迭代的正态逼近速率完全未知;马尔可夫噪声下的TTSA正态逼近也未知。平均迭代在Wasserstein距离下的速率(Kong et al. 2025)为\(n^{-1/4}\),但通过Lemma 1转化为凸距离时降为\(n^{-1/8}\),而单时间尺度LSA在凸距离下可达\(n^{-1/4}\)(Samsonov et al. 2024),因此存在改进空间。

⚠️ 作者的framing

作者将缺口frame为“首次对最后迭代和马尔可夫噪声给出非渐近正态逼近速率”,并强调凸距离比Wasserstein距离更精细。他们声称自己的凸距离界(\(n^{-1/4}\))优于Kong et al. (2025) 的Wasserstein界转化后的凸距离界(\(n^{-1/8}\))。但注意,这种比较依赖于Lemma 1的转换(凸距离 ≤ 常数 × Wasserstein距离的平方根),而Kong et al. (2025) 的Wasserstein界可能本身更紧,且凸距离和Wasserstein距离是不同度量,直接比较需谨慎。作者淡化了常数步长设定(Kwon et al. 2024)和完全非线性TTSA(Doan 2024)的竞争路线。明显该被引但未出现在intro中的工作:例如,关于单时间尺度SA的Berry-Esseen界(如Chen & Shao 2007; Shao & Zhang 2022)被引用,但关于高维Berry-Esseen的Bentkus (2003) 和Kojevnikov & Song (2022) 仅在讨论维度依赖时提及,未作为主要工具。此外,关于马尔可夫链的CLT速率(如Srikant 2024)被用于线性部分,但本文的马尔可夫噪声处理主要依赖Poisson方程和Kaledin et al. (2020) 的分解,而非直接使用Srikant (2024) 的结果。

张力

未见明显对立引用。但注意,Kong et al. (2025) 和本文都研究平均迭代,但距离度量不同,结论不完全可比。本文声称凸距离速率更快,但未讨论Wasserstein距离下的速率是否也能改进。


二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据交代清楚

  • 符号
  • \(\theta_k \in \mathbb{R}^{d_\theta}\):慢时间尺度参数(主估计量)。
  • \(w_k \in \mathbb{R}^{d_w}\):快时间尺度参数(辅助变量)。
  • \(\beta_k, \gamma_k\):步长,\(\beta_k = c_{0,\beta}(k+k_0)^{-b}, \gamma_k = c_{0,\gamma}(k+k_0)^{-a}\),其中 \(1/2 < a < b < 1\)(快尺度步长\(\gamma_k\)衰减更慢?注意:\(a<b\),所以\(\gamma_k\)衰减更快?实际上\(\gamma_k \sim k^{-a}, \beta_k \sim k^{-b}\),由于\(a<b\)\(\gamma_k\)衰减更慢?例如\(a=0.6, b=0.8\),则\(\gamma_k \sim k^{-0.6}, \beta_k \sim k^{-0.8}\),所以\(\gamma_k\)更大,即快尺度步长更大,更新更快。符合直觉:快尺度步长大,收敛快。
  • \(A_{ij} \in \mathbb{R}^{d_\theta \times d_\theta}\)\(i,j=1,2\)),\(b_i \in \mathbb{R}^{d_\theta}\):未知的系统矩阵和向量。
  • \(A_{ij}(x), b_i(x)\):观测到的随机估计,满足\(E[A_{ij}(X_k)] = A_{ij}, E[b_i(X_k)] = b_i\)
  • \(\varepsilon_k^V, \varepsilon_k^W\):噪声项,定义见(9),是鞅差。
  • \(V_k, W_k\):组合噪声,定义见(8),包含\(\varepsilon\)和随机矩阵偏差。
  • \(\theta^*, w^*\):线性系统(1)的唯一解。
  • \(\Delta = A_{11} - A_{12}A_{22}^{-1}A_{21}\):Schur补。
  • \(\Sigma_\varepsilon\):渐近协方差矩阵,定义见(20)。
  • \(\rho_{\text{Conv}}(\mu, \nu)\):凸距离,\(\sup_{B \in \text{Conv}(\mathbb{R}^d)} |\mu(B) - \nu(B)|\)

  • 模型:数据生成机制为线性系统(1),但矩阵和向量未知。观测到随机变量序列\(\{X_k\}\),通过函数\(A_{ij}(X_k), b_i(X_k)\)得到随机估计。噪声假设为鞅差(A1)或马尔可夫(B1)。关键结构假设:\(-A_{22}\)\(-\Delta\)是Hurwitz矩阵(特征值负实部),保证递归的稳定性。

  • 可观测数据:研究者实际能观测到的是\(\{X_k\}\)以及由此计算的\(A_{ij}(X_k), b_i(X_k)\)不可观测的是真实矩阵\(A_{ij}, b_i\),以及噪声的分布和矩。想要但观测不到的是解\((\theta^*, w^*)\),以及估计量的分布。识别依赖于假设A1-A6或B1-B3。

第二步:最小内核

考虑最简单的特例:\(d_\theta = d_w = 1\)(一维),且噪声为i.i.d.高斯,步长指数\(a=0.6, b=0.8\)。此时,TTSA更新为标量形式。核心思路是:将估计误差\(\theta_k - \theta^*\)分解为一个线性统计量(鞅差和)加上一个可忽略的余项,然后利用鞅的Berry-Esseen界控制线性部分的凸距离,再用矩界控制余项。

具体步骤

  1. 解耦变换(Proposition 2):定义\(\tilde{\theta}_k = \theta_k - \theta^*\)\(\tilde{w}_k = w_k - w^* + D_{k-1}\tilde{\theta}_k\),其中\(D_k\)是某个有界矩阵序列。变换后,递归变为:

    \[\tilde{\theta}_{k+1} = (I - \beta_k B_{11}^k)\tilde{\theta}_k - \beta_k A_{12}\tilde{w}_k - \beta_k V_{k+1},\]
    \[\tilde{w}_{k+1} = (I - \gamma_k B_{22}^k)\tilde{w}_k - \beta_k D_k V_{k+1} - \gamma_k W_{k+1}.\]
    关键:\(\tilde{w}_{k+1}\)的更新不再直接依赖\(\tilde{\theta}_k\),实现了“解耦”。

  2. 高阶矩界(Proposition 3):利用Burkholder不等式和递归,证明对任意\(p \ge 2\)

    \[E^{1/p}[\|\tilde{\theta}_{k+1}\|^p] \lesssim \prod_{j=0}^k (1 - \beta_j a_\Delta/8) + p^2 \beta_k^{1/2},\]
    \[E^{1/p}[\|\tilde{w}_{k+1}\|^p] \lesssim \prod_{j=0}^k (1 - \gamma_j a_{22}/8) + p^3 \gamma_k^{1/2}.\]
    这意味着误差的\(p\)阶矩以步长的平方根速率衰减,且初始误差指数衰减。

  3. 平均迭代的分解(Lemma 9):利用恒等式(18),

    \[\Delta(\theta_k - \theta^*) = \beta_k^{-1}(\theta_k - \theta_{k+1}) - \gamma_k^{-1} A_{12}A_{22}^{-1}(w_k - w_{k+1}) + (V_{k+1} - A_{12}A_{22}^{-1}W_{k+1}).\]
    \(k=1\)\(n\)求和,得到
    \[\sqrt{n}\Delta(\bar{\theta}_n - \theta^*) = \frac{1}{\sqrt{n}} \sum_{k=1}^n \psi_{k+1} + R_n^{\text{pr}},\]
    其中\(\psi_{k+1} = \varepsilon_{k+1}^V - A_{12}A_{22}^{-1}\varepsilon_{k+1}^W\)是鞅差,\(R_n^{\text{pr}}\)是余项(包含望远镜和与高阶项)。

  4. 凸距离控制(Proposition 1):对任意\(p \ge 1\)

    \[\rho_{\text{Conv}}(W+D, N(0,I)) \le \rho_{\text{Conv}}(W, N(0,I)) + 2 c_d^{p/(p+1)} E^{1/(p+1)}[\|D\|^p].\]
    这里\(W = \frac{1}{\sqrt{n}}\sum \psi_{k+1}\)(线性部分),\(D = \Sigma_\varepsilon^{-1/2} R_n^{\text{pr}}\)(余项)。

  5. 线性部分的凸距离:由于\(\psi_{k+1}\)有界鞅差(A6保证),且条件协方差恒定(A3),应用Wu et al. (2025)的鞅CLT(Lemma 2)得到

    \[\rho_{\text{Conv}}\left(\frac{1}{\sqrt{n}}\sum \psi_{k+1}, N(0,\Sigma_\varepsilon)\right) \lesssim \frac{\sqrt{d_\theta} \log n}{n^{1/4}}.\]

  6. 余项矩界:利用高阶矩界(Proposition 3)和Lemmas 10-12,证明对\(p = \log n\)

    \[E^{1/p}[\|R_n^{\text{pr}}\|^p] \lesssim \frac{\log^4 n}{n^{a/2}} + \frac{\log^4 n}{n^{(1-b)/2}}.\]
    代入Proposition 1,取\(p = \log n\),得到最终凸距离界。

核心数学困难:解耦变换后,\(\tilde{w}_k\)的矩界依赖于\(\tilde{\theta}_k\)的矩,需要联合递归;余项\(R_n^{\text{pr}}\)包含多个复杂项(如\(Y_1, Y_2, Y_3\)),需要精细的矩估计。关键想法:利用Burkholder不等式处理鞅差,利用步长衰减性质控制乘积和。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:线性双时间尺度随机逼近(TTSA)在鞅差和马尔可夫噪声下,Polyak-Ruppert平均迭代和最后迭代的正态逼近速率(凸距离)。
  2. 核心工具/方法:解耦变换(高斯消元)、高阶矩界(Burkholder不等式)、鞅CLT(Wu et al. 2025)、Poisson方程(处理马尔可夫噪声)、Proposition 1(将非线性统计量的凸距离分解为线性部分+余项矩)。
  3. 主要结论:在鞅差噪声下,平均迭代和最后迭代均达到\(n^{-1/4}\)(对数因子)的凸距离速率;在马尔可夫噪声下,达到\(n^{-1/6}\)速率。时间尺度分离对平均迭代不利(需要步长指数接近),对最后迭代有利(需要分离)。

关键设定与假设

  • A1-A6(鞅差噪声)
  • A1:\(V_{k+1}, W_{k+1}\)是鞅差。
  • A2(p):\(p\)阶矩有界,且与\(\theta_k, w_k\)的矩线性相关。
  • A3:\(\varepsilon_k^V, \varepsilon_k^W\)的条件协方差恒定(常数矩阵\(\Sigma_V, \Sigma_W, \Sigma_{VW}\))。相比Kong et al. (2025) 放宽:他们要求整个\(V_{k+1}, W_{k+1}\)的条件协方差恒定,而本文只要求\(\varepsilon\)部分恒定。
  • A4:\(-A_{22}\)\(-\Delta\)是Hurwitz(保证Lyapunov方程有解,从而矩阵乘积收缩)。
  • A5(p):步长形式为\(\beta_k = c_{0,\beta}(k+k_0)^{-b}, \gamma_k = c_{0,\gamma}(k+k_0)^{-a}\)\(1/2<a<b<1\),且\(c_{0,\beta}/c_{0,\gamma}\)足够小,\(k_0\)足够大(依赖于\(p^4/b\))。注意\(k_0\)依赖于总迭代次数\(n\)(因为\(p=\log n\)),这是单时间尺度SA中也出现的现象。
  • A6:\(A_{ij}(x), b_i(x)\)一致有界。

  • B1-B3(马尔可夫噪声)

  • B1:\(\{X_k\}\)是均匀几何遍历的马尔可夫链,混合时间\(t_{\text{mix}}\)有限,且平稳分布下\(E_\pi[A_{ij}^k] = A_{ij}, E_\pi[b_i^k] = b_i\)
  • B2(p):类似A5(p),但常数\(C_{B2}\)不同。
  • B3:额外条件\(2b > 1+a\),且\(n^b\)足够大。这个条件用于控制最后迭代余项中的某些项。

主要结果

  • Theorem 1(平均迭代,鞅差)

    \[\rho_{\text{Conv}}\left(\sqrt{n}\Delta(\bar{\theta}_n - \theta^*), N(0,\Sigma_\varepsilon)\right) \lesssim_{\log n} \frac{1}{n^{a/2}} + \frac{1}{n^{(1-b)/2}}.\]
    优化选择\(a = 1/2 + 1/\log n, b = a + 1/\log n\),得到\(n^{-1/4}\)(对数因子)。改进:Kong et al. (2025) 的Wasserstein距离\(n^{-1/4}\)对应凸距离\(n^{-1/8}\),本文直接得到凸距离\(n^{-1/4}\)

  • Theorem 2(最后迭代,鞅差)

    \[\rho_{\text{Conv}}\left(\beta_n^{-1/2}\tilde{\theta}_{n+1}, N(0,\Sigma_\infty^{\text{last}})\right) \lesssim_{\log n} n^{b/2} \prod_{j=0}^n (1 - \frac{a_\Delta}{8}\beta_j) + \frac{1}{n^{(3b-a-2)/2}}.\]
    优化选择\(a = 1/2 + 1/\log n, b = 1 - 1/\log n\),得到\(n^{-1/4}\)首次对TTSA最后迭代给出非渐近正态逼近速率。

  • Theorem 3(平均迭代,马尔可夫)

    \[\rho_{\text{Conv}}\left(\sqrt{n}\Delta(\bar{\theta}_n - \theta^*), N(0,\Sigma_\infty^{\text{mark}})\right) \lesssim_{\log n} \frac{1}{n^{1/4}} + \frac{1}{n^{(1-b)/2}} + \frac{1}{n^{a-1/2}} + \sqrt{n} \prod_{j=0}^{n-1} (1 - \frac{a_\Delta}{16}\beta_j).\]
    优化选择\(a = 2/3, b = 2/3 + 1/\log n\),得到\(n^{-1/6}\)首次对TTSA在马尔可夫噪声下给出正态逼近速率。

  • Theorem 4(最后迭代,马尔可夫)

    \[\rho_{\text{Conv}}\left(\beta_n^{-1/2}\tilde{\theta}_{n+1}, N(0,\Sigma_\infty^{\text{last,mark}})\right) \lesssim_{\log n} n^{b/2} \prod_{j=0}^n (1 - \frac{a_\Delta}{8}\beta_j) + \frac{1}{n^{b/2 - 1/4}} + \frac{1}{n^{a - b/2}} + \frac{1}{n^{(3b-a-2)/2}}.\]
    优化选择\(a = 2/3, b = 1 - 1/\log n\),得到\(n^{-1/6}\)

证明路线与技术技巧

整体路线(以鞅差平均迭代为例):

  1. 解耦:通过Proposition 2将TTSA转化为两个单时间尺度递归(13),使得\(\tilde{w}_{k+1}\)不直接依赖\(\tilde{\theta}_k\)
  2. 高阶矩界:利用Burkholder不等式和递归,证明Proposition 3(\(p\)阶矩界)。关键:控制矩阵乘积的收缩(Lemma 7)和噪声矩的线性增长(Lemma 5)。
  3. 误差分解:利用恒等式(18)将\(\sqrt{n}\Delta(\bar{\theta}_n - \theta^*)\)分解为线性统计量\(\frac{1}{\sqrt{n}}\sum \psi_{k+1}\)和余项\(R_n^{\text{pr}}\)(Lemma 9)。
  4. 线性部分凸距离:应用Wu et al. (2025)的鞅CLT(Lemma 2),需要验证\(\psi_{k+1}\)是有界鞅差且条件协方差恒定(A3, A6)。
  5. 余项矩界:将\(R_n^{\text{pr}}\)拆分为\(Y_1, Y_2, Y_3\),分别用高阶矩界和步长性质控制(Lemmas 10-12)。例如,\(Y_1 = \frac{1}{\sqrt{n}}\sum \beta_k^{-1}(\theta_k - \theta_{k+1})\)通过望远镜和转化为\(\tilde{\theta}_k\)的加权和,再用Proposition 3。
  6. 组合:代入Proposition 1,取\(p = \log n\),得到最终界。

关键跳跃点: - 解耦变换的有效性:需要证明\(L_k\)递归有界(Lemma 4),且\(B_{11}^k, B_{22}^k\)的收缩性质(Lemma 7)。这依赖于\(c_{0,\beta}/c_{0,\gamma}\)足够小。 - 高阶矩界的递归:Proposition 5和6的证明中,需要同时处理\(\tilde{\theta}\)\(\tilde{w}\)的耦合,通过构造上界序列\(U_k\)并解递归不等式。 - 马尔可夫噪声的处理:通过Poisson方程将噪声分解为鞅差部分和“平滑”部分(Section E.1),然后分别控制。平滑部分通过求和分部技巧(Lemma 21)转化为可处理的项。 - 最后迭代的协方差估计:需要证明\(\beta_n^{-1}\Sigma_n^{\text{last}}\)收敛到\(\Sigma_\infty^{\text{last}}\),且收敛速率为\(n^{-b}\)(Proposition 9),这通过解Riccati方程实现。

技术技巧点名: - Burkholder不等式(Osekowski 2012, Theorem 8.6):用于控制鞅差和的\(p\)阶矩(Proposition 5, 6等)。 - Lyapunov方程(Lemma 6):用于得到矩阵乘积的收缩率(10)。 - Poisson方程(Douc et al. 2018, Chapter 21):将马尔可夫链的依赖转化为鞅差(Section E.1)。 - 矩阵浓度不等式(Lemma 29, Paulin 2015):用于马尔可夫噪声下线性统计量的凸距离控制(Lemma 3的假设(34))。 - 求和分部技巧(Lemma 21):用于处理马尔可夫噪声中的平滑部分。 - Riccati方程(Proposition 9):用于计算最后迭代的渐近协方差。

真实例子与应用

Section 5 将理论结果应用于GTD和TDC算法。具体地: - 数据/场景:折扣MDP,线性函数逼近,特征映射\(\phi(s)\)满足\(\sup_s \|\phi(s)\| \le 1\)。数据生成方式有两种:i.i.d.从平稳分布采样(TD1)或马尔可夫轨迹(TD3)。 - 方法应用:验证GTD(0)和TDC的更新规则可以写成线性TTSA形式(6)-(7),并检查假设A1-A6和B1是否满足。例如,对于GTD,\(A_{22}=I\)显然是Hurwitz;\(\Delta = E[(\phi_k - \lambda\phi_{k+1})\phi_k^\top] E[\phi_k(\phi_k - \lambda\phi_{k+1})^\top]\)正定,因此\(-\Delta\)也是Hurwitz。 - 结果:所有定理直接适用于这些算法,从而给出正态逼近速率。 - 说明:这个例子旨在展示理论的应用范围,而非数值验证。本文为纯理论,无实证例子

🔎 结论是否比证明窄

  • Theorem 1的讨论(Section 3.2末尾):“the result in its current form does not apply directly if \(b=1\)”。作者预期成立但未证明。
  • Theorem 2的A7条件\(2b > 1+a\)。这个条件在证明中用于控制某些项(如Lemma 14中的求和),但可能不是必要的。作者未讨论能否放松。
  • 马尔可夫噪声下的速率\(n^{-1/6}\)可能不是最优。作者没有给出下界,且步长选择\(a=2/3\)是人为的。单时间尺度SA在马尔可夫噪声下可达\(n^{-1/4}\)(Samsonov et al. 2025),因此TTSA的\(n^{-1/6}\)可能可以改进。
  • Proposition 3的p依赖:作者提到使用Pinelis Rosenthal不等式可能改进,但未实现。当前证明中\(p^2\)\(p^3\)的依赖导致最终对数因子较高。

四、开放问题

  1. 构造下界:Theorem 1-4的速率是否紧?作者在Conclusion中明确提到“construction of lower bounds to ensure tightness of the rates”。扎根于论文最后一段:“Another important direction is the construction of lower bounds to ensure tightness of the rates obtained in Theorem 1-4.”

  2. 置信区间构造:基于bootstrap或渐近协方差估计,进行完全非渐近分析。扎根于Conclusion:“A natural further research direction is to consider the problem of constructing confidence intervals for the TTSA solution \((\theta^*, w^*)\) based on bootstrap approach or asymptotic covariance matrix estimation, and perform a fully non-asymptotic analysis of the suggested procedure.”

  3. 改进p依赖:Proposition 3中矩界对\(p\)的依赖(\(p^2, p^3\))可能通过Pinelis Rosenthal不等式改进,从而降低最终对数因子。扎根于Proposition 3后的讨论:“We expect that the dependence of the r.h.s. of (16) and (17) upon p can be improved based on applying the Pinelis version of Rosenthal inequality...”。

  4. 非线性TTSA:本文仅考虑线性TTSA。将正态逼近结果推广到非线性TTSA(如Doan 2024中的强单调设定)是一个自然方向。虽然本文未明确提及,但这是TTSA文献的常见扩展路径。

  5. 常数步长设定:Kwon et al. (2024) 研究了常数步长TTSA的收敛性,但未涉及CLT。常数步长下的正态逼近(可能涉及平衡分布而非点估计)是开放问题。本文仅考虑衰减步长。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论