跳转至

NestyNet. III. Symbolic Regression from Analytic Neural Surrogates

作者: Rodrigo Ibata, Wassim Tenachi, Foivos Diakogiannis, Neil Ibata, Anirudh Shankar
主题: 天体统计
相关性: 6/10
链接: https://arxiv.org/abs/2608.21051


一、子领域定位

  • 本文属于天文学的哪一支:天文数据分析方法(Astrostatistics / Astroinformatics),具体是符号回归(Symbolic Regression) 这一子领域。符号回归的目标是从数据中自动发现封闭形式的数学表达式(物理定律),而不预先假设模型形式(如线性、多项式)。该子领域处于天文学、机器学习和应用数学的交叉点,成熟度中等——已有多种方法(遗传编程、强化学习、神经网络引导),但精确恢复复杂多变量物理定律仍是一个开放挑战。
  • 本文在这个子领域里的位置:它针对的核心问题是如何可靠地从带噪声的、多变量的天文数据中自动发现可解释的物理定律。本文的独特切片是:利用高精度神经代理模型(NestyNet)的解析导数来检测函数的可分离性(additive/multiplicative/compound separability),从而将多变量问题递归分解为低维子问题;并引入一种新颖的因子化符号搜索(Factorized Symbolic Search, FSS),将结构发现与参数校准分离,大幅降低组合搜索的复杂度。

二、关键术语扫盲

  1. 符号回归 (Symbolic Regression, SR):一种机器学习任务,目标是找到一个数学表达式(由基本运算如加减乘除、幂、三角函数、指数等组合而成)来拟合数据。不同于传统回归(如线性回归)固定模型形式,SR 搜索整个表达式空间。
  2. 神经代理模型 (Neural Surrogate):一个训练好的神经网络,用来近似一个未知函数。本文中,这个代理模型(NestyNet)不仅输出函数值,还能精确计算一阶和二阶导数(解析导数),这是后续结构发现的关键。
  3. 可分离性 (Separability):一个多变量函数可以分解为几个低维函数的组合。例如,加法可分离 f(x,y) = g(x) + h(y),乘法可分离 f(x,y) = g(x) * h(y)。发现这种结构能将复杂问题简化。
  4. 复合坐标 (Compound Coordinate):由原始输入变量组合而成的新变量,例如 z = x1 * x2 或 z = x1^2 + x2^2。物理定律往往在正确的复合坐标下变得简单(例如,在 z = x1^2 + x2^2 下,f = sqrt(z) 比 f = sqrt(x1^2 + x2^2) 更简单)。
  5. 抽象语法树 (Abstract Syntax Tree, AST):一种树形数据结构,用于表示数学表达式。每个内部节点是一个运算符(如 +, *, sin),叶子节点是变量或常数。SR 算法通常在这个树空间中进行搜索。
  6. 因子化符号搜索 (Factorized Symbolic Search, FSS):本文的核心方法创新。它将搜索分解为两步:先搜索一个无常数的骨架(skeleton)(即复合坐标的结构),然后通过拟合一个校准映射(calibrated outer map)(如多项式、正弦、指数)来评估这个骨架的好坏。这样,常数(如振幅、频率)不需要通过离散搜索来发现,而是通过连续优化来拟合。
  7. 量纲分析 (Dimensional Analysis):利用物理量的单位(如长度 L、时间 T、质量 M)来约束搜索空间。只有量纲一致的表达式才是物理上合理的。本文实现了局部和全局("Buckingham–Sudoku")的量纲一致性检查,能提前剪枝掉大量无效候选。
  8. 广义对称性层 (Generalized Symmetry Layer, GS):通过求解一个线性方程(确定方程)来发现目标函数隐藏的对称性(如缩放、平移、旋转)。这些对称性直接揭示了正确的复合坐标,可以绕过组合搜索。
  9. SPARC 巡天 (SPARC survey):一个公开的星系旋转曲线数据库,提供了星系中气体和恒星的分布以及观测到的旋转速度。本文用它作为真实数据案例,来验证算法能否自动发现重子加速坐标(baryonic acceleration coordinate)。
  10. 径向加速度关系 (Radial Acceleration Relation, RAR):星系动力学中的一个经验关系,描述了观测到的向心加速度(g_obs)与由可见物质(重子物质)产生的预期加速度(g_bar)之间的关系。本文的 SPARC 案例就是盲恢复这个关系。
  11. 重子加速坐标 (Baryonic Acceleration Coordinate):一个复合坐标,由气体和恒星盘对旋转曲线的贡献按一定比例(质量-光度比)相加而成。发现这个坐标是理解 RAR 的关键一步。
  12. Levenberg–Marquardt (LM) 求解器:一种用于非线性最小二乘问题的优化算法。本文用它来拟合候选表达式中的常数参数,因为它对中等规模的参数优化问题非常有效。

三、天文学家关心的问题

天文学家面临一个根本性问题:如何从海量、高维、带噪声的观测数据中,自动发现简洁、可解释、可预测的物理定律?传统的做法依赖科学家的直觉和手动推导,但面对日益复杂的数据(如星系动力学、引力波信号、系外行星大气),这种方法越来越力不从心。符号回归(SR)提供了一个自动化的替代方案,但面临组合爆炸的挑战——候选表达式的数量随变量和运算符数量指数增长。

当前领域的主流方法包括: - 遗传编程(GP):如 PySR (Cranmer 2023),通过变异和交叉进化表达式树。局限:搜索效率低,常数优化与结构搜索耦合。 - 强化学习(RL):如 PhySO (Tenachi et al. 2023),将表达式生成视为序列决策问题。局限:需要大量训练,对复杂结构泛化能力有限。 - AI Feynman 方法 (Udrescu & Tegmark 2020):通过检测对称性和可分离性来递归分解问题。局限:依赖数值导数,精度不足时容易误判。

本文相对这些工作的贡献: 1. 解决了导数精度问题:利用 NestyNet 代理模型提供的高精度解析导数,使 AI Feynman 风格的可分离性检测变得可靠(此前因数值导数误差大而不可靠)。 2. 提出了因子化搜索(FSS):将结构搜索与参数校准分离,这是对 GP 和 RL 方法中“结构-参数耦合”问题的直接改进。常数通过拟合而非搜索得到,大幅缩小了离散搜索空间。 3. 引入了广义对称性层:能从梯度几何中直接发现复合坐标,绕过了组合搜索,能处理 AI Feynman 原始方法无法处理的非整数系数坐标。

四、数据问题(统计学家最该关注的部分)

  • 数据来源:本文主要使用两个数据源:
    1. AI Feynman 基准:120 个人工生成的数学方程,每个方程在给定域内均匀采样 2000 个训练点和 2000 个验证点。这是合成数据,用于方法验证。
    2. SPARC 巡天:48 个星系的旋转曲线数据(945 个数据点),提供每个半径处的气体贡献(g_gas)、恒星盘贡献(g_disk)和观测到的向心加速度(g_obs)。这是真实天文数据。
  • 数据形态:表格数据(catalogue)。每个样本点是一个向量 (x1, ..., xn, y)。在 AI Feynman 中,n 从 1 到 7+;在 SPARC 中,n=2(g_gas, g_disk),y = g_obs。
  • 几何结构:欧几里得空间 R^n。没有特殊的流形或球面几何结构。
  • 噪声模型 & 测量误差:
    • AI Feynman 基准:人为添加独立同分布的高斯噪声,信噪比从无噪声到 10%。
    • SPARC 数据:测量误差来自距离、倾角、旋转速度的观测不确定性。本文通过将距离和倾角作为自由参数(带高斯先验)来部分处理这些误差。
  • 系统性偏倚:
    • 选择效应:SPARC 样本并非随机,而是选择了动力学规则、质量高的星系(Q < 3, e_V/V < 0.1, 无核球等)。这是非随机抽样,结论的泛化性受限于此。
    • Malmquist 偏倚:未明确讨论,但 SPARC 样本偏向亮星系,可能存在。
  • 缺失 / 删失 / 截断:每个星系有不同数量的径向测量点(至少 8 个),但每个点都是完整的(无缺失值)。没有截断或删失。
  • 哪些是“漂亮的统计学问题”,哪些是“纯工程难题”:
    • 漂亮的统计学问题:
      1. 高维组合搜索的统计-计算权衡:符号回归的 NP-hard 性质本身就是一个统计-计算权衡问题。本文的 FSS 和 GS 层可以看作是在特定结构假设(可分离性、对称性)下,将计算复杂度从指数级降低到多项式级的策略。
      2. 模型选择与不确定性量化:在 SPARC 案例中,多个候选外律(RAR 插值函数、幂律等)在统计上不可区分。本文的“统计选择”(§7.5)和“姐妹模型”(sister model)后验提供了处理这种模型不确定性的框架,这直接对应统计学的模型平均/选择问题。
      3. 多数据集联合推断:SPARC 案例中,多个星系共享一个物理定律但有个体参数(质量-光度比)。这类似于统计学中的分层模型(hierarchical model) 或元分析(meta-analysis),需要处理组内相关性和组间异质性。
    • 纯工程难题:
      1. 神经代理模型的训练:NestyNet 的架构和训练策略(分段线性、LM 优化)是高度工程化的,对统计学家来说主要是黑箱。
      2. AST 的表示与操作:表达式树的生成、简化、量纲检查的工程实现,是计算问题而非统计问题。
      3. 搜索算法的调度:Phase 1 枚举、Phase 2 UCB 突变、重写规则的优先级调度,这些是算法工程,其统计性质(如 UCB 的探索-利用平衡)虽然有趣,但并非本文的核心统计贡献。

五、模型问题(统计学家最该关注的部分)

  • 文章建立的模型/方法重述:本文构建了一个两阶段流水线:
    • Stage A(结构发现):训练一个 NestyNet 代理模型 f_hat(x)。利用其解析导数,检测 f_hat 是否可分解(加法、乘法、复合坐标)。递归应用,直到每个分支变成一个低维(最好是单变量)的“神经原子”。
    • Stage B(符号闭合):将 Stage A 得到的神经原子转化为封闭形式的数学表达式。优先使用快速的重写规则(如检测到单变量是幂律、正弦等)。对于顽固的原子,升级到因子化符号搜索(FSS)。FSS 的核心是:搜索一个无常数的骨架 s(x),然后评估 s(x) 是否能通过一个简单的校准映射(如 a*sin(b*s + c))很好地拟合目标 y。常数 a, b, c 通过连续优化(LM)得到,而不是通过离散搜索。
  • 模型的关键假设:
    1. 物理定律是简单的:在正确的表示(复合坐标)下,物理定律是低维、可分离的。这是整个方法的哲学基础。
    2. 可分离性是普遍存在的:大多数物理定律可以分解为加法、乘法或复合坐标的形式。这个假设在物理学中很常见,但并非总是成立。
    3. 神经代理模型足够精确:NestyNet 的解析导数精度是 Stage A 成功的关键。如果代理模型不准确,所有下游的结构检测都会失败。
    4. 量纲一致性:物理定律必须量纲一致。这是一个很强的、物理上合理的约束,用于剪枝搜索空间。
  • 推断手段:
    • 点估计:LM 求解器用于拟合候选表达式中的常数参数。
    • 模型选择:通过启发式规则(§7.4)或统计选择(§7.5,基于 bootstrap 的置信 Pareto 前沿)在多个候选表达式之间进行选择。
    • 不确定性量化:在 SPARC 案例中,通过“姐妹模型”后验(以星系为独立单元的 bootstrap)给出了局部斜率 s(z) 的后验分布。这不是一个完整的贝叶斯后验,而是一种频率学派的不确定性量化。
  • 核心数值结论 + uncertainty 量化方式:
    • AI Feynman 基准:在无噪声情况下,完整流水线(不含 FSS)首次实现了所有 120 个方程的精确符号恢复。在有 10% 噪声时,恢复率约 50%。
    • FSS 单独测试:在 oracle 模式(精确函数值)下,FSS 恢复了 115 个方程中的 88 个(76.5%),中位运行时间 30 秒。
    • SPARC 案例:盲恢复发现重子加速坐标 z = g_gas + 0.56 * g_disk,质量-光度比 Υ_d = 0.56^{+0.14}_{-0.14},与预期一致。多个候选外律在统计上不可区分,因此报告为一个“族”而非唯一形式。局部斜率 s(z) 的后验在认证域上从 0.5(深区)上升到 1(牛顿区)。

六、对统计学家的判断(最关键的一节,不要含糊)

  1. 这篇文章作为入门读物质量如何?

    • 评分:4 / 5 星
    • 理由:这是一篇极好的第二篇或第三篇读物,但不是好的第一篇。文章内容极其丰富,方法创新点密集,但 exposition 对初学者不友好。它假设读者已经熟悉符号回归、AI Feynman 基准、NestyNet 前作(Paper I)以及大量天文学背景(如 SPARC、RAR、旋转曲线)。术语(如“神经原子”、“残差盆地”、“确定方程”)在文中定义,但需要读者有很强的上下文理解能力。作为入门,它暴露了本子领域的核心思路(可分离性、复合坐标、量纲分析),但 exposition 的清晰度不如一篇好的综述。如果你已经读过一篇 SR 综述(如 AI Feynman 的 Science Advances 论文),这篇就是完美的下一步。
  2. 这个问题值不值得统计学家进入工作?

    • 论证:
      • (i) 科学重要性:极高。天文学界非常在乎这个问题。自动发现物理定律是数据驱动科学发现的圣杯。SPARC 案例直接触及星系动力学和暗物质的核心争论(MOND vs. ΛCDM)。任何能自动、可靠地从天文数据中提取可解释定律的方法,都会产生巨大影响。
      • (ii) 方法学空间:巨大。这绝不仅仅是“套用一个标准方法”。符号回归本身就是一个 NP-hard 的组合优化问题,其统计-计算权衡是核心挑战。本文的 FSS 和 GS 层是聪明的启发式方法,但远非最终答案。真正的统计挑战包括:
        • 不确定性量化:如何为发现的表达式提供有意义的置信度?本文的“统计选择”和“姐妹模型”是初步尝试,但远未成熟。一个完整的贝叶斯符号回归框架(在表达式空间上定义先验)是开放问题。
        • 模型选择:在多个候选表达式之间进行选择,如何控制过拟合?AIC/BIC 等经典准则在表达式空间中的行为如何?
        • 噪声鲁棒性:本文的噪声实验显示恢复率随噪声增加急剧下降。如何设计对噪声更鲁棒的分离性检测和搜索策略?
        • 高维问题:当变量数超过 10 或 20 时,当前的递归分解策略会失效。需要新的降维或稀疏性假设。
      • (iii) 社区开放性:中等偏上。作者群主要是天文学家和计算机科学家,没有统计学家。方法学讨论(如 §7.5 的统计选择)虽然存在,但深度有限(例如,bootstrap 的使用方式在统计学家看来可能不够严谨)。然而,该领域(符号回归)本身非常欢迎方法学贡献,尤其是来自统计学界的。天文学界对新的统计方法通常持开放态度,只要它们能解决实际问题。
      • (iv) 武器库匹配度:
        • 非常熟悉:nonparametric statistics, minimax bounds, high-dimensional asymptotics, software development。
        • 中等熟悉:semiparametric theory, M-estimation theory。
        • 缺口:computation of higher-order U-statistics 中的 tensor contraction 技巧在这里不直接适用(符号回归的搜索空间是树,不是张量网络)。inverse problems with random noise 和 estimation theory in causal inference 中的识别理论不直接相关。核心缺口在于:对组合优化、搜索算法(如 UCB、蒙特卡洛树搜索)、遗传编程、强化学习的熟悉程度。本文的 FSS 本质上是一个精心设计的搜索算法,其性能分析(收敛性、最优性)需要组合优化和算法分析的工具,而非高维统计或半参理论。
    • 结论:边缘(Borderline)。
      • 理由:你的武器库与本文的核心方法(FSS 搜索、GS 对称性发现)匹配度不高。你的强项(非参、高维、半参)更适合处理符号回归中的下游问题,例如:
        • 为发现的表达式提供更好的不确定性量化(如贝叶斯后验)。
        • 分析候选表达式在噪声下的统计性质(如 minimax 最优性)。
        • 设计更鲁棒的模型选择准则。 但如果你直接想改进 FSS 的搜索算法本身,你的武器库不够,需要补充组合优化和搜索算法的知识。因此,这是一个边缘方向:值得进入,但需要调整切入点,从你擅长的统计推断和不确定性量化角度切入,而不是从搜索算法本身切入。
  3. 若值得进入,研究者能做的具体问题(最多 2 条)

    • 问题 1:为符号回归结果提供统计上严谨的不确定性量化。
      • 武器库:nonparametric statistics, semiparametric theory, M-estimation theory。
      • 第一步动作:将发现的表达式 f_hat(x; theta) 视为一个半参数模型,其中 theta 是常数参数,表达式结构是“非参”部分。利用 bootstrap 或 influence function 为 theta 和预测值 f_hat 构建置信区间。可以借鉴本文的“姐妹模型”思路,但用更严谨的统计理论(如去偏机器学习)来构造。
    • 问题 2:设计一个基于 minimax 准则的模型选择框架。
      • 武器库:minimax bounds for estimation problems, high-dimensional asymptotics。
      • 第一步动作:将符号回归视为一个模型选择问题:在候选表达式集合 F 中,选择能最小化预测风险(如均方误差)的表达式。推导在给定噪声水平和样本量下,最优表达式所能达到的 minimax 风险下界。然后,设计一个模型选择准则(如修正的 BIC 或交叉验证),并证明它在渐近意义上能达到这个下界。
  4. 下一步读什么?

    • 入门综述:
      • Udrescu, S.-M., & Tegmark, M. (2020). AI Feynman: A physics-inspired method for symbolic regression. Science Advances, 6(16), eaay2631. 这是本文的直接前身和灵感来源。它清晰阐述了“可分离性”和“对称性”作为核心归纳偏置的思想, exposition 对非天文学家友好得多。必读。
    • 方法学奠基论文:
      • Cranmer, M. (2023). Interpretable Machine Learning for Science with PySR and SymbolicRegression.jl. arXiv preprint arXiv:2305.01582. PySR 是当前最流行的符号回归工具之一,基于遗传编程。阅读它可以了解另一种主流方法,并与本文的 FSS 进行对比。
      • Tenachi, W., Ibata, R., & Diakogiannis, F. I. (2023). PhySO: Physical Symbolic Optimization. The Astrophysical Journal, 959(2), 99. 这是本文作者团队的前作,基于强化学习。阅读它可以了解该团队的方法演进脉络。
    • 可动手的公开数据集:
      • SRBench:一个标准化的符号回归基准测试平台,包含 AI Feynman 数据集和其他真实世界数据集。代码和数据公开(https://github.com/cavalab/srbench)。你可以直接用它来测试自己的方法或复现本文结果。

七、术语小抄

英文术语 中文 一句话解释
Symbolic Regression (SR) 符号回归 自动从数据中发现数学表达式,不预设模型形式。
Neural Surrogate 神经代理模型 一个训练好的神经网络,用来近似未知函数,并能提供解析导数。
Separability 可分离性 一个多变量函数可以分解为几个低维函数的组合(如加法、乘法)。
Compound Coordinate 复合坐标 由原始变量组合而成的新变量(如 x1*x2),使物理定律形式更简单。
Abstract Syntax Tree (AST) 抽象语法树 用树形结构表示数学表达式,每个节点是运算符或变量/常数。
Factorized Symbolic Search (FSS) 因子化符号搜索 将搜索分解为“找骨架”和“拟合常数”两步,常数通过优化而非搜索得到。
Dimensional Analysis 量纲分析 利用物理量的单位(L, T, M)来约束搜索,只保留量纲一致的表达式。
Generalized Symmetry (GS) 广义对称性 通过求解线性方程发现目标函数的隐藏对称性,直接揭示正确的复合坐标。
SPARC Survey SPARC 巡天 一个公开的星系旋转曲线数据库,用于研究星系动力学。
Radial Acceleration Relation (RAR) 径向加速度关系 观测到的向心加速度与重子物质预期加速度之间的经验关系。
Baryonic Acceleration Coordinate 重子加速坐标 由气体和恒星盘贡献按比例相加而成的复合坐标,是理解 RAR 的关键。
Levenberg–Marquardt (LM) Levenberg–Marquardt 算法 一种用于非线性最小二乘问题的优化算法,常用于拟合模型参数。
Upper Confidence Bound (UCB) 上置信界 一种用于平衡探索与利用的决策规则,常用于多臂赌博机问题。
Residual Basin 残差盆地 具有相似残差模式的候选表达式集合,用于引导搜索避免重复探索。
Determining Equation 确定方程 一个线性方程,其解空间对应目标函数的所有仿射对称性。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论