NestyNet. III. Symbolic Regression from Analytic Neural Surrogates¶
作者: Rodrigo Ibata, Wassim Tenachi, Foivos Diakogiannis, Neil Ibata, Anirudh Shankar
主题: 天体统计
相关性: 6/10
链接: https://arxiv.org/abs/2608.21051
一、子领域定位¶
- 本文属于天文学的哪一支:天文数据分析方法(Astrostatistics / Astroinformatics),具体是符号回归(Symbolic Regression) 这一子领域。符号回归的目标是从数据中自动发现封闭形式的数学表达式(物理定律),而不预先假设模型形式(如线性、多项式)。该子领域处于天文学、机器学习和应用数学的交叉点,成熟度中等——已有多种方法(遗传编程、强化学习、神经网络引导),但精确恢复复杂多变量物理定律仍是一个开放挑战。
- 本文在这个子领域里的位置:它针对的核心问题是如何可靠地从带噪声的、多变量的天文数据中自动发现可解释的物理定律。本文的独特切片是:利用高精度神经代理模型(NestyNet)的解析导数来检测函数的可分离性(additive/multiplicative/compound separability),从而将多变量问题递归分解为低维子问题;并引入一种新颖的因子化符号搜索(Factorized Symbolic Search, FSS),将结构发现与参数校准分离,大幅降低组合搜索的复杂度。
二、关键术语扫盲¶
- 符号回归 (Symbolic Regression, SR):一种机器学习任务,目标是找到一个数学表达式(由基本运算如加减乘除、幂、三角函数、指数等组合而成)来拟合数据。不同于传统回归(如线性回归)固定模型形式,SR 搜索整个表达式空间。
- 神经代理模型 (Neural Surrogate):一个训练好的神经网络,用来近似一个未知函数。本文中,这个代理模型(NestyNet)不仅输出函数值,还能精确计算一阶和二阶导数(解析导数),这是后续结构发现的关键。
- 可分离性 (Separability):一个多变量函数可以分解为几个低维函数的组合。例如,加法可分离
f(x,y) = g(x) + h(y),乘法可分离f(x,y) = g(x) * h(y)。发现这种结构能将复杂问题简化。 - 复合坐标 (Compound Coordinate):由原始输入变量组合而成的新变量,例如
z = x1 * x2或z = x1^2 + x2^2。物理定律往往在正确的复合坐标下变得简单(例如,在z = x1^2 + x2^2下,f = sqrt(z)比f = sqrt(x1^2 + x2^2)更简单)。 - 抽象语法树 (Abstract Syntax Tree, AST):一种树形数据结构,用于表示数学表达式。每个内部节点是一个运算符(如
+,*,sin),叶子节点是变量或常数。SR 算法通常在这个树空间中进行搜索。 - 因子化符号搜索 (Factorized Symbolic Search, FSS):本文的核心方法创新。它将搜索分解为两步:先搜索一个无常数的骨架(skeleton)(即复合坐标的结构),然后通过拟合一个校准映射(calibrated outer map)(如多项式、正弦、指数)来评估这个骨架的好坏。这样,常数(如振幅、频率)不需要通过离散搜索来发现,而是通过连续优化来拟合。
- 量纲分析 (Dimensional Analysis):利用物理量的单位(如长度 L、时间 T、质量 M)来约束搜索空间。只有量纲一致的表达式才是物理上合理的。本文实现了局部和全局("Buckingham–Sudoku")的量纲一致性检查,能提前剪枝掉大量无效候选。
- 广义对称性层 (Generalized Symmetry Layer, GS):通过求解一个线性方程(确定方程)来发现目标函数隐藏的对称性(如缩放、平移、旋转)。这些对称性直接揭示了正确的复合坐标,可以绕过组合搜索。
- SPARC 巡天 (SPARC survey):一个公开的星系旋转曲线数据库,提供了星系中气体和恒星的分布以及观测到的旋转速度。本文用它作为真实数据案例,来验证算法能否自动发现重子加速坐标(baryonic acceleration coordinate)。
- 径向加速度关系 (Radial Acceleration Relation, RAR):星系动力学中的一个经验关系,描述了观测到的向心加速度(
g_obs)与由可见物质(重子物质)产生的预期加速度(g_bar)之间的关系。本文的 SPARC 案例就是盲恢复这个关系。 - 重子加速坐标 (Baryonic Acceleration Coordinate):一个复合坐标,由气体和恒星盘对旋转曲线的贡献按一定比例(质量-光度比)相加而成。发现这个坐标是理解 RAR 的关键一步。
- Levenberg–Marquardt (LM) 求解器:一种用于非线性最小二乘问题的优化算法。本文用它来拟合候选表达式中的常数参数,因为它对中等规模的参数优化问题非常有效。
三、天文学家关心的问题¶
天文学家面临一个根本性问题:如何从海量、高维、带噪声的观测数据中,自动发现简洁、可解释、可预测的物理定律?传统的做法依赖科学家的直觉和手动推导,但面对日益复杂的数据(如星系动力学、引力波信号、系外行星大气),这种方法越来越力不从心。符号回归(SR)提供了一个自动化的替代方案,但面临组合爆炸的挑战——候选表达式的数量随变量和运算符数量指数增长。
当前领域的主流方法包括: - 遗传编程(GP):如 PySR (Cranmer 2023),通过变异和交叉进化表达式树。局限:搜索效率低,常数优化与结构搜索耦合。 - 强化学习(RL):如 PhySO (Tenachi et al. 2023),将表达式生成视为序列决策问题。局限:需要大量训练,对复杂结构泛化能力有限。 - AI Feynman 方法 (Udrescu & Tegmark 2020):通过检测对称性和可分离性来递归分解问题。局限:依赖数值导数,精度不足时容易误判。
本文相对这些工作的贡献: 1. 解决了导数精度问题:利用 NestyNet 代理模型提供的高精度解析导数,使 AI Feynman 风格的可分离性检测变得可靠(此前因数值导数误差大而不可靠)。 2. 提出了因子化搜索(FSS):将结构搜索与参数校准分离,这是对 GP 和 RL 方法中“结构-参数耦合”问题的直接改进。常数通过拟合而非搜索得到,大幅缩小了离散搜索空间。 3. 引入了广义对称性层:能从梯度几何中直接发现复合坐标,绕过了组合搜索,能处理 AI Feynman 原始方法无法处理的非整数系数坐标。
四、数据问题(统计学家最该关注的部分)¶
- 数据来源:本文主要使用两个数据源:
- AI Feynman 基准:120 个人工生成的数学方程,每个方程在给定域内均匀采样 2000 个训练点和 2000 个验证点。这是合成数据,用于方法验证。
- SPARC 巡天:48 个星系的旋转曲线数据(945 个数据点),提供每个半径处的气体贡献(
g_gas)、恒星盘贡献(g_disk)和观测到的向心加速度(g_obs)。这是真实天文数据。
- 数据形态:表格数据(catalogue)。每个样本点是一个向量
(x1, ..., xn, y)。在 AI Feynman 中,n从 1 到 7+;在 SPARC 中,n=2(g_gas,g_disk),y = g_obs。 - 几何结构:欧几里得空间
R^n。没有特殊的流形或球面几何结构。 - 噪声模型 & 测量误差:
- AI Feynman 基准:人为添加独立同分布的高斯噪声,信噪比从无噪声到 10%。
- SPARC 数据:测量误差来自距离、倾角、旋转速度的观测不确定性。本文通过将距离和倾角作为自由参数(带高斯先验)来部分处理这些误差。
- 系统性偏倚:
- 选择效应:SPARC 样本并非随机,而是选择了动力学规则、质量高的星系(
Q < 3,e_V/V < 0.1, 无核球等)。这是非随机抽样,结论的泛化性受限于此。 - Malmquist 偏倚:未明确讨论,但 SPARC 样本偏向亮星系,可能存在。
- 选择效应:SPARC 样本并非随机,而是选择了动力学规则、质量高的星系(
- 缺失 / 删失 / 截断:每个星系有不同数量的径向测量点(至少 8 个),但每个点都是完整的(无缺失值)。没有截断或删失。
- 哪些是“漂亮的统计学问题”,哪些是“纯工程难题”:
- 漂亮的统计学问题:
- 高维组合搜索的统计-计算权衡:符号回归的 NP-hard 性质本身就是一个统计-计算权衡问题。本文的 FSS 和 GS 层可以看作是在特定结构假设(可分离性、对称性)下,将计算复杂度从指数级降低到多项式级的策略。
- 模型选择与不确定性量化:在 SPARC 案例中,多个候选外律(RAR 插值函数、幂律等)在统计上不可区分。本文的“统计选择”(§7.5)和“姐妹模型”(sister model)后验提供了处理这种模型不确定性的框架,这直接对应统计学的模型平均/选择问题。
- 多数据集联合推断:SPARC 案例中,多个星系共享一个物理定律但有个体参数(质量-光度比)。这类似于统计学中的分层模型(hierarchical model) 或元分析(meta-analysis),需要处理组内相关性和组间异质性。
- 纯工程难题:
- 神经代理模型的训练:NestyNet 的架构和训练策略(分段线性、LM 优化)是高度工程化的,对统计学家来说主要是黑箱。
- AST 的表示与操作:表达式树的生成、简化、量纲检查的工程实现,是计算问题而非统计问题。
- 搜索算法的调度:Phase 1 枚举、Phase 2 UCB 突变、重写规则的优先级调度,这些是算法工程,其统计性质(如 UCB 的探索-利用平衡)虽然有趣,但并非本文的核心统计贡献。
- 漂亮的统计学问题:
五、模型问题(统计学家最该关注的部分)¶
- 文章建立的模型/方法重述:本文构建了一个两阶段流水线:
- Stage A(结构发现):训练一个 NestyNet 代理模型
f_hat(x)。利用其解析导数,检测f_hat是否可分解(加法、乘法、复合坐标)。递归应用,直到每个分支变成一个低维(最好是单变量)的“神经原子”。 - Stage B(符号闭合):将 Stage A 得到的神经原子转化为封闭形式的数学表达式。优先使用快速的重写规则(如检测到单变量是幂律、正弦等)。对于顽固的原子,升级到因子化符号搜索(FSS)。FSS 的核心是:搜索一个无常数的骨架
s(x),然后评估s(x)是否能通过一个简单的校准映射(如a*sin(b*s + c))很好地拟合目标y。常数a, b, c通过连续优化(LM)得到,而不是通过离散搜索。
- Stage A(结构发现):训练一个 NestyNet 代理模型
- 模型的关键假设:
- 物理定律是简单的:在正确的表示(复合坐标)下,物理定律是低维、可分离的。这是整个方法的哲学基础。
- 可分离性是普遍存在的:大多数物理定律可以分解为加法、乘法或复合坐标的形式。这个假设在物理学中很常见,但并非总是成立。
- 神经代理模型足够精确:NestyNet 的解析导数精度是 Stage A 成功的关键。如果代理模型不准确,所有下游的结构检测都会失败。
- 量纲一致性:物理定律必须量纲一致。这是一个很强的、物理上合理的约束,用于剪枝搜索空间。
- 推断手段:
- 点估计:LM 求解器用于拟合候选表达式中的常数参数。
- 模型选择:通过启发式规则(§7.4)或统计选择(§7.5,基于 bootstrap 的置信 Pareto 前沿)在多个候选表达式之间进行选择。
- 不确定性量化:在 SPARC 案例中,通过“姐妹模型”后验(以星系为独立单元的 bootstrap)给出了局部斜率
s(z)的后验分布。这不是一个完整的贝叶斯后验,而是一种频率学派的不确定性量化。
- 核心数值结论 + uncertainty 量化方式:
- AI Feynman 基准:在无噪声情况下,完整流水线(不含 FSS)首次实现了所有 120 个方程的精确符号恢复。在有 10% 噪声时,恢复率约 50%。
- FSS 单独测试:在 oracle 模式(精确函数值)下,FSS 恢复了 115 个方程中的 88 个(76.5%),中位运行时间 30 秒。
- SPARC 案例:盲恢复发现重子加速坐标
z = g_gas + 0.56 * g_disk,质量-光度比Υ_d = 0.56^{+0.14}_{-0.14},与预期一致。多个候选外律在统计上不可区分,因此报告为一个“族”而非唯一形式。局部斜率s(z)的后验在认证域上从 0.5(深区)上升到 1(牛顿区)。
六、对统计学家的判断(最关键的一节,不要含糊)¶
-
这篇文章作为入门读物质量如何?
- 评分:4 / 5 星
- 理由:这是一篇极好的第二篇或第三篇读物,但不是好的第一篇。文章内容极其丰富,方法创新点密集,但 exposition 对初学者不友好。它假设读者已经熟悉符号回归、AI Feynman 基准、NestyNet 前作(Paper I)以及大量天文学背景(如 SPARC、RAR、旋转曲线)。术语(如“神经原子”、“残差盆地”、“确定方程”)在文中定义,但需要读者有很强的上下文理解能力。作为入门,它暴露了本子领域的核心思路(可分离性、复合坐标、量纲分析),但 exposition 的清晰度不如一篇好的综述。如果你已经读过一篇 SR 综述(如 AI Feynman 的 Science Advances 论文),这篇就是完美的下一步。
-
这个问题值不值得统计学家进入工作?
- 论证:
- (i) 科学重要性:极高。天文学界非常在乎这个问题。自动发现物理定律是数据驱动科学发现的圣杯。SPARC 案例直接触及星系动力学和暗物质的核心争论(MOND vs. ΛCDM)。任何能自动、可靠地从天文数据中提取可解释定律的方法,都会产生巨大影响。
- (ii) 方法学空间:巨大。这绝不仅仅是“套用一个标准方法”。符号回归本身就是一个 NP-hard 的组合优化问题,其统计-计算权衡是核心挑战。本文的 FSS 和 GS 层是聪明的启发式方法,但远非最终答案。真正的统计挑战包括:
- 不确定性量化:如何为发现的表达式提供有意义的置信度?本文的“统计选择”和“姐妹模型”是初步尝试,但远未成熟。一个完整的贝叶斯符号回归框架(在表达式空间上定义先验)是开放问题。
- 模型选择:在多个候选表达式之间进行选择,如何控制过拟合?AIC/BIC 等经典准则在表达式空间中的行为如何?
- 噪声鲁棒性:本文的噪声实验显示恢复率随噪声增加急剧下降。如何设计对噪声更鲁棒的分离性检测和搜索策略?
- 高维问题:当变量数超过 10 或 20 时,当前的递归分解策略会失效。需要新的降维或稀疏性假设。
- (iii) 社区开放性:中等偏上。作者群主要是天文学家和计算机科学家,没有统计学家。方法学讨论(如 §7.5 的统计选择)虽然存在,但深度有限(例如,bootstrap 的使用方式在统计学家看来可能不够严谨)。然而,该领域(符号回归)本身非常欢迎方法学贡献,尤其是来自统计学界的。天文学界对新的统计方法通常持开放态度,只要它们能解决实际问题。
- (iv) 武器库匹配度:
- 非常熟悉:
nonparametric statistics,minimax bounds,high-dimensional asymptotics,software development。 - 中等熟悉:
semiparametric theory,M-estimation theory。 - 缺口:
computation of higher-order U-statistics中的 tensor contraction 技巧在这里不直接适用(符号回归的搜索空间是树,不是张量网络)。inverse problems with random noise和estimation theory in causal inference中的识别理论不直接相关。核心缺口在于:对组合优化、搜索算法(如 UCB、蒙特卡洛树搜索)、遗传编程、强化学习的熟悉程度。本文的 FSS 本质上是一个精心设计的搜索算法,其性能分析(收敛性、最优性)需要组合优化和算法分析的工具,而非高维统计或半参理论。
- 非常熟悉:
- 结论:边缘(Borderline)。
- 理由:你的武器库与本文的核心方法(FSS 搜索、GS 对称性发现)匹配度不高。你的强项(非参、高维、半参)更适合处理符号回归中的下游问题,例如:
- 为发现的表达式提供更好的不确定性量化(如贝叶斯后验)。
- 分析候选表达式在噪声下的统计性质(如 minimax 最优性)。
- 设计更鲁棒的模型选择准则。 但如果你直接想改进 FSS 的搜索算法本身,你的武器库不够,需要补充组合优化和搜索算法的知识。因此,这是一个边缘方向:值得进入,但需要调整切入点,从你擅长的统计推断和不确定性量化角度切入,而不是从搜索算法本身切入。
- 理由:你的武器库与本文的核心方法(FSS 搜索、GS 对称性发现)匹配度不高。你的强项(非参、高维、半参)更适合处理符号回归中的下游问题,例如:
- 论证:
-
若值得进入,研究者能做的具体问题(最多 2 条)
- 问题 1:为符号回归结果提供统计上严谨的不确定性量化。
- 武器库:
nonparametric statistics,semiparametric theory,M-estimation theory。 - 第一步动作:将发现的表达式
f_hat(x; theta)视为一个半参数模型,其中theta是常数参数,表达式结构是“非参”部分。利用 bootstrap 或 influence function 为theta和预测值f_hat构建置信区间。可以借鉴本文的“姐妹模型”思路,但用更严谨的统计理论(如去偏机器学习)来构造。
- 武器库:
- 问题 2:设计一个基于 minimax 准则的模型选择框架。
- 武器库:
minimax bounds for estimation problems,high-dimensional asymptotics。 - 第一步动作:将符号回归视为一个模型选择问题:在候选表达式集合
F中,选择能最小化预测风险(如均方误差)的表达式。推导在给定噪声水平和样本量下,最优表达式所能达到的 minimax 风险下界。然后,设计一个模型选择准则(如修正的 BIC 或交叉验证),并证明它在渐近意义上能达到这个下界。
- 武器库:
- 问题 1:为符号回归结果提供统计上严谨的不确定性量化。
-
下一步读什么?
- 入门综述:
- Udrescu, S.-M., & Tegmark, M. (2020). AI Feynman: A physics-inspired method for symbolic regression. Science Advances, 6(16), eaay2631. 这是本文的直接前身和灵感来源。它清晰阐述了“可分离性”和“对称性”作为核心归纳偏置的思想, exposition 对非天文学家友好得多。必读。
- 方法学奠基论文:
- Cranmer, M. (2023). Interpretable Machine Learning for Science with PySR and SymbolicRegression.jl. arXiv preprint arXiv:2305.01582. PySR 是当前最流行的符号回归工具之一,基于遗传编程。阅读它可以了解另一种主流方法,并与本文的 FSS 进行对比。
- Tenachi, W., Ibata, R., & Diakogiannis, F. I. (2023). PhySO: Physical Symbolic Optimization. The Astrophysical Journal, 959(2), 99. 这是本文作者团队的前作,基于强化学习。阅读它可以了解该团队的方法演进脉络。
- 可动手的公开数据集:
- SRBench:一个标准化的符号回归基准测试平台,包含 AI Feynman 数据集和其他真实世界数据集。代码和数据公开(https://github.com/cavalab/srbench)。你可以直接用它来测试自己的方法或复现本文结果。
- 入门综述:
七、术语小抄¶
| 英文术语 | 中文 | 一句话解释 |
|---|---|---|
| Symbolic Regression (SR) | 符号回归 | 自动从数据中发现数学表达式,不预设模型形式。 |
| Neural Surrogate | 神经代理模型 | 一个训练好的神经网络,用来近似未知函数,并能提供解析导数。 |
| Separability | 可分离性 | 一个多变量函数可以分解为几个低维函数的组合(如加法、乘法)。 |
| Compound Coordinate | 复合坐标 | 由原始变量组合而成的新变量(如 x1*x2),使物理定律形式更简单。 |
| Abstract Syntax Tree (AST) | 抽象语法树 | 用树形结构表示数学表达式,每个节点是运算符或变量/常数。 |
| Factorized Symbolic Search (FSS) | 因子化符号搜索 | 将搜索分解为“找骨架”和“拟合常数”两步,常数通过优化而非搜索得到。 |
| Dimensional Analysis | 量纲分析 | 利用物理量的单位(L, T, M)来约束搜索,只保留量纲一致的表达式。 |
| Generalized Symmetry (GS) | 广义对称性 | 通过求解线性方程发现目标函数的隐藏对称性,直接揭示正确的复合坐标。 |
| SPARC Survey | SPARC 巡天 | 一个公开的星系旋转曲线数据库,用于研究星系动力学。 |
| Radial Acceleration Relation (RAR) | 径向加速度关系 | 观测到的向心加速度与重子物质预期加速度之间的经验关系。 |
| Baryonic Acceleration Coordinate | 重子加速坐标 | 由气体和恒星盘贡献按比例相加而成的复合坐标,是理解 RAR 的关键。 |
| Levenberg–Marquardt (LM) | Levenberg–Marquardt 算法 | 一种用于非线性最小二乘问题的优化算法,常用于拟合模型参数。 |
| Upper Confidence Bound (UCB) | 上置信界 | 一种用于平衡探索与利用的决策规则,常用于多臂赌博机问题。 |
| Residual Basin | 残差盆地 | 具有相似残差模式的候选表达式集合,用于引导搜索避免重复探索。 |
| Determining Equation | 确定方程 | 一个线性方程,其解空间对应目标函数的所有仿射对称性。 |
Maintained by 陈星宇 · Homepage · Source on GitHub