跳转至

Galaxy Morphology Classification: Uncertainty Modeling and Out of Distribution Detection

作者: Prem Prakash, Shantanu Desai, P. K. Srijith
主题: 天体统计
相关性: 6/10
链接: https://arxiv.org/abs/2608.16654


一、子领域定位

  • 本文属于天文学的哪一支:extragalactic astronomy / galaxy morphology classification(星系形态分类)。核心科学问题是:星系如何形成和演化?形态(椭圆、旋涡、棒状等)是连接星系物理性质(恒星质量、恒星形成历史、暗物质分布)的关键观测探针。该子领域已从早期的人工目视分类(Hubble tuning fork)发展到大规模巡天时代的自动化深度学习分类,成熟度较高,但可靠的不确定性量化和异常/离群检测仍是开放问题——这正是本文的切入点。
  • 本文在这个子领域里的位置:它针对的是“自动分类器在遇到训练分布之外的罕见形态或观测伪影时,能否给出可靠的置信度并识别出这些异常样本”这一具体切片。本文不是提出新的分类架构,而是将计算机视觉中已有的OOD检测方法(IsoMaxPlus损失)和不确定性量化方法(MC Dropout)系统性地迁移到天文图像分类中,并首次在Galaxy Zoo DECaLS数据集上评估其效果。

二、关键术语扫盲

  1. Galaxy morphology(星系形态):星系的外观结构分类,最经典的是Hubble序列:椭圆星系(elliptical)、旋涡星系(spiral,有/无棒状结构)、透镜星系(lenticular)。形态与星系的形成历史、恒星含量、动力学状态密切相关。
  2. Hubble sequence(哈勃序列):由Edwin Hubble提出的星系形态分类体系,形如音叉,从椭圆到旋涡。现代分类在此基础上增加了更多细类(如环状、不规则、合并等)。
  3. DECaLS(Dark Energy Camera Legacy Survey):使用4米Blanco望远镜上的570百万像素暗能量相机(DECam)进行的深度光学巡天,覆盖约9000平方度天空,提供g、r、z三个波段图像。它是DESI(暗能量光谱仪)项目的成像部分。
  4. Galaxy Zoo:一个公民科学项目,邀请公众在线对星系图像进行目视形态分类。每个星系获得多个志愿者的投票,最终得到投票分数(vote fractions)作为软标签,而非单一硬标签。
  5. ResNet-34:一种34层深的卷积神经网络,通过残差连接(skip connections)解决深层网络退化问题。本文用它作为共享特征提取器,将星系图像映射到低维嵌入向量。
  6. SoftMax:神经网络分类器最后一层常用的激活函数,将logits(未归一化得分)转换为和为1的概率分布。缺点是对于OOD样本也会给出高置信度预测(overconfidence)。
  7. IsoMaxPlus(Isotropy Maximization Plus):一种替代SoftMax的损失函数,用输入特征到每个类别可学习原型(prototype)的欧氏距离代替线性logits。距离越小,属于该类别的概率越高。它通过熵尺度(entropy scale)控制后验分布的尖锐程度,使OOD样本获得更平坦(高熵)的预测分布,从而自然实现OOD检测。
  8. MC Dropout(Monte Carlo Dropout):一种近似贝叶斯推断的轻量方法。在推理时保持dropout层激活,对同一输入进行多次随机前向传播,用多次预测的均值和方差分别作为预测值和不确定性估计。它量化的是模型参数不确定性(epistemic uncertainty)。
  9. OOD detection(Out-of-Distribution detection,分布外检测):识别测试样本是否来自与训练数据不同的分布。在天文中,OOD样本包括罕见形态、合并星系、观测伪影等。本文用最小原型距离和预测熵作为OOD评分。
  10. Expected Calibration Error(ECE,期望校准误差):衡量分类器预测置信度与实际准确率之间一致性的指标。将预测置信度分桶,计算每个桶内平均置信度与准确率之差的加权平均。ECE越低,校准越好。
  11. Grad-CAM(Gradient-weighted Class Activation Mapping):一种可视化技术,通过分析最后一层卷积的梯度,生成热力图显示模型做决策时关注的图像区域。用于验证模型是否关注了有物理意义的星系结构(如旋臂、核球)。
  12. Vote fraction(投票分数):Galaxy Zoo中每个星系被志愿者归为各类别的比例。例如一个星系有70%的志愿者认为是旋涡,30%认为是椭圆。本文直接使用这些分数作为软标签训练模型,而非硬标签。

三、天文学家关心的问题

天文学家追问的核心问题是:星系如何形成和演化? 形态是回答这一问题的最直接观测线索之一——椭圆星系通常年老、恒星形成已停止;旋涡星系有活跃的恒星形成;棒状结构影响气体输运和核活动;合并星系触发星暴和形态转变。因此,大规模巡天(如SDSS、DECaLS、Euclid、Roman)需要为数十亿星系自动标注形态,以便统计研究形态与红移、质量、环境等的关系。

当前主流分析方法分为两类:(1) 基于深度学习的直接分类,如Dieleman et al. (2015) 使用旋转不变的CNN从Galaxy Zoo图像预测形态;(2) 贝叶斯CNN+主动学习,如Walmsley et al. (2020, 2022) 利用投票分数作为软标签训练贝叶斯CNN,同时用主动学习减少所需标注量。这些方法在ID样本上表现优异,但对OOD样本(罕见形态、合并、伪影)缺乏系统处理——标准SoftMax分类器会以高置信度将OOD样本强行归入某个已知类。已有的异常检测工作(如Lochner & Bassett 2021的Astronomaly,Margalef-Bentabol et al. 2020的VAE/WGAN方法)侧重于无监督发现,而非与分类器结合的OOD检测。

本文相对这些工作补了什么:它首次将IsoMaxPlus损失函数引入天文图像分类,在保持高分类准确率(97%)的同时,通过距离基原型和熵尺度正则化,实现了无需额外训练或异常样本的OOD检测;并进一步与MC Dropout结合,同时量化了认知不确定性。它绕开了需要单独训练生成模型或异常检测器的做法,直接在分类器内部嵌入OOD感知能力。

四、数据问题(统计学家最该关注的部分)

  • 数据来源:DECaLS巡天(Dey et al. 2019),使用4米Blanco望远镜+DECam相机。图像从Legacy Survey数据门户下载。
  • 数据形态:光学图像(g、r、z三波段),裁剪为400×400像素。每个星系有9个形态类别之一的投票分数标签。训练集约1.8万张,验证集约4600张,测试集约5.2万张(含OOD样本)。
  • 几何结构:图像是欧几里得空间中的2D网格,但星系在图像中的朝向、大小、位置是任意的。数据增强(旋转、翻转)用于引入旋转不变性。
  • noise model & 测量误差:图像噪声来自大气、探测器读出等,未显式建模。标签噪声来自公民科学投票——投票分数本身就是不确定的(不同志愿者可能给出不同分类)。本文直接使用投票分数作为软标签,而非硬标签,这隐含地处理了标签噪声。
  • selection effect / survey mask / Malmquist bias:样本选择基于光谱红移0.01≤z≤0.15和r<20.5的cut,优先选择可分辨形态的星系。投票阈值>90%确保标签质量,但导致类别严重不平衡(如Arms1类仅645张训练样本,而Round类有2382张)。不同类别使用了不同的角分辨率(0.06-0.16 arcsec/pixel),这引入了额外的系统差异。
  • 缺失 / censoring / truncation / 计算约束:稀有类别(如Ring、Arms1)样本极少,使用了更宽松的50%投票阈值来增加样本量。计算约束:单模型训练约3小时(NVIDIA 24GB GPU),MC Dropout推理需50次前向传播,计算成本线性增加。
  • 哪些是“漂亮的统计学问题”:投票分数作为软标签的统计建模(可视为多分类标签噪声问题)、类别不平衡下的OOD检测阈值选择、高维特征空间中距离基OOD评分的渐近性质。哪些是“纯工程难题”:图像预处理(不同角分辨率统一缩放)、数据增强策略、超参数调优(熵尺度Es=10的选择)、GPU内存管理。

五、模型问题(统计学家最该关注的部分)

  • 文章建立的模型/方法:使用共享的ResNet-34将星系图像x映射为嵌入向量f_θ(x)。在嵌入空间上,比较三种配置:
  • 交叉熵基线:标准SoftMax分类器,用投票分数作为软标签训练。
  • IsoMaxPlus:用可学习原型p_j^φ替代线性层,用欧氏距离||f_θ(x)-p_j^φ||作为logits,训练时加入熵尺度Es(设为10)使后验更平坦,推理时去掉Es。OOD评分用最小原型距离d_min。
  • IsoMaxPlus+MC Dropout:在推理时保持dropout激活,进行T=50次随机前向传播,用预测均值和方差分别作为分类结果和不确定性估计。
  • 关键假设:(a) 欧氏距离在嵌入空间中能有效度量形态相似性;(b) 原型能代表各类别的“典型”特征;(c) MC Dropout的多次随机前向传播能近似贝叶斯后验(Gal & Ghahramani 2015的理论保证);(d) 投票分数作为软标签能反映真实形态分布。
  • 推断手段:MLE(交叉熵损失)训练;MC Dropout提供近似贝叶斯后验;无显式先验。
  • 核心数值结论 + uncertainty量化方式:
  • 分类准确率:CE 0.9748 → IsoMaxPlus 0.9838(提升约0.9%);macro-F1:0.9435 → 0.9612。
  • OOD检测:TNR@TPR95提升约90%(具体数值未在摘要中给出,但正文提到)。
  • 校准误差:ECE从0.0095(CE)降至0.0033(IsoMaxPlus+MC Dropout),降幅约65-73%。
  • 不确定性通过预测熵和最小原型距离量化:ID样本集中在低熵、小距离区域;OOD样本向高熵、大距离区域偏移。
  • 使用ANOVA检验三种配置的准确率和F1差异,p值>0.05,表明差异在统计上不显著(但作者仍认为IsoMaxPlus有实际改进)。

六、对统计学家的判断(最关键的一节,不要含糊)

1. 这篇文章作为入门读物质量如何?

4/5 星。理由:本文对天文背景的统计学家来说是一个不错的入门读物,但不是最好的第一篇。优点:(a) 数据流程清晰——从巡天、图像裁剪、投票标签到训练/测试划分,每一步都交代了;(b) 模型部分自包含——解释了ResNet、IsoMaxPlus、MC Dropout的基本原理,不需要读者事先熟悉这些技术;(c) 暴露了本子领域的核心思路——自动分类+不确定性+OOD检测,这正是当前大规模巡天面临的实际问题。缺点:(a) 方法学创新有限——IsoMaxPlus和MC Dropout都是已有技术,本文主要是应用组合;(b) 对统计学家来说,缺乏对投票分数统计性质的深入讨论(如标签噪声模型、多标注者聚合的统计理论);(c) 评估指标(ECE、TNR@TPR95)是标准做法,但没有给出这些指标的置信区间或统计检验(除了ANOVA,但ANOVA结果不显著,作者未深入讨论)。

2. 这个问题值不值得统计学家进入工作?

边缘(borderline)。以下从四个维度论证:

(i) 科学重要性:高。 天文学界非常在乎这个问题。即将到来的Vera Rubin LSST、Euclid、Roman等巡天将产生数十亿星系图像,完全依赖自动分类。不可靠的分类会导致下游科学分析(如暗能量测量、星系演化统计)的系统偏差。OOD检测对于发现稀有/未知天体(如特殊合并、强透镜候选体)至关重要。因此,任何能提高分类可靠性和异常检测能力的方法都会受到天文学界欢迎。

(ii) 方法学空间:中等。 本文使用的IsoMaxPlus+MC Dropout是计算机视觉中已有技术的直接应用,没有提出新的统计方法。但天文数据特性确实提出了真正的统计挑战:(a) 标签噪声的结构化建模——投票分数不是独立同分布的噪声,而是来自多个标注者的聚合,且不同类别的标注难度不同;(b) OOD检测的统计保证——当前OOD评分(最小距离、熵)是启发式的,缺乏对假阳性率的理论控制;(c) 类别不平衡下的校准——稀有类别的ECE估计不可靠,需要专门的处理。这些挑战为统计学家提供了方法学空间,但需要将问题形式化为统计推断问题(如假设检验、经验过程理论),而非仅仅调深度学习超参数。

(iii) 社区开放性:中等偏低。 本文作者群(Prakash, Desai, Srijith)来自物理系和计算机系,没有统计学家。方法学讨论较浅——例如用ANOVA检验模型差异,但未讨论效应量、多重比较或更合适的非参数检验。该领域(天文机器学习)整体上欢迎方法学贡献,但需要统计学家主动用天文学家能理解的语言沟通。有成功先例(如Walmsley et al. 2020与Gal合作引入贝叶斯CNN),但门槛不低。

(iv) 武器库匹配度:部分匹配,但有缺口。 你的very_familiar武器包括nonparametric statistics、minimax bounds、inverse problems、high-dimensional asymptotics、software development。这些与本文的直接相关度不高——本文的核心是深度学习工程应用。但: - nonparametric statistics 可用于设计基于距离的OOD检测统计量(如检验新样本是否落在训练样本的支撑集外),并推导其渐近分布以控制第一类错误。 - high-dimensional asymptotics 可用于分析嵌入空间(如ResNet最后一层特征,维度通常为512或2048)中距离分布的相变行为,理解为什么欧氏距离在高维中可能失效(concentration of distances)。 - software development 可用于构建可复现的OOD检测基准测试框架。 - 缺口:你需要补充深度学习的基础知识(CNN架构、dropout、贝叶斯近似),以及天文图像处理的具体知识(PSF、背景减除、天体测量)。你的moderately_familiar武器(semiparametric theory、M-estimation)可用于处理投票分数作为软标签的估计问题,但需要将问题重新表述为半参数模型。

明确结论:边缘。 理由:科学重要性高,但方法学空间有限(当前工作主要是工程应用),且你的武器库与当前方法不直接对齐。如果你愿意花时间学习深度学习基础并主动与天文学家合作,可以做出有影响力的工作(特别是在OOD检测的统计保证和标签噪声建模方面)。但作为独立研究者,从零进入这个方向可能效率不高——更好的策略是:先读入门综述,然后找一个具体统计问题(如OOD检测的假设检验框架)做理论工作,再找天文学家合作验证。

3. 若值得进入,研究者能做的具体问题(最多2条)

(由于判断为“边缘”,这里给出两个需要补充技能但可用very_familiar武器起步的问题)

  1. 基于非参数距离的OOD检测假设检验:将OOD检测形式化为假设检验问题——H0: 样本来自ID分布 vs H1: 样本来自OOD分布。用最小原型距离作为检验统计量,利用nonparametric statistics推导其渐近零分布(考虑高维嵌入空间的浓度现象),从而给出有统计保证的阈值选择方法。用到:nonparametric statistics、high-dimensional asymptotics。第一步动作:阅读关于“two-sample testing in high dimensions”的文献(如Ramdas et al. 2015),将距离基检验适配到原型距离场景。

  2. 利用投票分数作为软标签的半参数效率估计:将投票分数视为真实形态标签的带噪声测量,建立半参数模型:观测到的投票分数 = g(真实标签) + 噪声,其中g是未知的标注偏差函数。目标是在存在标签噪声的情况下,高效估计分类器的泛化误差或某个形态类别的比例。用到:semiparametric theory、M-estimation、estimation theory in causal inference(将标注过程视为一种测量误差机制)。第一步动作:形式化投票分数的生成模型(如多项分布+随机标注者效应),推导真实标签分布的可识别性条件。

4. 下一步读什么

(以下前两项从被引文献中挑选真实存在的论文)

  • 入门综述:Conselice (2014) “The Evolution of Galaxy Structure Over Cosmic Time” (Annual Review of Astronomy and Astrophysics, 52, 291–337)。这篇综述全面介绍了星系形态与结构的研究方法(视觉分类、Sérsic拟合、非参数指标CAS/Gini/M20)以及形态随红移的演化,是了解本子领域科学背景的最佳起点。
  • 方法学奠基论文:Walmsley et al. (2020) “Galaxy Zoo: probabilistic morphology through Bayesian CNNs and active learning” (MNRAS, 491, 1554–1574)。这篇论文展示了如何将贝叶斯CNN与Galaxy Zoo的投票分数结合,产生校准良好的后验标签分布,并利用主动学习减少标注量。它是本文直接引用的不确定性量化基线工作,也是统计学家理解天文分类中概率建模的经典案例。
  • 公开数据集:Galaxy Zoo DECaLS数据集(Walmsley et al. 2022, MNRAS, 509, 3966–3988)包含314,000个星系的详细视觉形态测量,图像和投票分数均可从Legacy Survey数据门户下载。此外,Kaggle上曾有“Galaxy Zoo - The Galaxy Challenge”竞赛,提供SDSS图像和投票分数,适合作为动手练习。

七、术语小抄

英文术语 中文 一句话解释
galaxy morphology 星系形态 星系的外观结构分类(椭圆、旋涡、棒状等),反映其形成和演化历史。
Hubble sequence 哈勃序列 经典的星系形态分类体系,从椭圆到旋涡排列成音叉状。
DECaLS 暗能量相机遗产巡天 使用DECam相机进行的深度光学巡天,提供g、r、z三波段图像。
Galaxy Zoo 星系动物园 公民科学项目,公众对星系图像进行目视形态分类,产生投票分数。
ResNet 残差网络 通过跳跃连接解决深层网络退化问题的CNN架构。
SoftMax 软最大化 将logits转换为概率分布的激活函数,但对OOD样本易过度自信。
IsoMaxPlus 各向同性最大化Plus损失 用特征到原型的欧氏距离代替线性logits,实现距离基OOD检测。
MC Dropout 蒙特卡洛丢弃法 推理时保持dropout激活,多次前向传播近似贝叶斯后验,估计不确定性。
OOD detection 分布外检测 识别测试样本是否来自与训练数据不同的分布。
prototype 原型 可学习的类别中心向量,在嵌入空间中代表该类别的典型特征。
entropy scale 熵尺度 IsoMaxPlus中的超参数,控制训练后验的尖锐程度,越大越平坦。
vote fraction 投票分数 每个星系被志愿者归为各类别的比例,用作软标签。
ECE (Expected Calibration Error) 期望校准误差 衡量预测置信度与实际准确率之间一致性的指标。
Grad-CAM 梯度加权类激活映射 可视化模型决策依据的热力图,显示关注哪些图像区域。
TNR@TPR95 在95%真阳性率下的真阴性率 OOD检测的常用指标:在正确识别95%的ID样本时,能正确拒绝多少OOD样本。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论