跳转至

统计学史与文化 History & Culture

JCSDS 2026 · · 返回会议总览

  • 1 个分会场 · 4 场报告(已检索到对应论文 0 场)

统计学历史与文化

7 月 13 日(周一) · 08:30-10:10 · Colourful Guizhou Ballroom 1
组织 Wei Yuan(Renmin University of China) · 主持 Leping Liu(Tianjin University of Finance and Economics)

1. 洞见数据文明——中国统计学数字博物馆构想

讲者:Yingchun Zhou(East China Normal University)

对应论文:未检索到公开论文(以下为基于题目与作者方向的推断)

未检索到公开论文,以下为基于题目与讲者方向的推断。

问题
统计学作为数据科学的基石,其发展史蕴含丰富的思想演进、方法突破与人物故事,但相关史料分散于档案、书籍与个人记忆中,缺乏系统化、可交互的数字化载体。本报告提出“中国统计学数字博物馆”构想,旨在解决两个核心问题:如何将零散的统计史资源整合为结构化知识库?如何借助数字技术让统计学的“数据文明”被研究者、学生与公众直观感知,从而激发学科认同与创新灵感?

核心方法
报告拟采用数字人文与知识图谱技术构建三层架构:底层为多源异构数据采集层,涵盖统计学家生平、经典论文、教材、机构沿革、重要数据集(如人口普查、经济指标)等;中层为语义关联层,利用自然语言处理与实体链接技术,将人物、方法、事件、概念(如“最小二乘法”“抽样调查”)映射为节点与边,形成可查询的统计知识图谱;顶层为交互展示层,通过时间线可视化、地理热力图、虚拟现实(VR)场景还原(如模拟早期统计调查现场)等方式,实现沉浸式浏览。此外,可能引入众包机制,鼓励学界贡献史料,并利用机器学习自动补全缺失信息。

与已有工作关系
现有统计史研究多依赖传统文献考据(如《统计研究》中的历史专栏),缺乏数字化整合;而数字博物馆在历史学、考古学领域已有成熟案例(如“数字敦煌”),但针对统计学这一高度抽象学科的应用尚属空白。本报告将数字人文方法首次系统引入统计史领域,区别于零散的线上展览(如个别大学统计系史网页),强调知识关联与动态演化。

主要贡献
1. 提出一个开放、可扩展的统计学数字博物馆框架,为学科史研究提供基础设施,降低史料获取门槛。
2. 通过知识图谱揭示统计方法之间的传承与交叉(例如“方差分析”如何从农业试验扩展到社会科学),为研究者发现新问题提供线索。
3. 推动统计教育从公式记忆转向历史语境理解,增强学科文化自信。该构想若落地,将成为全球首个系统性的统计学数字文化遗产项目。

2. 薪火相传 笃行致远——上海财经大学统计学科史编撰成果

讲者:Xingdong Feng(Shanghai University of Finance and Economics)

对应论文:未检索到公开论文(以下为基于题目与作者方向的推断)

未检索到公开论文,以下为基于题目与讲者方向的推断。

问题
统计学科的发展史不仅是知识积累的记录,更揭示了学科范式转换、核心问题演变与学术共同体形成的内在逻辑。然而,国内统计学科史的系统性编撰工作长期缺位,导致研究者难以从历史脉络中识别“真问题”——例如,哪些经典方法因计算限制被搁置,如今因数据环境变化而重获生机?哪些交叉方向(如统计与计算机、经济学的互动)曾因制度因素被割裂?本报告以上海财经大学统计学科为案例,试图回答:如何通过学科史编撰,为当代统计研究者提供问题意识的“历史锚点”?

核心方法
报告采用“档案文献+口述史+计量分析”的混合方法。首先,系统梳理上财统计学科自建校以来的课程大纲、教材、学位论文等一手档案,提取关键概念(如“数理统计”“经济统计”的权重变迁)的频次与共现网络;其次,对老一辈统计学家(如陈希孺、王寿仁等)的访谈录音进行主题编码,还原学科建制化过程中的隐性知识(如学术争鸣、资源分配);最后,利用引文网络分析,量化上财统计学者在国内外期刊的学术影响力演变,并与同期学科政策(如教育部学科评估)进行关联。

与已有工作关系
现有统计学科史研究多集中于欧美(如Stigler的《统计史》),或国内仅以人物传记、回忆录形式散见。本报告首次以“机构史”为单元,将微观叙事(个人学术选择)与宏观制度(学科评估、基金导向)结合,弥补了国内统计学科“制度-知识”互动研究的空白。相较于单纯编年体,其方法更接近科学社会学中的“实验室研究”范式。

贡献
1. 为统计研究者提供“问题考古”工具:通过揭示上财统计学科在“文革”后如何从经济统计转向数理统计,启发当前高维统计、因果推断等热点是否也存在类似的“路径依赖”。
2. 方法论示范:将历史编撰转化为可复制的分析框架(档案数字化、引文网络可视化),其他高校可借鉴以构建自身学科史。
3. 教育启示:学科史中“失败”的研究方向(如早期非参数回归因计算成本被放弃)可成为教学案例,培养研究生的批判性思维。

3. 数据生产要素价值测度:数据科学的时代命题与统计学历史回响

讲者:Mengxin Wang(Guangzhou University)

对应论文:未检索到公开论文(以下为基于题目与作者方向的推断)

未检索到公开论文,以下为基于题目与讲者方向的推断。

问题
数据作为新型生产要素,其价值测度是数据科学时代的基础性难题。传统生产要素(劳动、资本)的价值可通过边际产出或市场价格直接观测,但数据具有非竞争性、可复制性与边际收益递增等特征,导致其价值难以用经典经济学框架量化。本报告试图回答:如何从统计学视角,为数据要素的“贡献”提供可识别、可分解的因果度量?

核心方法
报告提出将数据价值测度转化为“信息增量对决策收益的因果效应”问题。核心工具是结合Shapley值分解与反事实推断:将数据视为一组特征或信息源,通过随机化实验或倾向得分加权,估计移除某部分数据后决策效用的变化,从而量化各数据子集的边际贡献。具体地,利用\(E[Y|do(D=d)]\)\(E[Y|do(D=\emptyset)]\)的差异,其中\(D\)表示数据集合,\(Y\)为产出指标,并通过交叉拟合(cross-fitting)与双重稳健估计(doubly robust estimation)控制高维混杂。

与已有工作关系
区别于宏观经济学中基于增长核算的“数据资本”测度(如将数据纳入Cobb-Douglas生产函数),本报告强调微观层面的因果识别,避免内生性偏误。与计算机科学中基于Shapley值的特征重要性方法相比,报告引入统计推断的不确定性量化,并处理数据间的依赖结构(如时间序列、网络数据)。此外,报告回应了统计学史上“随机化实验”与“观察性研究”的争论,将数据价值测度重新锚定在Fisher与Neyman的因果推断传统中。

主要贡献
第一,为数据要素定价提供了严格的统计识别条件,指出仅凭相关性无法度量价值,必须依赖因果假设(如无混淆性、重叠性)。第二,提出一套可操作的估计流程,包括数据分割、伪结果回归与Bootstrap置信区间,适用于企业级数据资产评估。第三,从历史视角阐明:数据价值测度本质上是“统计推断在数字经济中的自然延伸”,为统计学在数据科学时代的核心地位提供了理论辩护。

4. 多模态数据分析的统计学之道:从方法拓荒到范式革新

讲者:Yaohua Rong(Beijing University of Technology)

对应论文:未检索到公开论文(以下为基于题目与作者方向的推断)

未检索到公开论文,以下为基于题目与讲者方向的推断。

问题
多模态数据(如文本、图像、基因组、传感器信号)的异质性、高维性与复杂关联给传统统计建模带来根本挑战:如何在同一框架下融合不同模态的分布差异、缺失模式与因果结构?现有方法多依赖深度学习的黑箱拟合,缺乏可解释性与不确定性量化,且难以处理模态间的选择性偏差与混杂效应。报告旨在回答:统计学能否为多模态分析提供一套从数据整合到推断决策的严谨方法论,并推动范式从“特征拼接”转向“结构融合”?

核心方法
讲者可能提出一套基于潜在因子模型张量分解的统计框架。核心思路是将多模态数据视为共享低维潜在结构(如公共因子)与模态特异成分的叠加,通过引入多模态变分贝叶斯正则化典型相关分析(CCA) 实现联合推断。进一步,利用因果图模型刻画模态间的干预关系,例如将图像特征作为文本语义的因果中介,从而在反事实框架下进行跨模态预测与归因。方法本质是“结构先验+不确定性量化”,而非纯预测导向的端到端学习。

与已有工作关系
区别于主流多模态深度学习(如Transformer、多模态对比学习)的“数据驱动”范式,该工作回归统计建模传统:一方面,将多模态CCA、因子分析等经典方法扩展至高维非线性场景,并引入稀疏性与可解释性约束;另一方面,与近期“可解释多模态学习”相比,更强调因果结构而非单纯的相关性,从而在分布偏移下保持稳健性。与贝叶斯非参数方法相比,可能提出更高效的变分推断算法以应对大规模数据。

主要贡献
1. 方法论上,为多模态数据提供了一套从联合建模因果推断的统计工具箱,填补了深度学习与经典统计之间的空白。
2. 理论上,可能给出潜在因子可识别性条件与因果效应估计的渐近性质,为多模态分析提供严谨的统计保证。
3. 实践上,通过真实案例(如医学影像-文本诊断、多组学数据整合)展示范式革新:从“预测准确性”转向“结构可解释性与反事实推理”,为交叉学科研究开辟新路径。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论