A novel agreement statistic using data on uncertainty in ratings¶
作者: Jarcy Zee, Laura Mariani, Laura Barisoni, Parag Mahajan, Brenda Gillespie
来源: Journal of the Royal Statistical Society Series C
主题: 数理统计 / 假设检验
相关性: 3/10
机构绿灯: University of Pennsylvania(US News 前 50,免分进入精读)
链接: https://doi.org/10.1093/jrsssc/qlad063
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向是评分者间一致性(inter-rater agreement)的度量,核心统计问题是:当多个评分者对同一对象(如病理切片)给出分类评级时,如何构造一个统计量,既能反映评分者之间的真实一致性,又能恰当地扣除“纯属偶然”的一致性(chance agreement)。经典方法如Cohen's kappa通过假设模型来估计随机一致性的概率,但该假设的合理性长期存在争议。本文试图通过收集额外的评分者不确定性数据,经验地估计随机一致性概率,从而构造一个更少依赖模型假设的一致性统计量。
发展脉络(history)¶
- 奠基工作:Cohen (1960) 提出Cohen's kappa,将观察一致性减去“在边际分布独立假设下”的期望一致性,再归一化。这是所有后续工作的起点,但其“边际独立”假设(即评分者的边际分布固定且独立)在应用中常被批评为不现实。
- 主要进展:加权kappa与条件kappa。Landis & Koch (1977) 给出了kappa强度的经验性标尺;Fleiss (1971) 推广到多个评分者;Cohen (1968) 提出加权kappa处理有序分类。这些工作都在同一假设框架下改进,未质疑“随机一致性”的模型基础。
- 当前frontier:对“随机一致性”假设的质疑与替代。已有工作(如Gwet, 2008; Brennan & Prediger, 1981)指出,当评分者边际分布高度偏斜时,kappa会低估一致性(即“kappa悖论”)。这些工作尝试用不同模型(如“无偏好假设”)替代边际独立假设,但仍依赖某种模型。
- 本文的位置:作者认为,与其依赖模型假设来估计随机一致性,不如直接收集额外数据——即评分者对自己每个评级的不确定性——来经验估计随机一致性概率。这是首次将“评分者不确定性”作为数据源纳入一致性度量,属于数据驱动替代模型驱动的思路。
子线索聚类¶
- 模型驱动的随机一致性校正:Cohen (1960, 1968), Fleiss (1971), Landis & Koch (1977), Gwet (2008), Brennan & Prediger (1981)。这一簇的核心是:给定一个随机一致性模型(如边际独立、无偏好),计算期望一致性,然后从观察一致性中扣除。
- 数据驱动的随机一致性校正:本文(Zee et al.)。这一簇目前只有本文,其核心是:收集额外数据(评分者不确定性),用这些数据经验估计随机一致性概率,不依赖模型假设。
- 应用驱动的病理学评级:Barisoni et al. (2017, 2020) 等肾脏病理学工作,提供了本文的动机和数据背景。这些工作展示了传统kappa在病理学评级中的局限性(如“kappa悖论”),但未提出统计方法改进。
这个方向在追问的核心问题¶
- 如何恰当地定义“随机一致性”? 不同模型(边际独立、无偏好、条件独立)给出不同定义,哪个更合理?
- 如何估计随机一致性的概率? 模型驱动方法依赖假设,数据驱动方法需要额外数据——额外数据是否可得、是否可靠?
- 新统计量的抽样分布与推断:如何构造标准误、置信区间、假设检验?
- 与经典kappa的比较:新统计量在什么条件下优于kappa?在什么条件下等价或更差?
已知瓶颈:模型驱动方法对边际分布敏感(kappa悖论),但数据驱动方法需要收集额外数据(评分者不确定性),这在实践中可能增加评分负担或引入新的测量误差。
⚠️ 作者的framing¶
作者把缺口frame成:“传统kappa类统计量对随机一致性的假设可能不恰当,而我们可以通过收集额外数据(评分者不确定性)来经验估计随机一致性概率,从而避免模型假设。” 这使得本文成为“显然的下一步”——既然模型假设有问题,那就用数据替代模型。
被淡化或回避的竞争路线: - Gwet (2008) 的AC1统计量(用“无偏好假设”替代边际独立假设)在文中仅被提及为“另一种假设”,未深入比较其与本文方法在什么条件下等价或更优。 - 作者未讨论:如果评分者不确定性数据本身有测量误差(如评分者报告的不确定性不准确),本文方法是否稳健?这可能是未来工作的方向。
什么明显该被引/该存在、却没出现在intro里? - 未引用任何关于“评分者不确定性”的已有文献(如心理学中的“confidence rating”文献)。这可能意味着:① 该领域确实没有将不确定性用于一致性度量的先例;② 作者忽略了相关文献。值得研究者去查:在心理测量学或医学决策中,是否有将评分者置信度用于校正一致性的工作?
张力¶
未见明显对立引用。所有被引工作都在同一框架(模型驱动 vs. 数据驱动)下,但未直接冲突。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
符号: - \( n \):被评对象(如肾活检切片)的数量。 - \( r \):评分者数量(本文考虑 \( r=2 \) 的简单情形,但方法可推广)。 - \( K \):评级类别数量(如“正常”、“轻度”、“中度”、“重度”)。 - \( Y_{ij} \in \{1, \dots, K\} \):评分者 \( j \) 对对象 \( i \) 的评级(可观测)。 - \( U_{ij} \in \{0, 1\} \):评分者 \( j \) 对对象 \( i \) 的评级是否“不确定”(可观测)。\( U_{ij}=1 \) 表示不确定,\( U_{ij}=0 \) 表示确定。 - \( \theta \):真实一致性概率(estimand),即两个评分者在去除随机一致性后,对同一对象给出相同评级的概率。这是本文要估计的目标量。 - \( p_o \):观察一致性概率,即两个评分者实际给出相同评级的概率。 - \( p_c \):随机一致性概率,即两个评分者在“纯属偶然”下给出相同评级的概率。传统方法用模型估计,本文用不确定性数据经验估计。 - \( \kappa \):Cohen's kappa,定义为 \( \kappa = (p_o - p_c) / (1 - p_c) \)。
模型: - 没有显式的概率模型。本文是非参数/半参数的:不对评分者的评级分布做任何参数假设。 - 核心假设(隐含):评分者的不确定性 \( U_{ij} \) 与他们的评级 \( Y_{ij} \) 之间存在某种关系,使得我们可以用 \( U_{ij} \) 来估计 \( p_c \)。具体假设在方法部分明确。
可观测数据: - 研究者实际能观测到的是:每个对象 \( i \),每个评分者 \( j \) 的评级 \( Y_{ij} \) 和不确定性指示 \( U_{ij} \)。 - 想要但观测不到的是:如果评分者不确定,他们“本应”给出的评级是什么?这是潜在量,本文通过假设来绕过。
第二步:讲最小内核¶
最简特例:\( r=2 \) 个评分者,\( K=2 \) 个类别(如“正常” vs. “异常”),且每个评分者对每个对象要么“确定”要么“不确定”。
在这个特例下,本文的核心思路是:
- 观察一致性 \( p_o \):直接计算两个评分者给出相同评级的比例。
- 随机一致性 \( p_c \) 的经验估计:当两个评分者都“不确定”时,他们的评级是“纯属偶然”的——因为不确定意味着他们实际上没有把握,所以他们的评级可以视为随机猜测。因此,只在两个评分者都“不确定”的那些对象上,计算他们给出相同评级的比例,这个比例就是 \( p_c \) 的经验估计。
- 新统计量 \( \hat{\theta} \):\( \hat{\theta} = (p_o - \hat{p}_c) / (1 - \hat{p}_c) \),与kappa形式相同,但 \( \hat{p}_c \) 是经验估计而非模型假设。
为什么这个特例抓住了核心: - 在 \( K=2, r=2 \) 下,所有数学细节都退化为简单的比例计算。 - 核心想法一目了然:用“两个评分者都不确定”的子样本作为随机一致性的“对照实验”。 - 一般情形(\( K>2, r>2 \))只是这个特例的“加壳”:需要处理多类别下的“相同评级”定义、多个评分者时的配对方式、以及当只有一个评分者不确定时的处理。
这个特例下的命题: - 如果假设“当评分者不确定时,其评级是随机的(与真实状态独立)”,那么 \( \hat{p}_c \) 是 \( p_c \) 的无偏估计,从而 \( \hat{\theta} \) 是 \( \theta \) 的无偏估计。 - 证明:在“不确定=随机”假设下,两个评分者都不确定时的评级分布就是随机一致性的分布,因此其观察一致性就是 \( p_c \)。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:提出一个新的评分者间一致性统计量,利用评分者不确定性数据经验估计随机一致性概率,替代传统kappa类统计量的模型假设。
- 核心工具/方法:将评分者不确定性指示 \( U_{ij} \) 作为“随机一致性”的代理变量,只在评分者不确定的子样本上估计 \( p_c \);推导了该统计量的标准误估计量(基于delta method和方差分解)。
- 主要结论:模拟研究表明,在大多数设定下,新统计量对真实一致性概率 \( \theta \) 的估计是无偏的;在肾脏病理学真实数据上,新统计量给出了比kappa更合理的一致性度量(kappa因边际分布偏斜而低估一致性)。
关键设定与假设¶
完整设定(在第二节最小记号基础上补充): - \( r=2 \) 个评分者(论文主要考虑此情形,但方法可推广)。 - \( K \) 个有序或无序类别。 - 每个评分者对每个对象给出一个评级 \( Y_{ij} \) 和一个不确定性指示 \( U_{ij} \in \{0,1\} \)。 - 定义“不确定”为:评分者对自己的评级没有把握,认为可能是随机猜测。
核心假设(论文中明确或隐含): 1. H1(不确定性=随机性):当评分者不确定时(\( U_{ij}=1 \)),其评级 \( Y_{ij} \) 与真实状态独立,即评级是随机的。这是最关键的假设,也是本文方法的基础。 2. H2(不确定性独立性):两个评分者的不确定性是独立的(给定对象)。即 \( U_{i1} \) 和 \( U_{i2} \) 在给定对象 \( i \) 下独立。这个假设用于推导标准误。 3. H3(无测量误差):评分者报告的不确定性 \( U_{ij} \) 是准确的,即没有虚假报告或遗漏。
与已有文献的对比: - 相比Cohen's kappa(假设边际独立),本文的H1更弱(只需要在不确定时随机,不需要整个边际分布独立),但需要额外数据。 - 相比Gwet的AC1(假设无偏好),本文的H1是数据驱动的,不依赖模型。
主要结果¶
定理1(无偏性): - 陈述:在假设H1下,新统计量 \( \hat{\theta} \) 是真实一致性概率 \( \theta \) 的无偏估计。 - 直觉:因为 \( \hat{p}_c \) 在H1下是 \( p_c \) 的无偏估计,而 \( p_o \) 是 \( p_o \) 的无偏估计,所以 \( \hat{\theta} \) 是 \( \theta \) 的无偏估计(因为 \( \theta = (p_o - p_c)/(1-p_c) \))。 - 必要条件:H1成立;样本量 \( n \) 足够大使得 \( \hat{p}_c \) 的分母(两个评分者都不确定的对象数)不为零。 - 解决的技术难点:如何定义“两个评分者都不确定”时的随机一致性?论文通过只在该子样本上计算一致性来绕过模型假设。
定理2(标准误估计): - 陈述:给出了 \( \hat{\theta} \) 的渐近标准误估计量,基于delta method和方差分解。 - 直觉:将 \( \hat{\theta} \) 视为 \( p_o \) 和 \( \hat{p}_c \) 的函数,用delta method得到其渐近方差;\( p_o \) 和 \( \hat{p}_c \) 的协方差通过不确定性独立性假设(H2)来估计。 - 必要条件:H1和H2成立;样本量 \( n \) 足够大。 - 解决的技术难点:\( p_o \) 和 \( \hat{p}_c \) 不是独立的(因为它们共享同一批数据),需要估计它们的协方差。
模拟研究结论: - 在大多数设定下(不同 \( \theta \)、不同不确定性比例、不同边际分布),\( \hat{\theta} \) 的偏差小于0.02,而kappa的偏差可达0.2(当边际分布偏斜时)。 - 当不确定性比例很低(<5%)时,\( \hat{\theta} \) 的方差增大,因为 \( \hat{p}_c \) 的估计基于很少的样本。 - 当H1被违反(即不确定时的评级并非随机)时,\( \hat{\theta} \) 出现偏差,但偏差方向与kappa相反(kappa高估,\( \hat{\theta} \) 低估)。
真实数据例子: - 数据:肾脏病理学家对肾活检切片的描述符评级(如“肾小球硬化程度”),共约200个切片,2个评分者,4个类别。 - 方法应用:收集每个评级的“不确定性”指示(评分者在评级后立即勾选“确定”或“不确定”)。 - 结果:kappa = 0.35(中度一致性),新统计量 \( \hat{\theta} = 0.62 \)(较高一致性)。作者认为新统计量更合理,因为kappa的低值是由于边际分布偏斜(大多数切片被评为“正常”),而新统计量通过不确定性数据校正了这一点。 - 这个例子想说明:在边际分布偏斜时,kappa低估一致性,而新统计量给出更合理的度量。
证明路线与技术技巧¶
整体路线(3-5步逻辑主干): 1. 定义估计量:\( \hat{\theta} = (\hat{p}_o - \hat{p}_c) / (1 - \hat{p}_c) \),其中 \( \hat{p}_o \) 是所有对象上两个评分者给出相同评级的比例,\( \hat{p}_c \) 是只在两个评分者都不确定的对象上两个评分者给出相同评级的比例。 2. 证明无偏性:在H1下,\( \hat{p}_c \) 是 \( p_c \) 的无偏估计(因为“不确定=随机”意味着该子样本的评级分布就是随机一致性的分布);\( \hat{p}_o \) 是 \( p_o \) 的无偏估计(标准结果);因此 \( \hat{\theta} \) 是 \( \theta \) 的无偏估计(因为 \( \theta \) 是 \( p_o \) 和 \( p_c \) 的确定性函数)。 3. 推导标准误:用delta method,将 \( \hat{\theta} \) 视为 \( (\hat{p}_o, \hat{p}_c) \) 的函数,得到 \( \text{Var}(\hat{\theta}) \approx (\partial \theta / \partial p_o)^2 \text{Var}(\hat{p}_o) + (\partial \theta / \partial p_c)^2 \text{Var}(\hat{p}_c) + 2 (\partial \theta / \partial p_o)(\partial \theta / \partial p_c) \text{Cov}(\hat{p}_o, \hat{p}_c) \)。 4. 估计方差分量:\( \text{Var}(\hat{p}_o) \) 用标准二项方差估计;\( \text{Var}(\hat{p}_c) \) 用“两个评分者都不确定”子样本的二项方差估计;\( \text{Cov}(\hat{p}_o, \hat{p}_c) \) 用H2(不确定性独立性)来简化——在H2下,\( \hat{p}_o \) 和 \( \hat{p}_c \) 的协方差只来自那些“两个评分者都不确定”的对象,因为其他对象对 \( \hat{p}_c \) 无贡献。 5. 模拟验证:通过模拟生成不同设定下的数据,比较 \( \hat{\theta} \) 的偏差、方差、覆盖概率与kappa的对应指标。
关键跳跃点: - 最吃劲的引理:证明 \( \hat{p}_c \) 在H1下是 \( p_c \) 的无偏估计。这需要论证“两个评分者都不确定”的子样本确实代表了随机一致性的分布。难点在于:如果评分者的不确定性不是完全随机的(例如,某些对象更容易引起不确定性),这个子样本是否有代表性?论文通过假设H1(不确定时评级随机)来绕过,但未讨论H1被违反时的偏差方向。 - 作者绕过去的办法:没有讨论H1的检验或稳健性,直接假设其成立。这是本文最薄弱的环节。
技术技巧点名: - Delta method:用于从 \( \hat{p}_o \) 和 \( \hat{p}_c \) 的方差推导 \( \hat{\theta} \) 的渐近方差。 - 方差分解:将 \( \text{Var}(\hat{\theta}) \) 分解为 \( \hat{p}_o \) 和 \( \hat{p}_c \) 的方差与协方差之和。 - 子样本估计:只在“两个评分者都不确定”的子样本上估计 \( p_c \),这是本文的核心技巧。
真实例子与应用¶
- 数据:肾脏病理学数据(约200个切片,2个评分者,4个类别)。
- 方法应用:收集每个评级的“不确定性”指示。
- 结果:kappa = 0.35,新统计量 \( \hat{\theta} = 0.62 \)。
- 这个例子想说明:在边际分布偏斜时,kappa低估一致性,而新统计量给出更合理的度量。作者还展示了:如果只考虑“确定”的评级,kappa会更高(0.55),但新统计量仍然高于kappa,说明不确定性数据提供了额外信息。
🔎 结论是否比证明窄¶
- 是。论文在摘要和引言中声称新统计量“在大多数设定下无偏”,但证明只在H1(不确定时评级随机)下成立。模拟研究显示,当H1被违反时(如不确定时的评级偏向某一类别),新统计量出现偏差。作者在讨论中承认了这一点,但未给出H1被违反时的偏差界。
- 具体语句:在讨论部分(第5节),作者写道:“Our method relies on the assumption that when raters are uncertain, their ratings are random. If this assumption is violated, our statistic may be biased.” 但未量化这个偏差。
四、开放问题¶
-
H1的检验与稳健性:如何检验“不确定时评级随机”这一假设?如果H1被违反,新统计量的偏差有多大?能否构造一个对H1违反稳健的版本?——扎根于论文讨论部分:“Our method relies on the assumption that when raters are uncertain, their ratings are random. If this assumption is violated, our statistic may be biased.”
-
多个评分者(\( r>2 \))的推广:当有3个或更多评分者时,如何定义“两个评分者都不确定”的子样本?是否需要考虑所有配对?——扎根于论文未来工作部分:“Extension to more than two raters is straightforward but requires careful definition of the ‘both uncertain’ subset.”
-
不确定性数据的测量误差:如果评分者报告的不确定性不准确(如高估或低估),新统计量是否稳健?能否用重复测量或外部验证来校正?——扎根于论文讨论部分:“We assume that raters accurately report their uncertainty. In practice, this may not hold.”
-
与模型驱动方法的理论比较:在什么条件下,新统计量等价于kappa或AC1?能否给出一个统一的框架,将模型驱动和数据驱动方法作为特例?——扎根于论文引言部分:“Existing methods correct for chance agreement based on different assumptions. Our method uses empirical data instead.” 但未给出理论比较。
Maintained by 陈星宇 · Homepage · Source on GitHub