A Statistical Framework for Alignment with Biased AI Feedback¶
讲者: Zhanrui Cai
会场: Recent Development on High-Dimensional Data Modeling
报告题目: A Statistical Framework for Alignment with Biased AI Feedback
链接: arXiv
来源: JCSDS 2026 · 返回会议总览
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向的核心问题是:如何利用大量廉价但有偏的AI反馈(LLM-as-a-Judge)与少量昂贵但准确的人类反馈,高效且统计上可靠地对大型语言模型(LLM)进行偏好对齐(alignment)。当前,LLM对齐的主流范式是“从人类反馈中强化学习”(RLHF),但人类标注成本高昂。因此,业界和学界正转向“从AI反馈中强化学习”(RLAIF),即用LLM作为裁判(LLM-as-a-Judge)自动生成偏好标签。然而,AI裁判存在系统性偏差(如位置偏差、冗长偏差、自我增强偏差),直接使用会导致模型与真实人类偏好“错位”(misalignment)。本文试图在统计框架下解决这一偏差校正问题,其成熟度处于“方法提出+理论分析+实验验证”的早期阶段,尚未形成公认的标准化解决方案。
发展脉络(history)¶
-
奠基工作:RLHF范式的确立。Christiano et al. (2017) 首次提出从人类偏好中进行深度强化学习,通过人类对轨迹片段的比较来训练奖励模型,再用PPO优化策略。Schulman et al. (2017) 提出的PPO成为RLHF中策略优化的标准算法。Ouyang et al. (2022) 将RLHF成功应用于指令微调(InstructGPT),奠定了现代LLM对齐的“预训练→SFT→RLHF”三阶段流水线。
-
主要进展:从奖励模型到直接偏好优化。Rafailov et al. (2023) 提出的DPO是一个关键突破:它利用Bradley-Terry(BT)偏好模型下最优策略的闭式解,将对齐问题简化为一个分类损失,绕过了显式奖励模型拟合和PPO的复杂优化。Azar et al. (2024) 提出的IPO则更进一步,直接最大化正则化的偏好概率,不依赖BT模型假设,提供了更通用的理论框架。这两项工作使偏好优化变得计算上轻量且稳定。
-
当前frontier:AI反馈的引入与偏差问题。Zheng et al. (2023) 和 Liu et al. (2023) 系统性地研究了“LLM-as-a-Judge”范式,发现强LLM裁判(如GPT-4)能与人类判断达到80%以上的一致性,但也揭示了位置、冗长、自我增强等系统性偏差。Wu et al. (2025) 和 Yu et al. (2025) 进一步探索了用LLM自我改进对齐(如Meta-Rewarding),但未从统计上处理偏差。Xu et al. (2025) 提出了“双重稳健偏好优化”(DRPO),在偏好模型或参考策略之一正确指定时保持一致性,但该工作仍假设偏好标签来自人类或已校正的AI。
-
本文的位置:本文是第一个将“有偏AI反馈”与“有限人类反馈”的结合问题形式化为一个统计去偏问题,并给出理论保证(次优性界、半参数效率界)的工作。它借鉴了预测驱动推断(PPI, Angelopoulos et al., 2023a,b)的思想,但将其扩展到存在分布漂移(response generation policy不同)的场景,并针对DPO和IPO两种主流对齐目标分别设计了去偏方法。
子线索聚类¶
这些被引文献大致落在三条子线索上:
- 线索一:偏好优化算法设计。包括DPO (Rafailov et al., 2023)、IPO (Azar et al., 2024)、Sampled IPO (Azar et al., 2024)、DRPO (Xu et al., 2025)。这一簇的核心是设计新的目标函数或优化算法,以简化RLHF流程或提高鲁棒性。它们通常假设偏好标签是准确的(人类或已校正的AI)。
- 线索二:LLM-as-a-Judge的实证与偏差分析。包括Zheng et al. (2023)、Liu et al. (2023)、Wu et al. (2025)、Yu et al. (2025)。这一簇通过实验揭示AI裁判的偏差模式,并尝试通过提示工程(如CoT)或模型选择来缓解,但缺乏统计上的偏差校正理论。
- 线索三:结合有偏与无偏数据的统计推断。包括PPI (Angelopoulos et al., 2023a) 和 PPI++ (Angelopoulos et al., 2023b)。这一簇为“用少量真实标签校正大量有偏预测”提供了通用统计框架,但主要针对均值、分位数、回归系数等参数的推断,且假设数据同分布。本文是这一线索在LLM对齐问题上的首次应用和扩展。
这个方向在追问的核心问题¶
- 如何量化并校正AI裁判的系统性偏差? 当前主流方法是直接使用AI标签或简单混合,缺乏理论指导。
- 在有限人类数据下,如何最优地结合大量有偏AI数据? 需要回答“多少人类数据足够”、“AI数据质量多高才有用”等定量问题。
- 去偏后的对齐方法是否仍能保持计算效率(如DPO的简洁性)? 去偏过程不应引入过高的计算开销。
- 去偏方法是否具有统计最优性(如达到半参数效率界)? 这是统计学家关心的核心问题。
已知瓶颈:AI偏差的复杂性和不可预测性;人类数据与AI数据生成分布可能不同(distribution shift);偏好优化目标(如DPO)本身对模型假设(如BT模型)的敏感性。
⚠️ 作者的 framing¶
作者将缺口 frame 成:“AI反馈有偏,但可以通过统计去偏框架,用少量人类数据校正大量AI数据,从而恢复接近全人类数据对齐的性能。” 作者通过将问题类比为“有偏测量+少量无偏测量”的统计问题,并借鉴PPI框架,使自己的方法成为“显然的下一步”。
被淡化或回避的竞争路线: - 更复杂的AI裁判:作者没有深入讨论“训练一个更好的、偏差更小的AI裁判”这条路线(如Meta-Rewarding, Wu et al., 2025),而是接受AI裁判有偏的事实,专注于事后校正。 - 主动学习:作者没有讨论如何自适应地选择哪些样本需要人类标注(active learning),而是假设人类数据是随机给定的。 - 非BT模型假设:DDPO依赖BT模型假设,作者虽然用DIPO作为补充,但DIPO的实证表现并未显著优于DDPO,且计算更复杂。
什么明显该被引/该存在、却没出现在intro里? - 关于“统计-计算权衡”的文献:本文提出的DDPO和DIPO都是多项式时间算法,但未讨论是否存在更优但计算不可行的方案,也未讨论信息-计算差距。这与研究者(陈星宇)的“statistical-computational tradeoff”兴趣点直接相关,但论文完全未触及。 - 关于“高阶U-统计量”或“张量收缩”的文献:本文的DIPO方法涉及对偏好概率的估计,其估计量(如公式3.6)本质上是U-统计量。但作者未引用任何U-统计量理论(如Hoeffding分解),也未讨论其计算复杂度。这与研究者的高阶U-统计量工作有潜在联系,但论文未建立连接。
张力¶
未见明显对立引用。所有被引工作基本在“RLHF有效但昂贵→DPO简化→AI反馈引入偏差→需要校正”这一叙事线上是连贯的。唯一的潜在张力在于:DPO(依赖BT模型)与IPO(不依赖BT模型)之间的选择,但本文通过同时提出DDPO和DIPO来调和,而非对立。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
X:提示(prompt),随机变量,服从分布P_X。Y^(1),Y^(2):针对同一提示X生成的两个候选响应(response),随机变量。Z:人类偏好标签,Z = 1表示人类更偏好Y^(1)而非Y^(2),否则为0。Z服从条件分布P(Z=1 | X, Y^(1), Y^(2)) = g(Y^(1), Y^(2) | X)。Ẑ:AI裁判给出的偏好标签,Ẑ = 1表示AI更偏好Y^(1)。Ẑ服从条件分布P(Ẑ=1 | X, Y^(1), Y^(2)) = \tilde{g}(Y^(1), Y^(2) | X)。r(X, Y):潜在的人类奖励函数(latent reward),是待估的参数/estimand。π(Y|X):待学习的LLM策略(policy),即给定提示X生成响应Y的条件概率分布。这是要优化的对象。π_ref(Y|X):固定的参考策略(reference policy),通常是SFT后的模型。π^Hum_Gen(Y|X):生成人类标注数据中响应对的策略。π^AI_Gen(Y|X):生成AI标注数据中响应对的策略。它们可能不同。β:KL正则化强度,超参数。n:人类标注数据样本量。N:AI标注数据样本量(通常N >> n)。w(Y^(1), Y^(2) | X):密度比(density ratio),用于校正π^Hum_Gen和π^AI_Gen之间的分布漂移。
-
模型:
- Bradley-Terry (BT) 偏好模型:假设人类偏好由潜在奖励函数
r通过逻辑斯蒂函数决定:P(Z=1 | X, Y^(1), Y^(2)) = σ(r(X, Y^(1)) - r(X, Y^(2))),其中σ(t) = 1/(1+exp(-t))。这是DPO及其变体的基础。 - KL-正则化策略优化:对齐的目标是找到一个策略
π,最大化期望奖励,同时用KL散度约束其与参考策略π_ref的距离:max_π E_{X,Y~π}[r(X,Y)] - β * KL(π || π_ref)。
- Bradley-Terry (BT) 偏好模型:假设人类偏好由潜在奖励函数
-
可观测数据:
- 人类标注数据
D_Human = {(X_i, Y_i^(1), Y_i^(2), Z_i)}_{i=1}^n。研究者能观测到提示、两个响应、以及人类给出的真实偏好标签。 - AI标注数据
D_AI = {(X_i, Y_i^(1), Y_i^(2), Ẑ_i)}_{i=n+1}^{n+N}。研究者能观测到提示、两个响应、以及AI裁判给出的有偏偏好标签。 - 不可观测量:潜在奖励函数
r(X,Y)和真实的人类偏好概率g是不可观测的,只能通过假设(如BT模型)和观测到的Z来识别。AI裁判的偏差\tilde{g} - g也是不可直接观测的,但可以通过比较Ẑ和Z来估计。
- 人类标注数据
第二步:讲最小内核¶
本文的核心思路可以用一个最简特例来理解:二值偏好、单提示、线性奖励、无分布漂移。
-
最简设定:
- 只有一个提示
X(即P_X是退化分布),因此忽略X。 - 奖励函数是线性的:
r(Y) = θ^T φ(Y),其中φ(Y)是响应Y的特征向量,θ是未知参数。 - 人类偏好严格遵循BT模型。
- 人类数据和AI数据的响应生成策略相同:
π^Hum_Gen = π^AI_Gen,因此密度比w = 1。 - 我们有一个巨大的AI标注数据集
D_AI = {(Y_i^(1), Y_i^(2), Ẑ_i)}_{i=1}^N和一个很小的人类标注数据集D_Human = {(Y_i^(1), Y_i^(2), Z_i)}_{i=1}^n。
- 只有一个提示
-
核心问题:如何用
D_AI和D_Human来估计θ(从而得到最优策略π*),使得估计量比只用D_Human更准,且比只用D_AI更无偏? -
DDPO的核心思路(在这个特例下):
- 用AI数据估计一个有偏的
θ:在DPO框架下,我们可以用D_AI最小化损失L_AI(θ),得到\hat{θ}_AI。由于Ẑ有偏,\hat{θ}_AI是θ*的有偏估计。 - 用人类数据估计偏差:在
D_Human上,我们可以计算AI标签Ẑ和人类标签Z的差异。具体地,我们可以计算损失函数的“偏差项”:Bias(θ) = E_{D_Human}[ℓ(θ; Ẑ) - ℓ(θ; Z)]。这个偏差项衡量了在人类数据分布下,使用AI标签代替人类标签所引入的平均损失差异。 - 去偏:构造一个去偏的损失函数
L_Debiased(θ) = L_AI(θ) - \hat{Bias}(θ),其中\hat{Bias}(θ)是用D_Human估计的偏差项。然后最小化L_Debiased(θ)得到\hat{θ}_DDPO。
- 用AI数据估计一个有偏的
-
为什么有效?
L_AI(θ)的方差小(因为N大),但偏差大。\hat{Bias}(θ)的方差大(因为n小),但期望是真实偏差。- 两者相减,偏差被抵消,而方差由
n和N共同决定。当N >> n时,L_Debiased(θ)的方差主要由L_AI(θ)的方差主导(即O(1/N)),而偏差被降低到O(1/n)的量级(取决于AI与人类的一致性)。这比只用人类数据(方差O(1/n))更高效。
-
DIPO的核心思路(在这个特例下):
- 目标不是估计
θ,而是直接估计偏好概率P(π ≻ π_ref)。 - 用AI数据得到一个有偏的估计
\hat{P}_AI(π)。 - 用人类数据估计偏差
\hat{Bias}_P(π) = E_{D_Human}[Ẑ - Z](经过重要性加权校正分布漂移)。 - 去偏:
\hat{P}_DIPO(π) = \hat{P}_AI(π) - \hat{Bias}_P(π)。 - 然后最大化
\hat{P}_DIPO(π) - β * KL(π || π_ref)得到\hat{π}_DIPO。
- 目标不是估计
这个最小内核清晰地展示了本文的核心数学操作:用少量无偏数据估计一个“偏差校正项”,然后从大量有偏数据的估计量中减去它。论文的一般情形只是在这个内核上增加了处理分布漂移的密度比加权、处理复杂偏好模型的IPO框架、以及更精细的理论分析。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在LLM对齐中,如何利用大量有偏的AI反馈(LLM-as-a-Judge)和少量准确的人类反馈,统计上最优地恢复与人类偏好一致的策略。
- 核心工具/方法:提出了两种去偏方法——DDPO(基于DPO,通过残差校正和密度比加权)和DIPO(基于IPO,直接估计偏好概率并校正偏差),并借鉴了预测驱动推断(PPI)和双重机器学习(DML)的思想。
- 主要结论:DDPO和DIPO均能有效消除AI偏差,在情感生成、摘要、对话三个任务上显著优于简单混合基线,接近全人类数据训练的Oracle模型;DIPO在理论上达到了半参数效率界,具有统计最优性。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
- 数据生成:提示
X ~ P_X。响应Y^(1), Y^(2) ~ π^AI_Gen(·|X)(用于AI数据)或~ π^Hum_Gen(·|X)(用于人类数据)。偏好标签Z ~ g(·|X, Y^(1), Y^(2))(人类),Ẑ ~ \tilde{g}(·|X, Y^(1), Y^(2))(AI)。 - 核心假设:
- Assumption 1 (Reward realizability):最优奖励函数
r*可以被策略类Π中的某个策略π通过r*(X,Y) = β log(π(Y|X)/π_ref(Y|X)) + β W(X)表示。这是DPO等价于PPO的基础。 - Assumption 2 (Boundedness):
π_ref和密度比w一致有界且远离0。这是重要性加权和off-policy评估的标准“重叠”条件(overlap condition),类似因果推断中的positivity。 - Assumption 3 (Model complexity):策略类
Π是VC型类,VC维为v。用于控制经验过程的收敛速度。 - Assumption 4 (Alignment between AI and human):AI与人类偏好的不一致概率
P(Z ≠ Ẑ | X, Y^(1), Y^(2)) = O_p(ν_n)。ν_n越小,AI越准,所需人类数据越少。 - Assumption 5 (Weak coverage):
π/π^Hum_Gen和π_ref/π^Hum_Gen一致有界。这是DIPO的“弱重叠”条件,比DDPO的Assumption 2更弱,因为DIPO不需要π_ref本身有界。 - Assumption 6 (Policy realizability):最优策略
π*在策略类Π中。
- Assumption 1 (Reward realizability):最优奖励函数
相比已有文献的强化或放宽:
- 相比标准DPO/IPO,本文新增了Assumption 4(AI偏差量化)和密度比估计(处理分布漂移)。
- 相比PPI,本文放宽了同分布假设,允许 π^Hum_Gen ≠ π^AI_Gen,并通过密度比 w 校正。
- DIPO的Assumption 5比DDPO的Assumption 2更弱,体现了DIPO在理论上的更广适用性。
主要结果¶
-
Theorem 1 (DDPO的次优性界):
- 陈述:DDPO策略
\hat{π}_DDPO与Oracle最优策略π*的期望奖励差距为O( (1/(βϵ)) * sqrt(v/N) + (1/(βϵ)) * sqrt(v * ν_n / n) + (1/(βϵ)) * ν_n^(1/2) * ||\hat{w} - w||_2 )。 - 直觉:第一项来自AI数据量
N的估计误差;第二项是偏差校正项,其大小取决于人类数据量n和AI与人类的不一致率ν_n。当ν_n很小时,第二项远小于O(1/sqrt(n)),说明少量人类数据即可有效校正偏差。第三项是密度比估计误差的影响,当生成策略已知时消失。 - 必要条件:Assumptions 1-4。
- 解决的技术难点:将PPI框架扩展到存在分布漂移和策略优化问题的场景,并推导出依赖
ν_n的精细上界。
- 陈述:DDPO策略
-
Theorem 2 (DIPO的渐近展开):
- 陈述:DIPO的偏好概率估计量
\hat{P}_DIPO(π)可以展开为三个主项(AI数据估计、人类数据校正、AI方差项)和一个余项R。余项R由||\tilde{g} - g||和||π^Hum_Gen / \hat{π}^Hum_Gen - 1||的乘积等高阶项控制。 - 直觉:这个展开揭示了DIPO的“双重稳健”性质:只要AI评估模型
\tilde{g}或人类生成策略π^Hum_Gen之一被正确指定(或估计误差足够小),余项R就会很小。 - 必要条件:Assumptions 4, 5, 6。
- 解决的技术难点:推导出DIPO估计量的影响函数(influence function)展开,这是证明其半参数效率的关键。
- 陈述:DIPO的偏好概率估计量
-
Corollary 1 (DIPO的效率增益):
- 陈述:在
N > n且AI评估足够准确的条件下,DIPO的均方误差(MSE)严格小于仅使用人类数据的IPO。当N >> n时,DIPO达到半参数效率界。 - 直觉:DIPO通过引入大量AI数据,在不增加偏差的前提下,显著降低了估计量的方差,从而实现了统计效率的提升。这是PPI框架的核心优势在偏好优化问题上的体现。
- 陈述:在
-
Theorem 3 (DIPO的遗憾界):
- 陈述:DIPO策略
\hat{π}_DIPO与Oracle最优策略π*的偏好概率差距为O( β + sqrt(v * (1/n + 1/N)) + v * (1/n + 1/N) + ||π^Hum_Gen / \hat{π}^Hum_Gen - 1|| * ||\tilde{g} - g|| )。 - 直觉:遗憾界由KL正则化强度
β、策略类复杂度v和样本量(n, N)共同决定。最关键的是,AI评估误差和生成策略估计误差的影响以乘积形式出现,这意味着只要其中一个误差很小,其整体影响就可忽略。这比DDPO的次优性界(其中密度比估计误差单独出现)更鲁棒。
- 陈述:DIPO策略
证明路线与技术技巧¶
-
整体路线(以DDPO为例):
- 定义去偏损失:
L_DDPO(π) = L_AI(π) - (L_AI^Hum(π) - L_Hum(π)),其中L_AI^Hum是在人类数据上评估的AI损失。 - 分解次优性:将
L_DDPO(π*) - L_DDPO(\hat{π})分解为“估计误差”和“偏差校正误差”。 - 控制估计误差:利用VC理论(Assumption 3)控制
L_AI(π)在π上的均匀收敛速度,得到O(sqrt(v/N))。 - 控制偏差校正误差:将偏差校正项
(L_AI^Hum(π) - L_Hum(π))分解为“真实偏差”和“估计偏差”。真实偏差由AI与人类的不一致率ν_n控制。估计偏差由人类数据量n和密度比估计误差||\hat{w} - w||控制。 - 合并:通过三角不等式和选优(oracle inequality)得到最终的次优性界。
- 定义去偏损失:
-
关键跳跃点:
- DDPO:如何将AI偏差的校正转化为一个可估计的“损失差异”项,并证明其收敛速度。这借鉴了PPI的核心思想,但需要处理策略优化(而非参数推断)带来的复杂性。
- DIPO:如何推导出偏好概率估计量的影响函数(Lemma 1),并证明DIPO的渐近展开(Theorem 2)和半参数效率(Corollary 1)。这需要熟练运用半参数理论中的“双稳健”估计和影响函数技巧。
-
技术技巧点名:
- Empirical process / VC theory:用于控制策略类
Π上的均匀收敛速度(Theorem 1, 3)。 - Influence function / Semiparametric efficiency theory:用于推导DIPO的最优性(Lemma 1, Corollary 1)。
- Double/debiased machine learning (DML):DIPO的偏差校正项结构(Theorem 2的余项
R是乘积形式)体现了DML的“Neyman orthogonality”性质,使得对\tilde{g}和π^Hum_Gen的估计误差不占主导。 - Sample splitting:用于保证密度比估计量
\hat{w}与主评估样本独立(Algorithm 1, 2),这是简化理论分析的标准技巧。 - Importance weighting / Density ratio:用于校正
π^Hum_Gen和π^AI_Gen之间的分布漂移。
- Empirical process / VC theory:用于控制策略类
真实例子与应用¶
本文包含三个真实数据实验:
-
Controlled Sentiment Generation (IMDb):
- 数据/场景:IMDb电影评论数据集。任务是根据前缀生成正面情感评论。
- 方法应用:用
gpt-neo-125m做SFT,gpt-4o-mini作为人类偏好代理(proxy)。通过随机翻转40%的标签模拟AI偏差。20%数据保留真实标签作为D_Human。 - 结果:DDPO的平均情感得分(0.9748)和胜率(93.30%)显著优于简单混合的DPO(0.8851, 83.92%),接近Oracle DPO(0.9882, 96.14%)。DIPO及其变体DIPO+也类似地优于IPO基线。
- 说明:验证了在简单任务上,去偏方法能有效恢复接近Oracle的性能。
-
Summarization (TL;DR):
- 数据/场景:Reddit帖子摘要任务。使用
Qwen2.5-1.5B和summarize-from-feedback数据集。 - 方法应用:类似地模拟偏差。用
gpt-4o-mini评估胜率。 - 结果:DDPO在温度0.1和1.0下的胜率(78.82%, 63.88%)均优于DPO(65.00%, 45.50%),接近Oracle(80.37%, 62.09%)。DIPO也表现一致。
- 说明:验证了方法在更复杂的文本生成任务上的有效性。
- 数据/场景:Reddit帖子摘要任务。使用
-
Single-Turn Dialogue (Anthropic HH):
- 数据/场景:Anthropic Helpful and Harmless对话数据集。
- 方法应用:类似地模拟偏差。
- 结果:DDPO和DIPO均优于各自基线,接近Oracle。
- 说明:验证了方法在对话任务上的泛化能力。
此外,作者还进行了更真实的偏差模拟实验(Tables 4, 8):用不同能力的LLM(如 Qwen3-30B vs Qwen3-1.7B)分别作为高质量和低质量标注者,模拟真实场景中的AI偏差。结果依然支持DDPO和DIPO的有效性。
🔎 结论是否比证明窄¶
- Theorem 1 (DDPO次优性界) 的证明依赖于Assumption 1(Reward realizability),即假设DPO的闭式解成立。但在实践中,BT模型假设可能不成立,此时DDPO的理论保证会减弱。论文在结论部分承认了这一点,并指出DIPO不依赖此假设。
- Corollary 1 (DIPO效率增益) 的成立需要
||\tilde{g} - g|| = o(1)和||π^Hum_Gen / \hat{π}^Hum_Gen - 1|| = o(1),即AI评估和生成策略估计都必须一致。如果AI偏差是“固定”的(即不随样本量增加而消失),则DIPO可能无法达到半参数效率界。论文在Theorem 2的余项中包含了这些误差项,但Corollary 1的陈述可能过于乐观。 - 实证部分:所有实验中的“人类偏好”实际上都是由强LLM(如
gpt-4o-mini)代理的,而非真实人类。论文在实验设置中明确说明了这一点,但结论中“接近全人类数据训练的Oracle模型”的说法,其“全人类数据”实际上也是LLM代理的。因此,实验结果只能证明方法能校正“弱LLM”相对于“强LLM”的偏差,而不能直接证明能校正“LLM”相对于“真实人类”的偏差。这是一个重要的局限性。
四、开放问题¶
-
扩展到多轮对话和长程RL:本文的方法主要针对单轮偏好。作者在结论中明确指出“Extending the proposed debiasing framework to multi-turn dialogue and long-horizon reinforcement learning is an important challenge”。这需要处理序列决策中的累积偏差和信用分配问题,是一个自然的扩展方向。(扎根于论文Section 6第一句)
-
放松人类数据独立同分布的假设:作者提到“relaxing the assumption that human-labeled comparisons are independently obtained”。在实践中,人类标注可能来自不同标注者、存在时间相关性或选择偏差。如何在这种更复杂的数据结构下进行去偏,是一个开放问题。(扎根于论文Section 6第二句)
-
自适应/主动数据收集策略:作者提到“Incorporating adaptive or active data collection strategies”。当前方法假设人类数据是随机给定的。一个更高效的方法是主动选择那些AI最不确定或偏差最大的样本请求人类标注,从而最大化有限人类数据的价值。这与研究者的“statistical-computational tradeoff”兴趣点有潜在联系。(扎根于论文Section 6第三句)
-
信息-计算差距:本文提出的DDPO和DIPO都是多项式时间算法。是否存在一个统计上更优(例如,达到更小的minimax风险)但计算上不可行(例如,需要指数时间)的去偏方案?这个问题在本文中完全没有被讨论,但对于一个关注“统计-计算权衡”的研究者来说,这是一个非常自然的追问。可以确认这是否是一个真gap:去读近期关于“computationally constrained RLHF”或“information-computation gap in preference learning”的文献。
Maintained by 陈星宇 · Homepage · Source on GitHub