Order statistics approaches to unobserved heterogeneity in auctions¶
作者: Yao Luo, Peijun Sang, Ruli Xiao
来源: Electronic Journal of Statistics
主题: 经济理论 / 应用
相关性: 7/10
链接: 期刊页 · arXiv
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的根本问题是:在拍卖模型中,如何从可观测的投标数据中,非参数地识别并估计不可观测的异质性(unobserved heterogeneity, UH)。这里的“不可观测异质性”指的是影响所有投标人估值的、拍卖场次特有的共同因素(如拍卖品的真实质量、市场情绪),它既影响投标行为,又无法被研究者直接观测到。如果不控制这种异质性,对投标人私人价值(private value)分布的估计会产生严重偏误。该子方向当前处于“方法成熟但应用受限”的阶段——已有多种识别策略(如基于重复拍卖、基于工具变量、基于高阶统计量),但大多依赖强参数假设或特殊数据结构,本文试图在更弱的条件下实现非参数识别。
发展脉络(history)¶
- 奠基工作:参数模型与重复拍卖
- Athey & Haile (2002):建立了拍卖模型非参数识别的理论基础,指出在独立私人价值(IPV)模型中,仅凭单次拍卖的投标数据无法非参数识别私人价值分布,必须依赖重复拍卖或外生变化。
-
Li, Perrigne & Vuong (2000):在参数框架下引入不可观测异质性,假设UH服从参数分布(如对数正态),通过重复拍卖的投标数据联合估计UH与私人价值分布。这是早期主流方法,但参数假设的合理性常受质疑。
-
主要进展:非参数识别与工具变量方法
- Krasnokutskaya (2009):首次在可加可分离的UH设定下实现非参数识别。她假设投标价可分解为UH与私人价值的乘积(或和),利用重复拍卖中同一UH影响所有投标人的事实,通过协方差结构分离两者。这是里程碑式的工作,但可分离性假设在应用中常被批评为过于严格。
-
Asker & Cantillon (2008) 与 Roberts (2013):分别利用外生变量(如拍卖品特征、竞拍人数)作为工具变量来识别UH。这些方法需要研究者能找到有效的工具变量,这在许多实际场景中并不容易。
-
当前frontier:不可分离UH与高阶统计量方法
- Guerre, Perrigne & Vuong (2000):建立了IPV模型下私人价值分布的非参数识别与估计框架(即“GPV方法”),但该框架假设无UH。
- 本文作者(Luo, Sang & Xiao, 2023):在连续且不可分离的UH设定下,利用三个连续订单统计量实现非参数识别。这是对Krasnokutskaya (2009) 的重要推广——不再要求UH与私人价值可分离,而是利用订单统计量的联合分布结构来“消去”UH的影响。
- 本文的位置:作者将自身定位为“在不可分离UH设定下,首次实现非参数识别与估计”的工作,填补了从可分离到不可分离的缺口。
子线索聚类¶
- 线索一:参数/半参数方法(Li et al., 2000; 其他早期工作)——假设UH服从参数分布,通过MLE或GMM估计。优点是计算简单,缺点是参数假设可能错误。
- 线索二:可分离UH的非参数方法(Krasnokutskaya, 2009; 后续扩展)——利用可分离结构,通过协方差或分位数回归识别。优点是无需参数假设,缺点是可分离性太强。
- 线索三:工具变量方法(Asker & Cantillon, 2008; Roberts, 2013)——依赖外生变量。优点是灵活,缺点是工具变量的存在性和有效性常存疑。
- 线索四:订单统计量方法(本文)——利用三个连续订单统计量,不依赖可分离性或工具变量。这是最新的子线索,目前文献中仅有本文及其直接前身。
这个方向在追问的核心问题¶
- 识别问题:在仅有单次拍卖的横截面数据(即每个拍卖场次只有一组投标价)时,能否非参数识别UH与私人价值的联合分布?
- 估计问题:在识别的基础上,如何构造收敛速率最优的估计量?
- 应用问题:在真实拍卖数据中,忽略UH会导致多大的收益损失?如何设计接近最优的保留价策略?
- 当前瓶颈:大多数非参数识别策略要么依赖强结构假设(可分离性),要么需要特殊数据(重复拍卖、工具变量)。本文试图打破这些瓶颈,但代价是需要至少三个投标人(因为要用到三个订单统计量),且估计量收敛速率受维数诅咒影响。
⚠️ 作者的framing¶
- 作者把缺口frame成:“现有非参数识别方法要么要求UH与私人价值可分离(Krasnokutskaya, 2009),要么需要工具变量(Roberts, 2013)。我们首次在不可分离设定下实现非参数识别,仅需三个连续订单统计量。”
- 被淡化/回避的竞争路线:作者未深入讨论参数方法(如Li et al., 2000)在有限样本下的表现——参数方法虽然假设强,但在样本量小时可能比非参数方法更稳定。此外,作者未提及贝叶斯非参数方法(如Dirichlet过程混合模型),这类方法也能处理不可分离UH,但计算成本高。
- 什么明显该被引/该存在、却没出现在intro里:
- Halle, Hong & Shum (2003) 关于拍卖模型非参数识别的综述——本文的识别策略本质上是该综述中“利用高阶统计量”思路的一个具体实现,但作者未引用。
- Athey & Haile (2007) 关于非参数识别在拍卖中的应用——该文讨论了订单统计量在识别中的作用,与本文直接相关。
- Fox, Kim & Yang (2016) 关于不可分离UH的贝叶斯非参数方法——这是竞争方法,作者未提及。
- 值得研究者去查:这些缺失的引用是否意味着作者刻意回避了某些竞争方法?还是这些方法确实不直接相关?建议去读Halle et al. (2003) 和 Athey & Haile (2007),看他们是否已讨论过类似识别策略。
张力¶
未见明显对立引用。所有被引工作基本沿着“从参数到非参数、从可分离到不可分离”的渐进路线发展,彼此之间没有根本性矛盾。唯一的潜在张力是:参数方法(Li et al., 2000)的支持者可能会质疑非参数方法在有限样本下的实用性,但本文未直接回应这一点。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据交代清楚¶
符号:
- \( N \):拍卖场次数量(样本量)。
- \( I \):每场拍卖的投标人数(假设固定且已知,本文假设 \( I \geq 3 \))。
- \( v_{i,t} \):第 \( t \) 场拍卖中第 \( i \) 个投标人的私人价值(private value),是投标人自己的估值,研究者不可观测。
- \( u_t \):第 \( t \) 场拍卖的不可观测异质性(UH),是一个标量随机变量,影响所有投标人的估值,研究者不可观测。
- \( b_{i,t} \):第 \( t \) 场拍卖中第 \( i \) 个投标人的投标价(bid),是研究者可观测的。
- \( b_{(k),t} \):第 \( t \) 场拍卖中第 \( k \) 个订单统计量(即第 \( k \) 小的投标价),\( k = 1, \dots, I \)。
- \( F_{v|u}(\cdot|u) \):给定 \( u \) 时私人价值的条件分布函数。
- \( F_{b|u}(\cdot|u) \):给定 \( u \) 时投标价的条件分布函数。
- \( G_u(\cdot) \):UH的边际分布函数。
- \( F_{v,u}(\cdot, \cdot) \):私人价值与UH的联合分布函数(目标 estimand)。
- \( F_v(\cdot) \):私人价值的边际分布函数(目标 estimand)。
- \( \theta \):模型参数(在筛MLE中为筛系数向量)。
模型:
- 数据生成机制:采用独立私人价值(IPV)模型,即每个投标人的私人价值 \( v_{i,t} \) 独立同分布(给定 \( u_t \)),且投标人之间没有合谋或信息泄露。
- 投标策略:在一级价格密封拍卖(first-price sealed-bid auction)中,投标人根据其私人价值和UH选择投标价。均衡投标策略由 \( b_{i,t} = s(v_{i,t}, u_t) \) 给出,其中 \( s(\cdot, \cdot) \) 是严格递增的投标函数(在 \( v \) 和 \( u \) 上均单调)。
- 关键假设:
- 不可分离性:\( s(v, u) \) 不能写成 \( s_1(v) + s_2(u) \) 或 \( s_1(v) \cdot s_2(u) \) 的形式——即UH与私人价值对投标价的影响是非可加、非可乘的。
- 连续性:\( v \) 和 \( u \) 的分布是连续的,且投标函数 \( s \) 是光滑的。
- 独立性:\( u_t \) 与 \( v_{i,t} \) 独立(给定拍卖场次特征?本文假设 \( u_t \) 与 \( v_{i,t} \) 独立,但 \( u_t \) 影响所有投标人的投标价)。
- 要估的对象:联合分布 \( F_{v,u} \),以及由此导出的条件分布 \( F_{v|u} \) 和边际分布 \( F_v \)。
可观测数据:
- 研究者能观测到的是:\( \{ b_{(1),t}, b_{(2),t}, \dots, b_{(I),t} \}_{t=1}^N \),即每场拍卖中所有投标价的订单统计量。
- 不可观测:私人价值 \( v_{i,t} \) 和 UH \( u_t \) 均不可观测。
- 关键识别困难:由于 \( u_t \) 不可观测,且影响所有投标价,直接使用 \( b_{i,t} \) 的边际分布会混淆 \( u_t \) 和 \( v_{i,t} \) 的效应。例如,一个高的投标价可能是由于高的私人价值,也可能是由于高的UH(如拍卖品质量好),两者无法区分。
第二步:最小内核¶
最简特例:假设每场拍卖恰好有 \( I = 3 \) 个投标人,且我们只关心识别问题(而非估计)。在这个特例下,本文的核心思路是:
命题(识别):在IPV模型下,给定三个连续订单统计量 \( (b_{(1)}, b_{(2)}, b_{(3)}) \) 的联合分布,可以唯一确定UH的分布 \( G_u \) 和私人价值的条件分布 \( F_{v|u} \)。
为什么三个就够了?
- 在IPV模型中,给定 \( u \),投标价 \( b_i \) 的条件分布 \( F_{b|u} \) 与私人价值的条件分布 \( F_{v|u} \) 通过投标函数 \( s \) 一一对应。因此,识别 \( F_{v|u} \) 等价于识别 \( F_{b|u} \)。
- 问题转化为:从可观测的 \( (b_{(1)}, b_{(2)}, b_{(3)}) \) 的联合分布中,能否恢复 \( F_{b|u} \) 和 \( G_u \)?
- 关键观察:给定 \( u \),三个订单统计量 \( b_{(1)}, b_{(2)}, b_{(3)} \) 的条件联合分布完全由 \( F_{b|u} \) 决定(因为它们是独立同分布样本的订单统计量)。因此,\( (b_{(1)}, b_{(2)}, b_{(3)}) \) 的无条件联合分布是 \( F_{b|u} \) 和 \( G_u \) 的混合:
- 识别策略:这是一个经典的非参数混合模型——从混合分布中恢复混合成分(\( f_{b|u} \))和混合分布(\( g_u \))。通常,这种模型需要至少两个条件独立的观测来识别(如重复测量)。这里,三个订单统计量提供了三个“条件独立”的观测(给定 \( u \),它们独立),因此可以实现非参数识别。
- 为什么不是两个?:如果只有两个订单统计量,混合模型通常只能识别到某个等价类(如无法区分 \( u \) 的尺度变化)。三个订单统计量提供了额外的约束,使得识别成为可能。
数学困难:这个识别策略的严格证明需要处理非参数混合模型的可识别性问题——即证明从 \( (b_{(1)}, b_{(2)}, b_{(3)}) \) 的联合分布到 \( (F_{b|u}, G_u) \) 的映射是单射。本文利用订单统计量的马尔可夫性质和积分变换来证明这一点,具体见第三节。
总结:本文的最小内核是:利用三个条件独立观测(订单统计量)来非参数识别一个混合模型。这个思路在统计上并不新鲜(如非参数EM算法),但将其应用于拍卖模型中的不可分离UH,是本文的创新。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在连续且不可分离的不可观测异质性(UH)设定下,利用三个连续订单统计量,非参数识别并估计拍卖模型中UH与私人价值的联合分布。
- 核心工具/方法:基于订单统计量的非参数识别策略 + 筛极大似然估计(sieve MLE),其中筛空间使用B样条基函数逼近未知密度函数。
- 主要结论:① 证明了非参数识别(定理1);② 建立了筛MLE的收敛速率(定理2),在适当光滑性条件下达到 \( N^{-\alpha/(2\alpha+1)} \)(其中 \( \alpha \) 为光滑参数);③ 应用于中国司法拍卖数据,发现忽略UH会导致保留价设定显著偏离最优,而使用评估价作为保留价的简单方案可接近最优收益。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
- 假设1(IPV模型):私人价值 \( v_{i,t} \) 在给定 \( u_t \) 下独立同分布,且投标人采用对称均衡策略。
- 假设2(单调性):投标函数 \( s(v, u) \) 在 \( v \) 和 \( u \) 上均严格递增,且可微。
- 假设3(连续性):\( v \) 和 \( u \) 的分布是连续的,密度函数存在且光滑(属于Hölder类 \( \Sigma(\alpha, L) \))。
- 假设4(支撑集):\( u \) 的支撑集是紧集(如 \( [0,1] \)),\( v \) 的支撑集是紧区间。
- 假设5(投标人数):每场拍卖的投标人数 \( I \geq 3 \),且固定已知。
- 相比已有文献:
- 相比Krasnokutskaya (2009):放宽了可分离性假设——本文允许 \( s(v, u) \) 为任意单调函数,而非可加/可乘形式。
- 相比Roberts (2013):不需要工具变量——本文仅依赖订单统计量。
- 代价:需要 \( I \geq 3 \),而Krasnokutskaya (2009) 仅需 \( I \geq 2 \)。
主要结果¶
定理1(非参数识别):在假设1-5下,给定三个连续订单统计量 \( (b_{(k)}, b_{(k+1)}, b_{(k+2)}) \) 的联合分布(对任意 \( k \leq I-2 \)),可以唯一识别UH的分布 \( G_u \) 和私人价值的条件分布 \( F_{v|u} \)。
- 直觉:证明分为两步:① 利用订单统计量的马尔可夫性质,将联合分布分解为条件密度乘积;② 通过积分变换,将混合模型转化为一个可识别的积分方程系统。
- 必要条件:\( I \geq 3 \) 是必要的——若 \( I=2 \),则只能识别到某个等价类(如 \( u \) 的单调变换)。
- 解决的技术难点:非参数混合模型的可识别性通常需要额外假设(如混合成分的单调性)。本文利用拍卖模型的结构约束(投标函数的单调性)来绕过这一困难。
定理2(筛MLE的收敛速率):设 \( \alpha > 0 \) 为密度函数的光滑参数(Hölder类),筛空间使用 \( J = O(N^{1/(2\alpha+1)}) \) 个B样条基函数。则筛MLE \( \hat{F}_{v,u} \) 在Hellinger距离下的收敛速率为 \( O_p(N^{-\alpha/(2\alpha+1)}) \)。
- 直觉:这是非参数密度估计的标准速率(如Stone, 1994),表明筛MLE达到了最优收敛速率(在minimax意义下)。
- 必要条件:光滑性假设 \( \alpha \) 决定了速率——\( \alpha \) 越大,速率越快。
- 解决的技术难点:筛MLE的收敛性分析需要处理无限维参数空间和非凹目标函数。本文使用经验过程理论(如van der Vaart & Wellner, 1996)来建立一致性,并利用筛空间的逼近性质(B样条的逼近误差)来推导速率。
定理3(边际分布的收敛速率):私人价值边际分布 \( F_v \) 的筛MLE \( \hat{F}_v \) 在Hellinger距离下也达到 \( O_p(N^{-\alpha/(2\alpha+1)}) \) 的速率。
- 直觉:边际分布是联合分布的积分,因此继承了联合分布的收敛速率。
证明路线与技术技巧¶
整体路线(以定理1的识别证明为例):
1. 步骤1:从订单统计量到条件分布
利用订单统计量的联合分布公式,写出 \( (b_{(k)}, b_{(k+1)}, b_{(k+2)}) \) 的密度:
订单统计量具有马尔可夫性质:给定 \( b_{(k+1)} \),\( b_{(k)} \) 与 \( b_{(k+2)} \) 条件独立。这允许将联合密度分解为:
将步骤1和步骤2结合,得到关于 \( f_{b|u} \) 和 \( g_u \) 的积分方程系统。通过变量替换(如令 \( y = F_{b|u}(b|u) \)),将系统转化为一个可识别的Volterra型积分方程。
4. 步骤4:证明唯一性
利用积分方程的唯一解性质(如Picard-Lindelöf定理),证明从可观测分布到 \( (F_{b|u}, G_u) \) 的映射是单射。
关键跳跃点:
- 最吃功夫的引理:引理1(积分方程的唯一性)——证明从 \( (b_{(k)}, b_{(k+1)}, b_{(k+2)}) \) 的联合分布到 \( (F_{b|u}, G_u) \) 的映射是单射。这个引理依赖于拍卖模型的单调性假设和积分方程理论,是识别证明的核心。
- 难点:非参数混合模型通常不是唯一可识别的(如存在多个 \( (F_{b|u}, G_u) \) 对生成相同的可观测分布)。作者利用订单统计量的马尔可夫性质和投标函数的单调性来打破这种非唯一性。
技术技巧点名:
- 经验过程理论:用于筛MLE的收敛性分析(定理2),具体使用van der Vaart & Wellner (1996) 的“熵条件”来控制经验过程的上确界。
- B样条逼近:用于构造筛空间,利用B样条的逼近性质(如de Boor, 2001)来控制筛误差。
- 积分方程理论:用于识别证明(定理1),具体使用Volterra型积分方程的唯一解性质。
- 订单统计量的马尔可夫性质:用于简化联合分布的结构,这是识别证明的关键技巧。
真实例子与应用¶
数据:中国司法拍卖数据(judicial auctions),来自某东部省份法院,涵盖2015-2017年的约2000场拍卖。每场拍卖的标的物为房产(住宅或商业),投标人数 \( I \) 在3到20之间。
如何应用:
1. 将每场拍卖的投标价按升序排列,取前三个订单统计量 \( (b_{(1)}, b_{(2)}, b_{(3)}) \)。
2. 使用筛MLE估计UH的分布 \( G_u \) 和私人价值的条件分布 \( F_{v|u} \)。
3. 基于估计结果,计算最优保留价(reserve price)——即使得拍卖人期望收益最大化的保留价。
结果:
- 忽略UH的后果:若假设无UH(即使用GPV方法),估计出的最优保留价显著偏低(平均低约15%),导致拍卖人收益损失约8%。
- 简单方案:作者提出使用评估价(appraisal value,由第三方评估机构给出)作为保留价。实证表明,这一简单方案的平均收益与理论最优收益相差不到2%,且无需估计UH。
这个例子想说明什么:
- 验证理论:证明在真实数据中,UH确实存在且影响显著。
- 展示实用性:虽然非参数估计复杂,但最终可以导出一个简单的、接近最优的保留价规则(使用评估价),便于实践应用。
🔎 结论是否比证明窄¶
- 窄的地方:定理1的识别证明依赖于三个连续订单统计量,但作者在结论中声称“利用三个订单统计量”即可识别。实际上,证明中使用了特定顺序(如 \( (b_{(1)}, b_{(2)}, b_{(3)}) \)),而非任意三个订单统计量。作者在文中提到“任意三个连续订单统计量”均可,但未证明非连续的情况(如 \( (b_{(1)}, b_{(3)}, b_{(5)}) \))是否也成立。
- 泛化的claim:作者在摘要中说“利用三个连续订单统计量实现非参数识别”,但在正文中仅证明了 \( k=1 \) 的情况(即最小的三个)。对于 \( k>1 \) 的情况,证明需要调整(因为马尔可夫性质的形式不同),但作者声称“类似可证”,未给出详细论证。
- 建议:如果研究者想推广本文结果,应首先验证 \( k>1 \) 的情况是否真的“类似可证”,还是需要额外假设。
四、开放问题(点到为止,扎根具体语句)¶
- 更高阶订单统计量的识别能力:本文仅使用三个连续订单统计量。如果使用更多(如四个或五个),能否识别更复杂的UH结构(如多维UH)?
- 扎根:作者在结论部分提到“我们的方法可以扩展到更多订单统计量,但识别条件会更复杂”(原文第X页)。具体如何扩展?是否需要额外假设?
- 有限样本下的估计性能:定理2的收敛速率是渐近的,但有限样本下筛MLE的表现如何?特别是当 \( I \) 较小(如 \( I=3 \))时,估计量的方差可能很大。
- 扎根:作者在模拟实验中仅报告了 \( N=500 \) 和 \( I=5 \) 的结果,未探索 \( I=3 \) 的边界情况。
- 非参数识别的最优性:本文证明了 \( I \geq 3 \) 是识别必要的,但这是否也是充分的?是否存在 \( I=3 \) 但无法识别的病理情形?
- 扎根:作者在定理1的证明中假设了 \( u \) 的支撑集是紧集,且投标函数光滑。若这些假设不成立,识别是否仍成立?
- 与proximal causal inference的潜在联系:本文的识别策略(利用条件独立观测来“消去”不可观测变量)与proximal CI中的negative control设定有结构相似性。能否将本文的积分方程方法迁移到proximal CI中,用于处理更复杂的未观测混杂?
- 扎根:这是研究者自己的兴趣点,非本文直接提及。建议去读Tchetgen Tchetgen et al. (2020) 关于proximal CI的综述,看其中是否已有类似方法。
Maintained by 陈星宇 · Homepage · Source on GitHub