人类参与循环的上下文老虎机用于短期租赁动态定价:历史预热与审批门控在线学习的结构等价性

arXiv cs.LG 论文

摘要

本文介绍了用于短期租赁动态定价的人类参与循环门控老虎机(HITL-GB),表明先前策略下的历史定价数据在结构上等同于在线策略预热数据,将冷启动从约150轮减少到约30轮。

arXiv:2606.02595v1 公告类型: new 摘要:短期租赁(STR)市场的动态定价为在线学习算法带来了独特的挑战:定价决策具有显著的财务风险,运营商需要可解释性,并且市场反馈稀疏(每个挂牌夜晚只有一个预订结果)。我们引入了人类参与循环门控老虎机(HITL-GB)框架,在该框架中,上下文老虎机算法生成价格建议,但人类代理有权在接受、修改或拒绝每条建议之后才应用它。我们表明,在这种审批约束下,先前确定性策略下收集的历史定价数据在结构上等同于用于初始化老虎机后验的在线策略预热数据,从而避免了纯在线老虎机学习在稀疏反馈市场中不切实际的数周至数月的冷启动期。我们形式化了审批门控奖励信号,从历史轮次中推导出正则化岭回归预热程序,并在真实STR生产数据(匿名城市市场,2个房间,2022年4月至2026年4月,1,461个夜间定价轮次)上验证了该方法。我们的预热程序在初始化来自Hierarchical Factored Thompson Sampling (HF-TS) 族的智能体时,将有效冷启动从约150轮压缩到约30轮。我们进一步论证,结构等价性结果与领域无关:任何高风险领域——包括临床药物剂量、信贷发放、内容审核和放射诊断——只要法律或运营上要求人类审批,都满足相同条件,并受益于相同的预热策略。在受监管行业中,强制性人类监督因此是一种统计资产,而非部署约束。
查看原文
查看缓存全文

缓存时间: 2026/06/03 09:38

# 基于人机协同上下文赌博机的短租动态定价:历史预热与审批门控在线学习的结构等价性
来源:https://arxiv.org/html/2606.02595
(2026年5月)

###### 摘要

短租市场中的动态定价对在线学习算法构成了独特挑战:定价决策具有显著财务风险,运营商需要可解释性,且市场反馈稀疏(每夜一个预订结果)。我们提出了**人机协同门控赌博机(HITL-GB)**框架,在该框架中,上下文赌博机算法生成价格推荐,但人类代理保留接受、修改或拒绝每条推荐的权力,然后才能应用。我们证明,在这种批准约束下,历史定价数据(在先前确定性策略下收集)在结构上等价于用于初始化赌博机后验的策略内预热数据,从而绕过了数周至数月的冷启动期——后者使得纯在线赌博机学习在稀疏反馈市场中不可行。我们形式化了批准门控的奖励信号,从历史片段推导出正则化岭回归预热过程,并在**真实的短租生产数据**(匿名城市市场,2个房源,2022年4月至2026年4月,共1461个夜间定价片段)上验证了该方法。在从分层因子化汤普森采样(HF-TS)家族(Hong 等,2021(https://arxiv.org/html/2606.02595#bib.bib3),2022(https://arxiv.org/html/2606.02595#bib.bib4);Zimmert 和 Seldin,2018(https://arxiv.org/html/2606.02595#bib.bib2))初始化代理时,我们的预热过程将有效冷启动从约150个片段压缩至约30个片段。我们进一步论证,该结构等价性结果与领域无关:任何要求人类批准(法律或操作上)的高风险领域——包括临床药物剂量、信贷发放、内容审核和放射诊断——都满足相同条件,并能受益于相同的预热策略。在受监管行业中,强制性人类监督因此是一种**统计资产**,而非部署约束。

#### 关键词

上下文赌博机、动态定价、人机协同、离策略评估、短租、冷启动、分层汤普森采样、因子化赌博机、临床决策支持、受监管AI

###### 目录

1. 1.引言(https://arxiv.org/html/2606.02595#S1)
2. 2.相关工作(https://arxiv.org/html/2606.02595#S2)1. 2.1.分层与因子化赌博机(https://arxiv.org/html/2606.02595#S2.SS1) 2. 2.2.人机协同机器学习(https://arxiv.org/html/2606.02595#S2.SS2) 3. 2.3.离策略评估与预热(https://arxiv.org/html/2606.02595#S2.SS3) 4. 2.4.短租定价(https://arxiv.org/html/2606.02595#S2.SS4)
3. 3.问题形式化(https://arxiv.org/html/2606.02595#S3)1. 3.1.HITL-GB设定(https://arxiv.org/html/2606.02595#S3.SS1) 2. 3.2.人类批准函数(https://arxiv.org/html/2606.02595#S3.SS2) 3. 3.3.三层价格信号(https://arxiv.org/html/2606.02595#S3.SS3) 4. 3.4.因子化赌博机臂(https://arxiv.org/html/2606.02595#S3.SS4) 5. 3.5.HITL反馈信号(https://arxiv.org/html/2606.02595#S3.SS5)
4. 4.历史预热:结构等价性(https://arxiv.org/html/2606.02595#S4)1. 4.1.短租市场中的冷启动问题(https://arxiv.org/html/2606.02595#S4.SS1) 2. 4.2.先前策略下的历史数据(https://arxiv.org/html/2606.02595#S4.SS2) 3. 4.3.结构等价性定理(https://arxiv.org/html/2606.02595#S4.SS3) 4. 4.4.α混合岭回归预热(https://arxiv.org/html/2606.02595#S4.SS4) 5. 4.5.双重冷启动:一个数据集,两个问题(https://arxiv.org/html/2606.02595#S4.SS5)
5. 5.实验设置(https://arxiv.org/html/2606.02595#S5)1. 5.1.数据集(https://arxiv.org/html/2606.02595#S5.SS1) 2. 5.2.HF-TS基准代理(https://arxiv.org/html/2606.02595#S5.SS2) 3. 5.3.预热条件(https://arxiv.org/html/2606.02595#S5.SS3)
6. 6.结果(https://arxiv.org/html/2606.02595#S6)1. 6.1.校准的天信号参数(https://arxiv.org/html/2606.02595#S6.SS1) 2. 6.2.相对于冷启动的收入优势(https://arxiv.org/html/2606.02595#S6.SS2) 3. 6.3.总结(https://arxiv.org/html/2606.02595#S6.SS3)
7. 7.HITL-GB框架的更广泛应用(https://arxiv.org/html/2606.02595#S7)
8. 8.讨论(https://arxiv.org/html/2606.02595#S8)1. 8.1.批准门控作为统计资产(https://arxiv.org/html/2606.02595#S8.SS1) 2. 8.2.与现有分层理论的关系(https://arxiv.org/html/2606.02595#S8.SS2) 3. 8.3.人类批准函数的平稳性(https://arxiv.org/html/2606.02595#S8.SS3) 4. 8.4.局限性(https://arxiv.org/html/2606.02595#S8.SS4)
9. 9.结论(https://arxiv.org/html/2606.02595#S9)
10. 参考文献(https://arxiv.org/html/2606.02595#bib)
11. A.结构等价性定理的证明(https://arxiv.org/html/2606.02595#A1)
12. B.HF-TS理论结果(https://arxiv.org/html/2606.02595#A2)

## 1.引言

在线学习算法——特别是多臂赌博机——已在电子商务(Misra 等,2019(https://arxiv.org/html/2606.02595#bib.bib24))、网约车(Tang 等人,2013(https://arxiv.org/html/2606.02595#bib.bib21))和酒店收益管理(Ferreira 等,2016(https://arxiv.org/html/2606.02595#bib.bib23))的动态定价中展示了强大性能。其核心吸引力显而易见:算法探索价格-需求曲线,从预订结果更新其信念,并收敛到收入最大化的臂,而无需预先指定需求模型。

然而,在短租市场中,天真地应用赌博机算法面临结构性障碍:**人类操作员必须批准定价决策**。物业经理、收益经理和投资组合所有者不愿将定价权完全委托给算法。价格影响客人关系、品牌声誉和平台排名——这些后果超越单一的预订结果。这不是一个可以被工程化解决的限制;它是该领域的基本特征。

主要的实际应对措施是将赌博机视为**推荐系统**:算法提出一个臂(价格乘数),人类接受或覆盖。这在实践中广泛应用,但理论上研究甚少。特别是,三个问题仍悬而未决:

1. 1.**反馈归因**:当人类覆盖推荐时,奖励是由谁的决定产生的——人类还是算法?
2. 2.**历史等价性**:历史定价数据(在先前确定性策略下收集)能否作为有效的预热数据,还是批准门控使得离策略重用无效?
3. 3.**冷启动压缩**:结合历史预热的HITL批准能否消除纯在线赌博机学习在稀疏市场中不切实际的长冷启动期?

本文回答了这三个问题。我们的主要贡献是:

1. 1.**HITL-GB框架**(§3(https://arxiv.org/html/2606.02595#S3)):门控赌博机系统的正式定义,其中应用于环境的臂可能与算法推荐的臂不同,由人类批准函数 h:A×X→A 作为中介。
2. 2.**结构等价性定理**(§4(https://arxiv.org/html/2606.02595#S4)):在具有平稳批准函数的批准约束下,由确定性定价策略生成的历史数据是有效的预热初始化器,无需重要性采样修正。
3. 3.**来自单一数据集的双重冷启动**(§4(https://arxiv.org/html/2606.02595#S4)):相同的历史片段同时初始化赌博机臂的后验,并校准四个天信号参数 θ,将冷启动从约150个片段压缩至约30个已预订片段。
4. 4.**基于真实短租生产数据的实证验证**(§6(https://arxiv.org/html/2606.02595#S6))(1461个夜间片段),显示在大约30个在线片段内实现正向收入优势。
5. 5.**跨领域适用性**(§7(https://arxiv.org/html/2606.02595#S7)):对12个受监管领域的调查,其中该结果成立,包括临床剂量、信贷发放和内容审核。

#### 关键反直觉见解。

人类批准门控通常被视为算法与市场之间的摩擦。本文重新审视了它:批准门控恰恰是**使得历史数据无需IS修正即可用于预热的原因**。监管要求并非机器学习部署的障碍——它们是使快速部署成为可能的机制。

## 2.相关工作

### 2.1.分层与因子化赌博机

我们的基础代理家族HF-TS借鉴了近期分层赌博机文献。

#### 因子化赌博机。

Zimmert 和 Seldin(2018(https://arxiv.org/html/2606.02595#bib.bib2))将定价行动分解为独立原子行动的笛卡尔积,并以乘法方式组合,产生关于联合臂数的亚线性遗憾界。我们将其用作层次结构的第一层(市场需求)。

#### 分层汤普森采样。

Hong 等人(2021(https://arxiv.org/html/2606.02595#bib.bib3))将所有物业建模为从共享聚类分布中抽取的任务,实现了跨物业后验共享。Hong 等人(2022(https://arxiv.org/html/2606.02595#bib.bib4))将其扩展到任意L层先验树,遗憾界随深度多项式改善。

#### 由粗到细的分层探索。

Yue 等人(2012(https://arxiv.org/html/2606.02595#bib.bib5))随着数据密度增长逐步解锁更细粒度的臂空间状态,提供了最优解锁阈值(下文定理8.2(https://arxiv.org/html/2606.02595#S8.Thmtheorem2))。

#### 元数据和在线聚类变体。

Wan 等人(2021(https://arxiv.org/html/2606.02595#bib.bib6))用余弦相似度加权的贝叶斯先验替代硬聚类分配。Zhou 等人(2024(https://arxiv.org/html/2606.02595#bib.bib7))允许通过k均值式质心跟踪在线演化聚类分配。

### 2.2.人机协同机器学习

HITL文献主要涉及**主动学习**(Settles,2012(https://arxiv.org/html/2606.02595#bib.bib15))和基于人类反馈的强化学习(RLHF)(Christiano 等,2017(https://arxiv.org/html/2606.02595#bib.bib16);Ouyang 等人,2022(https://arxiv.org/html/2606.02595#bib.bib17))。在RLHF中,人类偏好塑造了一个奖励模型,指导策略学习。我们的设定与其根本不同:人类在执行前批准或覆盖动作,使批准成为执行前门控,而非事后标签。

最相关的工作是用于临床试验设计的HITL赌博机(Liao 等人,2020(https://arxiv.org/html/2606.02595#bib.bib18))和教育推荐(Rafferty 等人,2019(https://arxiv.org/html/2606.02595#bib.bib19)),其中专家批准约束了臂选择。两者均未解决批准约束下历史预热的结构等价性问题,也未解决稀疏反馈机制。

### 2.3.离策略评估与预热

离策略评估(OPE)涉及从不同策略下收集的数据中进行学习(Precup 等,2000(https://arxiv.org/html/2606.02595#bib.bib13))。标准解决方案是使用具有倾向性修正的重要性采样(IS):

V̂(π) = (1/N) ∑_{t=1}^{N} [π(a_t|x_t) / π_0(a_t|x_t)] r_t. (1)

我们证明,在HITL批准结构下,IS修正对于预热初始化是不必要的——简化了实现,并避免了IS估计器在稀疏数据集中的高方差。

### 2.4.短租定价

短租定价研究集中于享乐回归(Gibbs 等,2018(https://arxiv.org/html/2606.02595#bib.bib22))、需求预测和竞争定位。基于赌博机的短租定价在学术上仍基本未被研究。我们的工作贡献了该领域首个关于HITL门控赌博机定价的正式处理。

## 3.问题形式化

### 3.1.HITL-GB设定

令 T={1,2,...,T} 为定价时间步集合,其中每一步 t 对应物业日历中的单个夜晚。在每一步 t:

- •环境揭示上下文 x_t ∈ X(市场入住率、距入住天数、星期几、物业填充率等)
- •赌博机算法选择推荐臂 a_t^rec ∈ A(价格乘数)
- •人类代理应用批准函数 h: A×X → A,产生执行臂 a_t^exec = h(a_t^rec, x_t)
- •环境返回奖励 r_t ~ R(· | a_t^exec, x_t)(预订结果 × 价格)

赌博机观察到元组 (a_t^rec, a_t^exec, r_t, x_t) 并更新其后验。完整的决策循环如图1所示(https://arxiv.org/html/2606.02595#S3.F1)。

图1:HITL-GB决策循环。*上方*:标准赌博机——算法直接选择并执行一个臂;重用离策略历史时需要IS修正。*下方*:HITL门控赌博机(我们的)——算法*推荐*一个臂;人类批准或修改它;两个代理都观察奖励。关键性质:由于在历史机制中相同的门控h是活跃的,执行臂的分布匹配,历史数据无需IS修正。

### 3.2.人类批准函数

我们将人类批准函数建模为:

h(a^rec, x) = { a^rec,概率 p(x);a^human(x),概率 1−p(x) } (2)

其中 p(x) ∈ [0,1] 是上下文相关的接受概率,a^human(x) 是给定上下文 x 时人类偏好的臂。

关键特殊情况:p(x)=1 给出完全委托的标准赌博机;p(x)=0 给出纯人类控制,无赌博机输入;p(x)∈(0,1) 是本文研究的HITL-GB机制。

### 3.3.三层价格信号

HITL-GB系统产生最终价格,作为三个分量的乘积,每个分量在不同时间和粒度尺度上运行:

price_t = r̄_t × μ^LLM × δ_t(θ) (3)

市场费率 r̄_t:IQR稳健的聚类均值 × LLM乘数 μ^LLM:物业级别,月度 × 天信号 δ_t(θ):每晚,通过预热校准;由赌博机臂网格探索

其中:
- 市场费率 r̄_t 将定价锚定到竞争对手聚类。
- LLM乘数 μ^LLM 基于评论质量和地理特征(月度更新,稳定)相对于聚类定位物业。
- 天信号乘数 δ_t(θ) 捕获假期、事件、星期几效果和季节性(由预热校准;随后由赌博机臂网格探索)。

图2:三层定价架构。市场费率 r̄_t 将定价锚定到竞争对手聚类。LLM乘数 μ^LLM 基于评论质量和地理特征(月度更新,稳定)相对于聚类定位物业。天信号乘数 δ_t(θ)(由预热校准;由赌博机臂网格探索)。

相似文章

有限适应性下的上下文Slate GLM Bandits

arXiv cs.LG

提出了在有限适应性下具有广义线性奖励的上下文Slate Bandit算法,实现了与非线性参数无关的遗憾界。批量式和少切换算法计算高效,且在经验上优于基线,包括在语言模型示例选择任务中。

跨域上下文赌博机的离线策略评估与学习

arXiv cs.LG

本文介绍了面向上下文赌博机的跨域离线策略评估与学习(OPE/L),允许利用多个源域的日志数据来改进目标域中的策略评估与学习,这些目标域面临少样本数据、确定性日志策略和新动作等挑战性条件。