标签
本文解决了一个开放问题,表明一个单一算法在无知对手下的多臂老虎机中,针对每个S值都能实现最优切换遗憾。
本文证明了Thompson采样在非单调凸脊强盗问题中实现了多项式遗憾,表明单调性并非必要,并给出了新的遗憾界限Õ(d^{9/2} √n)。
本文提出算法,用于在有限反馈的在线环境中,自适应地将提示路由至LLM专家。该问题被形式化为多臂赌博机问题,旨在最小化遗憾并最大化响应质量。
本文将提示到大语言模型专家的自适应路由建模为具有有限反馈的上下文赌博机问题,提出实现次线性遗憾的算法,并展示高效学习高质量路由策略的能力。
本文提出绝对汤普森采样(ATS),这是对汤普森采样的一种改进,通过使用绝对探索噪声确保期望上的乐观性,在保持计算效率的同时实现了更简单的UCB风格遗憾分析。它达到了与现有TS界相匹配的遗憾,并引入了一种集成变体,该变体收敛于UCB行为。
提出了GraphDR-LinUCB方法,一种面向具有图结构臂的上下文赌博机方法,该方法将特征投影到图的低频频谱子空间上。实现了首个基于频谱投影的上下文赌博机的遗憾界,并在真实数据集上相比全维度LinUCB实现了15倍的遗憾值降低。
本文提出了一种约束随机赌博机算法,用于在时变任务需求以及异构的准确性、延迟和成本配置下在线选择大型语言模型,并在遗憾和约束违反方面提供了理论保证。