bandit-algorithms

标签

Cards List
#bandit-algorithms

面向无知对手下多臂老虎机的最优切换遗憾

arXiv cs.LG ↗ · 2026-09-15 缓存

本文解决了一个开放问题,表明一个单一算法在无知对手下的多臂老虎机中,针对每个S值都能实现最优切换遗憾。

0 人收藏 0 人点赞
#bandit-algorithms

非单调凸脊强盗问题中的Thompson采样:多项式遗憾不需要单调性

arXiv cs.LG ↗ · 2026-09-11 缓存

本文证明了Thompson采样在非单调凸脊强盗问题中实现了多项式遗憾,表明单调性并非必要,并给出了新的遗憾界限Õ(d^{9/2} √n)。

0 人收藏 0 人点赞
#bandit-algorithms

基于有限反馈的LLM专家在线学习

arXiv cs.LG ↗ · 2026-09-10 缓存

本文提出算法,用于在有限反馈的在线环境中,自适应地将提示路由至LLM专家。该问题被形式化为多臂赌博机问题,旨在最小化遗憾并最大化响应质量。

0 人收藏 0 人点赞
#bandit-algorithms

基于有限反馈的LLM专家在线学习

Hugging Face Daily Papers ↗ · 2026-09-05 缓存

本文将提示到大语言模型专家的自适应路由建模为具有有限反馈的上下文赌博机问题,提出实现次线性遗憾的算法,并展示高效学习高质量路由策略的能力。

0 人收藏 0 人点赞
#bandit-algorithms

通过绝对扰动实现线性赌博机中的随机探索

arXiv cs.LG ↗ · 2026-06-30 缓存

本文提出绝对汤普森采样(ATS),这是对汤普森采样的一种改进,通过使用绝对探索噪声确保期望上的乐观性,在保持计算效率的同时实现了更简单的UCB风格遗憾分析。它达到了与现有TS界相匹配的遗憾,并引入了一种集成变体,该变体收敛于UCB行为。

0 人收藏 0 人点赞
#bandit-algorithms

面向上下文赌博机的图降维:近似平滑与噪声特征空间下的结构特定遗憾界

arXiv cs.LG ↗ · 2026-06-29 缓存

提出了GraphDR-LinUCB方法,一种面向具有图结构臂的上下文赌博机方法,该方法将特征投影到图的低频频谱子空间上。实现了首个基于频谱投影的上下文赌博机的遗憾界,并在真实数据集上相比全维度LinUCB实现了15倍的遗憾值降低。

0 人收藏 0 人点赞
#bandit-algorithms

基于时变需求的约束赌博机在线LLM选择

arXiv cs.LG ↗ · 2026-06-17 缓存

本文提出了一种约束随机赌博机算法,用于在时变任务需求以及异构的准确性、延迟和成本配置下在线选择大型语言模型,并在遗憾和约束违反方面提供了理论保证。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈