contextual-bandits

标签

Cards List
#contextual-bandits

贪婪采样探索时:无eluder维度依赖的KL正则化上下文强盗

arXiv cs.LG · 昨天 缓存

本文研究了KL正则化的上下文强盗问题,并表明贪婪采样能够在奖励和偏好反馈下实现对数遗憾,而无需显式依赖于eluder维度。

0 人收藏 0 人点赞
#contextual-bandits

COBRA-Skills: 基于上下文赌博机的高效代理技能优化(开源)

Reddit r/artificial · 2天前

本文介绍了 COBRA-Skills,这是一种利用上下文赌博机高效优化代理技能的方法,通过避免重复的基于 LLM 的轨迹分析和技能重写来降低成本。

0 人收藏 0 人点赞
#contextual-bandits

COBRA-Skills:上下文赌博机引导的智能体技能优化进化

Hugging Face Daily Papers · 6天前 缓存

COBRA-Skills 提出了一种通过上下文赌博机和进化算子优化智能体技能的方法,在多个 AI 智能体基准测试中实现了 55-58% 的优化成本降低。

0 人收藏 0 人点赞
#contextual-bandits

基于有限反馈的LLM专家在线学习

Hugging Face Daily Papers · 2026-09-05 缓存

本文将提示到大语言模型专家的自适应路由建模为具有有限反馈的上下文赌博机问题,提出实现次线性遗憾的算法,并展示高效学习高质量路由策略的能力。

0 人收藏 0 人点赞
#contextual-bandits

安全源于设计:具有连续动作的情境强盗中的实现成本约束

arXiv cs.LG · 2026-08-28 缓存

本文提出了一种针对具有连续动作的情境强盗问题的高概率约束UCB算法,强调实现成本约束而非期望成本以提升安全性,并提供了理论遗憾界和实验验证。

0 人收藏 0 人点赞
#contextual-bandits

学习失败模式:用于对抗性数据策展的上下文强盗方法

arXiv cs.CL · 2026-08-20 缓存

本文介绍了一种故障感知的对抗检索增强框架,利用上下文强盗来提升自然语言理解的鲁棒性,并在SNLI、ANLI和MultiNLI等基准测试中取得了显著改进。

0 人收藏 0 人点赞
#contextual-bandits

快速A/B/n测试:通过树耦合反馈共享进行精确多策略比较

arXiv cs.LG · 2026-08-14 缓存

介绍树耦合A/B测试(TCAB),一种精确的反馈共享设计,通过更少的奖励查询比较多个自适应策略,同时保留每个策略的轨迹分布。

0 人收藏 0 人点赞
#contextual-bandits

当离线评估产生误导:延迟反馈上下文老虎机中奖励与策略选择的诊断协议

arXiv cs.LG · 2026-08-13 缓存

本文提出了一种在延迟反馈上下文老虎机中选择奖励与策略的诊断协议,认为标准离线评估可能产生误导,并在基准测试和已部署的推送系统上验证了该方法。

0 人收藏 0 人点赞
#contextual-bandits

带有背包约束的上下文老虎机的重优化算法

arXiv cs.LG · 2026-08-13 缓存

本文提出了带有背包约束的上下文老虎机的新的重优化算法,实现了平均遗憾界 O((ln T)^3 / T),并改进了现有结果。

0 人收藏 0 人点赞
#contextual-bandits

Bootstrap-Conditioned Action Selection with Tabular Foundation Models

arXiv cs.LG · 2026-08-10 缓存

The paper proposes BC-ICL, a bootstrap-conditioned action selection method that leverages pretrained tabular foundation models with in-context learning for contextual bandits, improving exploration and regret performance under strict online protocols.

0 人收藏 0 人点赞
#contextual-bandits

跨域上下文赌博机的离线策略评估与学习

arXiv cs.LG · 2026-07-27 缓存

本文介绍了面向上下文赌博机的跨域离线策略评估与学习(OPE/L),允许利用多个源域的日志数据来改进目标域中的策略评估与学习,这些目标域面临少样本数据、确定性日志策略和新动作等挑战性条件。

0 人收藏 0 人点赞
#contextual-bandits

因果赌博机的信息导向采样

arXiv cs.LG · 2026-07-20 缓存

本文研究了具有不可操纵变量的上下文因果赌博机问题,提出了汤普森采样和信息导向采样(IDS)的因果变体,利用共享因果机制加速决策过程。理论遗憾界和合成任务实验表明,所提方法优于因果和非因果基线。

0 人收藏 0 人点赞
#contextual-bandits

基于代理奖励的上下文感知上下文赌博机用于LLM路由

arXiv cs.LG · 2026-07-13 缓存

本文提出了相关性感知的上下文赌博机算法,利用机器学习模型产生的代理奖励信号进行LLM路由,与标准基线相比,实现了更好的精度-成本权衡和样本效率。

0 人收藏 0 人点赞
#contextual-bandits

一种具有双边信息不对称的Contextual-Bandit监督博弈

arXiv cs.AI · 2026-07-02 缓存

本文介绍了一种用于AI智能体运行时人工监督的、具有双边信息不对称的Contextual-Bandit团队博弈,刻画了团队最优策略与短视人工监督策略之间的差距。

0 人收藏 0 人点赞
#contextual-bandits

有限适应性下的上下文Slate GLM Bandits

arXiv cs.LG · 2026-07-01 缓存

提出了在有限适应性下具有广义线性奖励的上下文Slate Bandit算法,实现了与非线性参数无关的遗憾界。批量式和少切换算法计算高效,且在经验上优于基线,包括在语言模型示例选择任务中。

0 人收藏 0 人点赞
#contextual-bandits

预算约束下RAG系统中的事实错误诊断与修复

arXiv cs.AI · 2026-06-30 缓存

本文提出D2R-RAG,一个模型无关且资源感知的框架,在延迟和VRAM约束下诊断和修复RAG系统中的事实错误,在FEVER和HotpotQA上实现了更好的准确性与效率权衡。

0 人收藏 0 人点赞
#contextual-bandits

面向上下文赌博机的图降维:近似平滑与噪声特征空间下的结构特定遗憾界

arXiv cs.LG · 2026-06-29 缓存

提出了GraphDR-LinUCB方法,一种面向具有图结构臂的上下文赌博机方法,该方法将特征投影到图的低频频谱子空间上。实现了首个基于频谱投影的上下文赌博机的遗憾界,并在真实数据集上相比全维度LinUCB实现了15倍的遗憾值降低。

0 人收藏 0 人点赞
#contextual-bandits

用于最大化激励口碑回报的上下文多臂赌博机

arXiv cs.LG · 2026-06-16 缓存

本文提出了一种上下文多臂赌博机框架,该框架学习社交网络中的个体溢出概率,以优化激励式口碑营销,通过定向关联用户实现更高的回报。

0 人收藏 0 人点赞
#contextual-bandits

嵌入模型路由的策略遗憾:具有低秩专家的上下文赌博机

arXiv cs.LG · 2026-06-16 缓存

本文将嵌入模型路由形式化为具有低秩专家的对抗性上下文线性赌博机,提出了Hypentropy策略梯度(HPG)算法,该算法实现了O~(s√(MT))的策略遗憾,避免了维度灾难。

0 人收藏 0 人点赞
#contextual-bandits

面向上下文LLM级联的在线Pandora's Box

arXiv cs.AI · 2026-06-08 缓存

本文介绍了一种面向自适应查询和选择LLM API的在线上下文Pandora's Box模型,提出了一种结合GMM估计与UCB风格置信区间的学习方法,并证明了维度相关的遗憾界。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈