基于有限反馈的LLM专家在线学习
摘要
本文将提示到大语言模型专家的自适应路由建模为具有有限反馈的上下文赌博机问题,提出实现次线性遗憾的算法,并展示高效学习高质量路由策略的能力。
查看缓存全文
缓存时间: 2026/09/14 10:34
论文页面 - 基于有限反馈的LLM专家在线学习
来源:https://huggingface.co/papers/2609.05820
摘要
将提示自适应路由至LLM专家的问题被建模为具有有限反馈的上下文老虎机问题,由此产生的算法具有次线性遗憾界和有效的路由策略。
我们研究了在具有有限反馈的在线环境中,将提示自适应路由至大型语言模型(LLM)专家以最大化响应质量的问题。我们将该问题建模为具有K个动作(代表专家)和d个特征(编码提示)的老虎机问题,时间范围为T轮。我们提出了能够战略性地选择并观察奖励以最小化遗憾的算法。在完全信息设定下,我们实现了O(dT/m)的遗憾界,而在老虎机设定下实现了O(dTK/m)的遗憾界,其中m << T是反馈预算。我们的实验表明,我们能够从有限反馈中有效地学习针对多样化LLM的高质量路由策略。
查看arXiv页面 (https://arxiv.org/abs/2609.05820)查看PDF (https://arxiv.org/pdf/2609.05820)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.05820)
在您的智能体中获取此论文:
hf papers read 2609\.05820
没有最新版CLI?运行:curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
尚无模型链接此论文
在模型的README.md中引用arxiv.org/abs/2609.05820以从本页面链接。
引用此论文的数据集0
尚无数据集链接此论文
在数据集的README.md中引用arxiv.org/abs/2609.05820以从本页面链接。
引用此论文的Spaces0
尚无Space链接此论文
在Space的README.md中引用arxiv.org/abs/2609.05820以从本页面链接。
包含此论文的收藏夹0
尚无收藏夹包含此论文
将此论文添加到收藏夹 (https://huggingface.co/new-collection)以从本页面链接。
相似文章
基于有限反馈的LLM专家在线学习
本文提出算法,用于在有限反馈的在线环境中,自适应地将提示路由至LLM专家。该问题被形式化为多臂赌博机问题,旨在最小化遗憾并最大化响应质量。
并非放之四海而皆准:多语言大语言模型中从固定提示到可学习路由的演进
# 并非放之四海而皆准:多语言大语言模型中从固定提示到可学习路由的演进 来源:[https://arxiv.org/html/2604.16937](https://arxiv.org/html/2604.16937) Wei-Chi Wu, Sheng-Lun Wei, Hen-Hsen Huang, Hsin-Hsi Chen α 台湾大学电脑科学与资讯工程学系,台湾 β 中央研究院资讯科学研究所,台湾 γ 台湾大学人工智能研究中心(AINTU),台湾 wcwu@c
基于时变需求的约束赌博机在线LLM选择
本文提出了一种约束随机赌博机算法,用于在时变任务需求以及异构的准确性、延迟和成本配置下在线选择大型语言模型,并在遗憾和约束违反方面提供了理论保证。
面向即时自适应反馈:通过知识驱动的LLM提升学生学习效果
本文提出一个框架,利用领域专家知识来引导大语言模型,根据学生的书面推理提供即时自适应反馈。在一门大规模大学课程中,该框架使学生成绩提升了超过80%。
基于代理奖励的上下文感知上下文赌博机用于LLM路由
本文提出了相关性感知的上下文赌博机算法,利用机器学习模型产生的代理奖励信号进行LLM路由,与标准基线相比,实现了更好的精度-成本权衡和样本效率。