基于有限反馈的LLM专家在线学习

Hugging Face Daily Papers 论文

摘要

本文将提示到大语言模型专家的自适应路由建模为具有有限反馈的上下文赌博机问题,提出实现次线性遗憾的算法,并展示高效学习高质量路由策略的能力。

我们研究在有限反馈的在线环境中,为最大化响应质量而对提示到大语言模型(LLM)专家的自适应路由。我们将其建模为一个具有K个动作(代表专家)和d个特征(编码提示)的赌博机问题,跨越T轮。我们提出算法,通过策略性地选择和观察奖励来最小化遗憾。在全信息设置中,我们实现了O(d T / m)的遗憾,而在赌博机设置中,我们实现了O(d T K / m)的遗憾,其中m ≪ T是反馈预算。我们的实验表明,我们能够从有限反馈中高效地学习到跨多种LLM的高质量路由策略。
查看原文
查看缓存全文

缓存时间: 2026/09/14 10:34

论文页面 - 基于有限反馈的LLM专家在线学习

来源:https://huggingface.co/papers/2609.05820

摘要

将提示自适应路由至LLM专家的问题被建模为具有有限反馈的上下文老虎机问题,由此产生的算法具有次线性遗憾界和有效的路由策略。

我们研究了在具有有限反馈的在线环境中,将提示自适应路由至大型语言模型(LLM)专家以最大化响应质量的问题。我们将该问题建模为具有K个动作(代表专家)和d个特征(编码提示)的老虎机问题,时间范围为T轮。我们提出了能够战略性地选择并观察奖励以最小化遗憾的算法。在完全信息设定下,我们实现了O(dT/m)的遗憾界,而在老虎机设定下实现了O(dTK/m)的遗憾界,其中m << T是反馈预算。我们的实验表明,我们能够从有限反馈中有效地学习针对多样化LLM的高质量路由策略。

查看arXiv页面 (https://arxiv.org/abs/2609.05820)查看PDF (https://arxiv.org/pdf/2609.05820)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.05820)

在您的智能体中获取此论文:

hf papers read 2609\.05820

没有最新版CLI?运行:curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

尚无模型链接此论文

在模型的README.md中引用arxiv.org/abs/2609.05820以从本页面链接。

引用此论文的数据集0

尚无数据集链接此论文

在数据集的README.md中引用arxiv.org/abs/2609.05820以从本页面链接。

引用此论文的Spaces0

尚无Space链接此论文

在Space的README.md中引用arxiv.org/abs/2609.05820以从本页面链接。

包含此论文的收藏夹0

尚无收藏夹包含此论文

将此论文添加到收藏夹 (https://huggingface.co/new-collection)以从本页面链接。

相似文章

基于有限反馈的LLM专家在线学习

arXiv cs.LG

本文提出算法,用于在有限反馈的在线环境中,自适应地将提示路由至LLM专家。该问题被形式化为多臂赌博机问题,旨在最小化遗憾并最大化响应质量。

并非放之四海而皆准:多语言大语言模型中从固定提示到可学习路由的演进

arXiv cs.CL

# 并非放之四海而皆准:多语言大语言模型中从固定提示到可学习路由的演进 来源:[https://arxiv.org/html/2604.16937](https://arxiv.org/html/2604.16937) Wei-Chi Wu, Sheng-Lun Wei, Hen-Hsen Huang, Hsin-Hsi Chen α 台湾大学电脑科学与资讯工程学系,台湾 β 中央研究院资讯科学研究所,台湾 γ 台湾大学人工智能研究中心(AINTU),台湾 wcwu@c

基于时变需求的约束赌博机在线LLM选择

arXiv cs.LG

本文提出了一种约束随机赌博机算法,用于在时变任务需求以及异构的准确性、延迟和成本配置下在线选择大型语言模型,并在遗憾和约束违反方面提供了理论保证。