标签
本文提出了一种针对多LLM协作的9种模型选择算法的分类体系,研究表明,在数学、编程、问答和推理任务中,基于能力感知的选择策略相比随机或启发式的团队组建方式,性能提升最高可达36.1%。
本文探讨了企业将AI从实验阶段转向生产阶段时的经济策略,重点在于根据工作负载需求和成本可预测性,评估所有权与消费模式。
论文提出了RouteFM,一个面向LLM路由的基础模型,通过跨异构环境的情景化预训练学习可复用的路由能力,使一个冻结的路由器仅凭行为上下文即可适应新的领域、模态和候选模型池。在MMR-Bench上,RouteFM仅凭每个候选8条观测就以2.23个质量点领先最强基线,支持'一次预训练、随处路由'的范式。
FlexRouter 提出了一种以覆盖率为导向的 LLM 路由框架,利用行列式点过程(Determinantal Point Processes)建模模型之间的互补性,最大化至少有一个被选中模型回答正确的概率,同时避免冗余选择和固定的计算预算。
论文提出了SaveRouter,一个稀疏监督的LLM路由框架,它有选择性地获取查询-模型反馈,并在相关查询之间共享能力信息,在保持具有竞争力的路由质量的同时降低监督成本,并将盈亏平衡部署量减少1.9-9.5倍。
SeLMRoute 提出了一种大语言模型路由框架,将与候选模型无关的语义证据抽取与性能学习解耦。在 LLMRouterBench 上,跨越 15 个数据集和 20 个候选模型,该框架取得了 72.08% 的平均准确率,超越了最强的固定候选模型(69.23%),并同时支持面向性能和成本感知的路由决策。
一项研究发现,一个训练用于在模型之间进行选择的LLM路由器学会了任务识别而非难度评估,导致在保留任务上泛化能力差,但基于廉价模型输出的延迟策略带来了更好的性能。
本文挑战了在跨设备硬件评估中,rank portability 意味着 feasibility portability 的假设,通过基准测试表明,高秩相关性在联合硬件约束下并不能保证安全部署决策。
一家专注于AI的公司已经对最先进模型实施了每日预算限制,将大多数任务转向更便宜的模型,表明了AI成本管理的趋势。
文章探讨了更小的量化模型是否正在成为本地AI应用的首选,强调了它们在VRAM使用、性能和功能(如工具调用)之间的平衡。
FedFIbOS提出了一种基于Fisher重要性的方法,用于异构联邦学习中的最优子模型选择,该方法具有理论基础,并在非独立同分布设置下比现有最先进方法准确率提高约10%。
Eve 引入了使用 TypeSafe AI 的 Jev 实现自动工具审批和模型选择,通过 AI SDK 评估 API 为不同任务动态选择 AI 模型。
本文介绍了推理网络,一个基于图的框架,用于优化多个LLMs在推理中的使用,具有最优激活策略,可在满足性能目标的同时最小化成本。
作者构建了一个基于成本和性能数据自动路由 LLM 选择的系统,旨在优化 AI 支出,并计划将该工具开源。
一个Python和TypeScript库,用于下载大型语言模型目录,并构建管道以根据价格、延迟和基准测试等标准过滤和选择模型。
SCX Router 引入了一个基于GLiClass的轻量级模型选择工具,该工具使用解码器-KV分类器和任务本体来路由LLM任务,优化速度、成本和质量,无需自回归生成。
作者正在开发Agent-PGO,这是一个工具,可以分析AI代理的执行,动态地为不太关键的任务替换更便宜的模型,同时通过评估基准保持质量。
本文提出EEG-AS,一种算法选择框架,通过重建行为实现在多个EEG基础模型之间的实例级选择,从而提高神经解码性能。
本文提出一种递归公式,用于使用 Normalized Maximum Likelihood 模型高效计算具有聚类结构的向量的随机复杂性,将时间复杂度从多项式降低到线性。