标签
本文提出了一种针对多LLM协作的9种模型选择算法的分类体系,研究表明,在数学、编程、问答和推理任务中,基于能力感知的选择策略相比随机或启发式的团队组建方式,性能提升最高可达36.1%。
本文探讨了企业将AI从实验阶段转向生产阶段时的经济策略,重点在于根据工作负载需求和成本可预测性,评估所有权与消费模式。
论文提出了SaveRouter,一个稀疏监督的LLM路由框架,它有选择性地获取查询-模型反馈,并在相关查询之间共享能力信息,在保持具有竞争力的路由质量的同时降低监督成本,并将盈亏平衡部署量减少1.9-9.5倍。
SeLMRoute 提出了一种大语言模型路由框架,将与候选模型无关的语义证据抽取与性能学习解耦。在 LLMRouterBench 上,跨越 15 个数据集和 20 个候选模型,该框架取得了 72.08% 的平均准确率,超越了最强的固定候选模型(69.23%),并同时支持面向性能和成本感知的路由决策。
一项研究发现,一个训练用于在模型之间进行选择的LLM路由器学会了任务识别而非难度评估,导致在保留任务上泛化能力差,但基于廉价模型输出的延迟策略带来了更好的性能。
本文挑战了在跨设备硬件评估中,rank portability 意味着 feasibility portability 的假设,通过基准测试表明,高秩相关性在联合硬件约束下并不能保证安全部署决策。
一家专注于AI的公司已经对最先进模型实施了每日预算限制,将大多数任务转向更便宜的模型,表明了AI成本管理的趋势。
文章探讨了更小的量化模型是否正在成为本地AI应用的首选,强调了它们在VRAM使用、性能和功能(如工具调用)之间的平衡。
FedFIbOS提出了一种基于Fisher重要性的方法,用于异构联邦学习中的最优子模型选择,该方法具有理论基础,并在非独立同分布设置下比现有最先进方法准确率提高约10%。
Eve 引入了使用 TypeSafe AI 的 Jev 实现自动工具审批和模型选择,通过 AI SDK 评估 API 为不同任务动态选择 AI 模型。
本文介绍了推理网络,一个基于图的框架,用于优化多个LLMs在推理中的使用,具有最优激活策略,可在满足性能目标的同时最小化成本。
作者构建了一个基于成本和性能数据自动路由 LLM 选择的系统,旨在优化 AI 支出,并计划将该工具开源。
一个Python和TypeScript库,用于下载大型语言模型目录,并构建管道以根据价格、延迟和基准测试等标准过滤和选择模型。
SCX Router 引入了一个基于GLiClass的轻量级模型选择工具,该工具使用解码器-KV分类器和任务本体来路由LLM任务,优化速度、成本和质量,无需自回归生成。
作者正在开发Agent-PGO,这是一个工具,可以分析AI代理的执行,动态地为不太关键的任务替换更便宜的模型,同时通过评估基准保持质量。
本文提出EEG-AS,一种算法选择框架,通过重建行为实现在多个EEG基础模型之间的实例级选择,从而提高神经解码性能。
本文提出一种递归公式,用于使用 Normalized Maximum Likelihood 模型高效计算具有聚类结构的向量的随机复杂性,将时间复杂度从多项式降低到线性。
本文详细介绍了 ChatGPT Work 的功能和特点,这是 OpenAI 开发的一款强大AI工具,仅面向付费用户,重点介绍了其基于云的服务,例如代码执行和模型选择。