从生产流量到后训练:构建覆盖企业请求混合的自托管LLM
摘要
一篇研究论文提出了一种方法,使用通过SLERP合并的单独GRPO专家来训练较小的自托管LLM,该LLM在企业任务上优于更大的基线模型,并以更低的成本服务一半的平台流量。
查看缓存全文
缓存时间: 2026/09/02 11:45
论文页面 - 从生产流量到后训练:构建覆盖企业请求组合的自托管大语言模型
来源:https://huggingface.co/papers/2609.01572 作者:
,
,
,
,
,
,
,
,
,
,
,
,
摘要
一个通过SLERP(球面线性插值)合并了独立GRPO专家的较小自托管大语言模型,在指令遵循、函数调用和内部任务上超越了一个规模远大的基线模型,同时以更低的成本承载了平台一半的流量。
数据驻留约束迫使企业自托管大语言模型,但持续采用更新的模型而不退役旧模型,导致服务集群扩张,从而分散了有限的GPU资源池。我们通过缩小生产错误分析中识别出的质量差距,将200多个内部应用程序的流量整合到单一模型上,这些差距涉及三个维度:指令遵循(https://huggingface.co/papers?q=instruction%20following)、函数调用(https://huggingface.co/papers?q=function-calling)和内部任务分布。质量通过按生产流量分层的离线基准测试进行跟踪,并由确定性验证器(https://huggingface.co/papers?q=deterministic%20verifiers)或校准的大语言模型评审(https://huggingface.co/papers?q=calibrated%20LLM%20judges)进行评分。我们没有联合优化所有目标(这会引入跨领域奖励干扰(https://huggingface.co/papers?q=reward%20interference)),而是为每个维度训练一个独立的GRPO(https://huggingface.co/papers?q=GRPO)专家,并通过两阶段SLERP(https://huggingface.co/papers?q=SLERP)将它们合并。每个专家的奖励揭示了一种独特的失败模式,即语义坍塌(https://huggingface.co/papers?q=semantic%20collapse)、过度调用(https://huggingface.co/papers?q=over-calling)和冗长性漏洞(https://huggingface.co/papers?q=verbosity%20hacking),每种模式都需要特定领域的修复。在非推理模式下,该方案在内部竞技场(Arena)上超越了总参数量约大7倍的基线模型,得分分别为69.6对比65.8,指令遵循(https://huggingface.co/papers?q=instruction%20following)得分0.85对比0.83,函数调用(https://huggingface.co/papers?q=function-calling)得分0.79对比0.77,同时提升了通用对话基准测试的表现。该模型吸收了50%的平台流量,每月处理1.16亿请求,而服务成本仅为其中一部分。
查看arXiv页面 (https://arxiv.org/abs/2609.01572) 查看PDF (https://arxiv.org/pdf/2609.01572) 项目页面 (https://huggingface.co/t-tech/T-pro-it-2.1) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.01572)
通过您的代理获取此论文:
hf papers read 2609\.01572
没有最新版CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型的README.md中引用 arxiv.org/abs/2609.01572 以将其从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集的README.md中引用 arxiv.org/abs/2609.01572 以将其从此页面链接。
引用此论文的Space0
没有Space链接此论文
在Space的README.md中引用 arxiv.org/abs/2609.01572 以将其从此页面链接。
包含此论文的合集0
没有合集包含此论文
将此论文添加到合集 (https://huggingface.co/new-collection) 以将其从此页面链接。
相似文章
我们不再手动优化 LLM 技术栈——现在它实现了自我优化
本文描述了一家企业如何实现向自我优化 LLM 技术栈的转型。该系统利用生产环境中的调用追踪数据,自动路由请求并微调模型,从而显著降低了成本并提升了性能。
生产环境中的高效基准测试:一项演化LLM代理研究
本文探索生产环境中LLM代理的高效重复评估方法,比较自适应测试和固定子集等技术,并提供部署的实用建议。
LLM服务的一年:负载演化、缓存与负载均衡
本文分析了来自Chutes的一年生产追踪数据,以研究LLM服务负载,揭示时间演化和用户-模型交互,以改进服务系统基准测试。
在与20多个在生产环境中运行LLM的团队交流后,三个痛点反复出现
基于与20多个团队的对话,作者指出了在生产中使用LLM时反复出现的三个痛点:仅企业版提供的基础功能、缺乏代理可观测性、以及新模型支持缓慢。
AutoLLMResearch:通过从低成本学习来优化高成本,训练研究智能体以自动化大型语言模型实验配置
本文介绍了 AutoLLMResearch,这是一个智能体框架,旨在通过在低保真环境中学习并外推至高成本设置,实现昂贵的大型语言模型(LLM)实验配置的自动化。其目标是减少可扩展 LLM 研究中的计算浪费以及对专家直觉的依赖。