释放大型语言模型的潜力:实现实时、企业级部署的蓝图

arXiv cs.LG 论文

摘要

这篇arXiv论文提出了一种统一的LLMOps架构,用于实时、企业级LLM部署,集成了数据摄入、持续学习、RAG和反馈循环。它引入了AIPO、STAR+FAR和SAGE等组件,以解决受监管行业中知识过时、幻觉和延迟-成本权衡的问题。

arXiv:2608.00419v1 公告类型:新 摘要:大型语言模型在实时、受监管的环境中部署时,面临知识过时、灾难性遗忘、幻觉和反馈循环薄弱等问题。我们提出了一种统一的、模式驱动的LLMOps架构,将实时数据摄入、持续学习、检索增强生成(RAG)和人在回路的反馈集成到单一操作管线中。四项贡献对应既定的软件设计模式:一种自适应摄入模式编排器(AIPO),通过FreshStreamBench进行评估;STAR+FAR持续学习,采用稀疏时间适配器路由和新鲜度感知重放;SAGE,一种SLO感知的自适应检索策略,预测每次查询的段落预算以满足尾部延迟目标;以及一个带RLHF触发器的自动化反馈驱动收敛阶段。该结果减少了延迟-成本-准确性权衡,同时支持医疗保健和金融等高风险行业的可审计性和回滚。
查看原文
查看缓存全文

缓存时间: 2026/08/04 07:41

# 释放大型语言模型的潜力:面向实时、企业级部署的蓝图
来源:https://arxiv.org/abs/2608.00419
查看 PDF(https://arxiv.org/pdf/2608.00419)

> 摘要:在实时、受监管的环境中部署的大型语言模型面临知识过时、灾难性遗忘、幻觉以及反馈回路薄弱等问题。我们提出了一种统一的、模式驱动的 LLMOps 架构,将实时数据摄取、持续学习、检索增强生成(RAG)和人在回路反馈集成到单一操作流水线中。四项贡献对应成熟的软件设计模式:自适应摄取模式编排器(AIPO),通过 FreshStreamBench 进行评估;STAR+FAR 持续学习,采用稀疏时间适配器路由和新鲜度感知回放;SAGE,一种 SLO 感知的自适应检索策略,预测每次查询的段落预算以满足尾延迟目标;以及一个自动化的、反馈驱动的收敛阶段,带有 RLHF 触发机制。该成果在降低延迟-成本-准确性权衡的同时,支持医疗保健和金融等高风险行业的可审计性和回滚。

## 提交历史

来自:Muhammad Faizan Raza \[查看电子邮件(https://arxiv.org/show-email/71e45c24/2608.00419)\] **\[v1\]** 2026年8月1日星期六 03:40:22 UTC(543 KB)

相似文章

DeepSeek LLM:以长期主义扩展开源语言模型

Papers with Code Trending

DeepSeek LLM是一个开源语言模型项目,它开发了一个大规模数据集,并采用SFT和DPO,在各种基准测试和开放式评估中实现了超越LLaMA-2 70B和GPT-3.5的性能。

ProactiveLLM: 学习主动交互的流式大语言模型

arXiv cs.CL

ProactiveLLM 提出了一种方法,使流式大语言模型能够基于内源性线索主动决定何时生成输出,通过基于掩码的流式建模和同步特权自蒸馏,在无需外部标注的情况下降低延迟。

大语言模型部署最佳实践

OpenAI Blog

Cohere、OpenAI 和 AI21 Labs 联合发布了大语言模型开发和部署的初步最佳实践,涵盖使用指南、安全措施、偏差缓解、文档、多元化团队和伦理劳动标准。