从单体融合到代理编排:大规模对话助手的动态响应

arXiv cs.AI 论文

摘要

本论文报告了一次客户支持对话助手的生产迁移,将单体AI模型替换为代理编排系统,以提高精度、减少幻觉并降低服务成本。

arXiv:2609.05758v2 公告类型:新 摘要:对话助手可以在单一模型路径中融合检索、行动选择、升级和措辞,或分离这些角色。我们报告了一次大型住宿市场(每月数百万对话,11种语言,10秒P90)客户支持助手的生产迁移。动态响应(DR)将单一的Qwen3-235B-A22B融合响应器替换为一个有界ReAct编排器,该编排器使用类型化工具,并配合一个较小的生成器,从后端验证的上下文契约中生成内容。由于迁移还改变了提示、对齐和服务,我们将每个效应归因于其原因,并仅将那些在相同重放回合上测量的效应称为架构效应:类型化实体选择将预订选择器移至精度优先的操作点(精度从8.3%提升至89.1%,召回率从75.2%降至67.3%),而带有成员检查的类型化行动ID消除了观察到的结构化行动幻觉(从2.14%降至0.0%)。一个低坡度A/B测试重现了重放升级减少:硬升级响应从5.60%降至3.08%,软升级响应从9.56%降至2.49%,同时生产交接量大致保持稳定;自解具有方向性(+5.1点,95% CI [-2, +12])。服务优化将编排器P90延迟从3.87秒降至2.24秒,GPU占用减少约三分之一,自托管将估计的年度模型服务成本降低了一个数量级以上。
查看原文
查看缓存全文

缓存时间: 2026/09/10 08:41

# 从单体融合到智能体编排:面向大规模对话助手的动态响应机制  
来源:https://arxiv.org/html/2609.05758  

彭 王, 博 师, 育峰 张, 英 吕  
附属机构:万梦 任, 罗伯特 薛, 克莱尔 纳 程, 亚沙尔 梅赫达德  
附属机构:Airbnb, Inc\.  
附属机构:\{mia\.zhao, peng\.wang, chuan\.shi, wayne\.zhang, ying\.lyu, emma\.ren, robert\.xue, claire\.cheng, yashar\.mehdad\}@airbnb\.com  

###### 摘要

对话助手可以在单一模型路径中融合检索、动作选择、升级和措辞,或将这些角色分离。我们报告了某大型住宿市场(每月数百万对话,支持11种语言,10秒P90响应)客户支持对话助手的生产环境迁移。动态响应(DR)用一个基于类型化工具的有限ReAct编排器,加上一个更小的生成器(该生成器依据后端验证的上下文契约来书写回复),替代了原先融合一切的单一Qwen3-235B-A22B模型。由于迁移同时改变了提示词、对齐方式和服务方式,我们将每种效应归因于其特定原因,并仅将那些在相同重放轮次上测量到的效应视为架构效应:类型化实体选择将预订选择器移动到以精度为先的操作点(召回率从75.2%降至67.3%时,精度从8.3%提升至89.1%);带成员检查的类型化动作ID则消除了观察到的结构化动作幻觉(从2.14%降至0.0%)。一项低流量A/B测试复现了重放时的升级响应降幅:硬升级响应从5.60%降至3.08%,软升级响应从9.56%降至2.49%,同时生产环境的转接量大致保持稳定,自助解决率呈正向趋势(+5.1个百分点,95% CI [-2, +12])。服务优化将编排器的P90延迟从3.87秒降至2.24秒,同时GPU占用减少约三分之一;自托管将预估的年度模型服务成本降低了一个数量级以上(见附录F (https://arxiv.org/html/2609.05758#A6))。

## 1 引言

基于大语言模型(LLM)构建的对话助手正日益充当一线客户支持专员。在我们的场景中,助手需要回答政策问题、选择结构化的取消与退款流程、提出澄清问题,并在自动化应停止时路由至人工。每个轮次必须符合10秒的端到端P90预算,包括跨11种语言的翻译。核心的系统性难题在于,支持轮次同时需要*决策制定*和*措辞生成*。一个单一的融合响应器可以检索上下文、选择实体或动作、决定是否澄清或升级,并撰写回复,但这些职责的失败模式不同。错误的实体卡片、不支持的动作语言或过早的人工转接,当路由和文本在同一个生成路径中产出时,就变得难以定位。动态响应(DR)将这些角色分离。一个大型编排器负责规划、调用类型化工具,并掌控路由、动作和升级决策;一个更小的生成器依据后端验证的上下文契约来撰写面向用户的回复。我们聚焦于系统设计;评分工具构建、离线到在线校准以及发布决策方法论是配套的评估工作。由于迁移同时改变了架构、提示词、对齐方式和服务方式,我们将每种报告的效应归因于其特定原因,并仅将那些在相同重放轮次上测量到的效应视为架构效应(表2 (https://arxiv.org/html/2609.05758#S6.T2));其余结果则是系统迁移的整体成果。我们做出四项贡献。与带API封装的RAG工作流不同,DR结构化并记录了中间决策,将生成约束为编排器决策和检索证据,并使用角色特定的模型规模。其可转移的原则是:将高后果决策转化为显式的、经后端验证的类型化工具,并将措辞保留在下游并加以约束。具体包括:(1)生产环境解耦,即分离编排与最终文本的类型化上下文契约;(2)工具中介的运行时,具备有限ReAct规划、类型化模式、边界防护和保守回退;(3)服务方案,即基于vLLM自托管的开放权重MoE,采用张量并行服务、FlashInfer、EAGLE-3推测解码以及延迟适配的布局;(4)运营经验,涉及上下文交接、工具误报、软升级、以及开放权重的成本与控制权衡。

## 2 背景与问题设定

### 2\.1 任务

当客人或房东发起支持请求时,助手必须理解请求、检索用户状态(预订、房源、支付、账户)、检索政策与帮助中心证据,并在结构化动作卡片、澄清性问题、信息性回答和人工路由之间做出选择。许多轮次需要跨源推理:一次取消可能取决于预订日期、房源政策、支付状态和地区规则。系统还必须支持翻译、避免不支持的动作、保持引用可追溯并保留人工转接能力;这些约束使得架构与基础模型的选择同等重要。

### 2\.2 单体融合基线

前代系统使用相同的Qwen3-235B-A22B类模型作为单体响应器。后端服务预组装了候选的帮助或政策片段、用户状态变量和可渲染的结构化动作候选。单一的融合模型路径随后选择响应策略、决定是呈现动作还是升级,并撰写面向用户的回复;后端规则验证可渲染性、阻止不支持的输出并提供保守回退。这种设计简单且避免了第二次模型调用,但它将*做什么*与*说什么*纠缠在一起:错误的动作、不支持的转接语言或错误的实体引用都出现在同一个生成痕迹中,难以归咎于检索、路由或措辞。添加工具也扩大了融合提示词,因为每项能力都必须暴露给产出最终文本的路径。DR在保持相同的大模型推理能力用于规划的同时,使路由、工具使用和最终措辞变得可独立观察和控制。一个更强的单体系统(使用受控解码或结构化JSON输出)可以强制语法有效性,但路由和文本仍将共享一个无法单独定位、门控或回滚的生成痕迹,且角色特定的模型规模配置仍将无法实现。

### 2\.3 相关工作

DR结合了RAG、工具使用智能体和LLM服务的思想。RAG(Lewis等人, 2020 (https://arxiv.org/html/2609.05758#bib.bib5))将生成建立在检索证据的基础上,但单次传递的RAG式支持系统仍然可能耦合证据选择、动作选择、升级和最终措辞。基于思维链提示(Wei等人, 2022 (https://arxiv.org/html/2609.05758#bib.bib4)),ReAct(Yao等人, 2023 (https://arxiv.org/html/2609.05758#bib.bib1))交错推理和行动,这自然映射到支持解决过程(作为工具调用加上观察),而工具增强LLM(Schick等人, 2023 (https://arxiv.org/html/2609.05758#bib.bib2); Qin等人, 2024 (https://arxiv.org/html/2609.05758#bib.bib3))研究模型如何选择和使用外部工具。服务效率也很重要,因为编排必须符合生产延迟预算:混合专家模型(Shazeer等人, 2017 (https://arxiv.org/html/2609.05758#bib.bib18))、分组查询注意力(Ainslie等人, 2023 (https://arxiv.org/html/2609.05758#bib.bib17))、vLLM(Kwon等人, 2023 (https://arxiv.org/html/2609.05758#bib.bib12))和推测解码(Leviathan等人, 2023 (https://arxiv.org/html/2609.05758#bib.bib13); Chen等人, 2023 (https://arxiv.org/html/2609.05758#bib.bib31))使得大型路由模型的实际服务成为可能。智能体框架如AutoGen(Wu等人, 2023 (https://arxiv.org/html/2609.05758#bib.bib25))、LangGraph(LangChain, 2024 (https://arxiv.org/html/2609.05758#bib.bib26))、Smolagents(Hugging Face, 2025 (https://arxiv.org/html/2609.05758#bib.bib27))和CrewAI(CrewAI, Inc., 2024 (https://arxiv.org/html/2609.05758#bib.bib28))提供了有用的编排抽象,但我们的部署需要后端强制控制路由、防护栏位置、日志记录、上下文交接和回退行为。与我们场景最接近的是近期的LLM客户支持智能体:用于解决真实电子商务问题的基准测试(Wang等人, 2025 (https://arxiv.org/html/2609.05758#bib.bib21))和用于在对话式产品搜索中提出澄清问题的基准测试(Ye等人, 2025a (https://arxiv.org/html/2609.05758#bib.bib22)),以及围绕持续改进数据飞轮(Zhao等人, 2025 (https://arxiv.org/html/2609.05758#bib.bib23))和带智能体反馈的增量摘要(Wu等人, 2025 (https://arxiv.org/html/2609.05758#bib.bib24))构建的已部署系统。这些工作针对任务性能、数据循环和辅助功能,并且通常评估单一的端到端策略。DR则相反,将高后果决策转化为类型化的、经后端验证的工具调用,并在相同的重放轮次上明确归因报告迁移效果;我们发布门背后的评估方法论是配套工作。

## 3 动态响应架构

### 3\.1 设计原则与运行时

DR遵循三条设计规则。**将路由与措辞分离**:编排器选择工具、动作和升级;生成器撰写回复而不覆盖这些决策。**按需检索**:编排器仅请求当前轮次所需的上下文,并将精心策展的状态传递给生成器。**使控制流可观察**:每个编排步骤都记录为结构化事件,以便故障可定位,并在合适的边界附加防护栏。图1 (https://arxiv.org/html/2609.05758#S3.F1)展示了运行时。在输入安全检查和翻译之后,编排器进入一个最多三步的有限ReAct循环。它可能调用检索工具、选择器工具、升级工具或响应生成;工具观察结果被追加到编排状态中。一旦选择了响应生成,生成器接收类型化上下文契约并撰写最终回复。生成后检查会在交付前验证格式、引用、不支持的动作和安全敏感输出。

用户消息 \(\+\+翻译\)前防护栏(输入安全)编排器\(Qwen3-235B-A22B\)有限ReAct循环(≤3步)工具:用户状态变量/知识库/服务代理检索、选择器、升级生成器\(Qwen3-Next-80B-A3B\)撰写面向用户的回复后防护栏(输出安全、格式、风险)响应/结构化动作观察图1:DR运行时。大型编排器在有限ReAct循环中规划并调用工具;较小的生成器根据类型化契约撰写。防护栏包裹输入、工具使用和输出。
### 3\.2 模型角色

编排器是一个经过微调的开放权重MoE模型,Qwen3-235B-A22B(Qwen团队, 2025 (https://arxiv.org/html/2609.05758#bib.bib19)),总参数235B,激活参数22B。它与单体基线使用的大型模型类别相同,但DR将其限制为结构化的工具调用决策、终端动作和回退条件,而非面向用户的文本。生成器是Qwen3-Next-80B-A3B,选择它是因为最终回复较长且必须符合延迟预算。它依据第4节 (https://arxiv.org/html/2609.05758#S4)中的契约进行书写,不能选择新动作、调用检索或发起升级。

### 3\.3 工具注册表

编排器使用一个类型化注册表(完整模式见附录C (https://arxiv.org/html/2609.05758#A3), 表13 (https://arxiv.org/html/2609.05758#A3.T13))。每个条目定义了模式、资格、日志字段和防护栏钩子。面向客户的工具改变客户体验;内部工具检索上下文或约束动作空间。工具输出尽可能为小型类型化对象,允许后端在生成前验证ID、原因代码和来源成员资格。

### 3\.4 两阶段部署

DR分两个阶段发布,均保留对先前路径的回退以隔离迁移风险。阶段1使用单个编排器调用,基于预获取的上下文,保留大部分后端同时验证结构化路由;与单体不同,它调用单独的生成器而非直接撰写最终文本。阶段2引入了完整的工具中介循环,让编排器决定调用哪些检索工具、是否需要实体选择、结构化动作是否适用以及何时运行生成。下面报告的架构局部收益来自阶段2的类型化决策;阶段1主要用于验证结构化路由和交接,阶段间消融分析超出范围。

## 4 上下文契约、防护栏与回退

### 4\.1 上下文契约

编排器和生成器之间的交接是一个产品接口,而非提示词细节。正向契约传递任务状态、可用工具、检索的来源、用户状态变量、政策约束、区域设置和先前观察。反向契约包含回复文本、来源引用、可选的编排器选择的动作卡片引用以及渲染字段;完整字段见附录A (https://arxiv.org/html/2609.05758#A1)。两个约束是核心。第一,生成器只能引用契约中存在的工具、来源和用户状态键,生成后检查强制执行此封闭性。第二,交接包含保持一致性所需的编排状态,而不仅是引用的片段:仅引用式交接虽更短,但丢失了上下文(例如为什么某个动作不可用)。

### 4\.2 防护栏与回退

DR在编排之前、ReAct循环内部和生成之后放置防护栏。前检查分类输入安全性和资格;中间检查验证工具模式、资格以及与先前状态的一致性;后检查验证引用、动作卡片ID、格式和风险敏感措辞。如果编排器超出迭代限制、发出无效工具调用或收到不一致的观察结果,DR将回退到基于可用上下文的保守生成。回退不能发明动作或绕过安全路由;每次回退都记录其触发原因,将基础设施故障(超时、格式错误的工具结果)与策略故障(无合格动作、状态模糊)分开,后者需要不同的所有者处理。

## 5 模型与服务选择

### 5\.1 开放权重服务

编排器和生成器在vLLM(Kwon等人, 2023 (https://arxiv.org/html/2609.05758#bib.bib12))上自托管。开放权重使我们能够通过全参数偏好优化(附录E (https://arxiv.org/html/2609.05758#A5))将模型与策略对齐、保持预生产和生产环境设置一致、针对我们的流量模式调整服务,并运行大型影子测试;奖励校准到生产自助解决率超出范围。以我们的流量规模和解码设置,相对于专有API基线,自托管将预估的年度模型服务成本降低了一个数量级以上;这些是内部数量级估计,其基础、范围和排除项详见附录F (https://arxiv.org/html/2609.05758#A6)。

### 5\.2 推理引擎调优

编排器在H100 GPU上运行确定性解码,其中延迟而非吞吐量是约束条件。从张量加专家并行切换到仅张量并行服务(Shoeybi等人, 2019 (https://arxiv.org/html/2609.05758#bib.bib16))、启用异步调度以及使用FlashInfer内核(Ye等人, 2025b (https://arxiv.org/html/2609.05758#bib.bib15))将P90延迟从3.87秒降至2.24秒,同时减少了GPU占用。

相似文章

关于长期代理的思考

Reddit r/AI_Agents

作者讨论了从将自助入职重建为代理流程中获得的见解,强调了将确定性任务管理与非确定性LLM操作相结合的长期代理如何提高企业AI部署的可靠性并减少幻觉。