如何训练一个现实世界的硅基助手?将复杂业务工作流内化至单一模型

arXiv cs.CL 论文

摘要

本文提出OneModel,一种统一的AI范式,将复杂业务工作流整合到单一模型的参数中,通过持续预训练和逻辑编译,在金融服务中实现超过50%的延迟降低和准确性的提升。

arXiv:2608.20350v1 Announce Type: new 摘要:传统工业代理依赖于模块化管道,包括路由器、检索器、规划器、执行器、响应器、审查器等组件。这些系统常常因临时补丁而变得错综复杂,导致错误级联和高延迟。我们提出OneModel,一种从外部工作流到内化知识表示的范式转变。与将流动用户意图切割成静态步骤的模块化系统不同,OneModel将复杂的业务逻辑和标准操作流程直接整合到模型参数中。通过持续预训练(CPT)和逻辑编译SFT,我们在统一的注意力空间中将碎片化的业务规则转化为直观的模型推理。在全球金融服务系统中部署后,OneModel有效打破了延迟、准确性和复杂性之间的权衡。在线A/B测试显示端到端延迟降低了50%以上,从18.7秒降至8.0秒,同时智能解决率(IRR)从64.3%提升至83.3%。结果表明,OneModel可以用内化的认知直觉取代脆弱的工程逻辑,为工业代理从复杂、易出错的工作流程过渡到统一模型架构提供可扩展的蓝图。
查看原文
查看缓存全文

缓存时间: 2026/08/24 04:08

# 如何训练现实世界的硅管家?将复杂业务工作流内化至单一模型
来源:https://arxiv.org/html/2608.20350
###### 摘要

传统的工业智能体依赖模块化流水线,包括路由器、检索器、规划器、执行器、响应器、审查器等,这些不可避免地演变为由临时补丁构成的迷宫,导致错误级联与高延迟。我们提出**OneModel**,一种从外部工作流转向内化知识表征的适用范式。与将流动用户意图切割为静态步骤的模块化系统不同,**OneModel**将复杂业务逻辑与标准操作流程直接整合到模型参数中。通过持续预训练和逻辑编译式监督微调,我们将碎片化的业务规则转化为统一注意力空间内的模型直观推理。部署于我们的全球金融服务系统中,**OneModel**有效打破了延迟、准确率与复杂度的权衡困境。在线A/B测试显示,端到端延迟降低超过50%(18.7秒→8秒),智能解决率从64.3%跃升至83.3%。结果表明,我们的**OneModel**范式通过内化认知直觉有效替代了脆弱的工程逻辑,为工业智能体从复杂易错的工作流转向统一模型架构提供了一个可扩展且面向未来的蓝图。

如何训练现实世界的硅管家?将复杂业务工作流内化至单一模型

蚂蚁国际

## 1 引言

参见图1:传统基于PEER的模块化工作流(左)与我们提出的**OneModel**内化知识流水线(右)的架构对比。PEER通过六个串行阶段分解查询,而**OneModel**将智能整合到统一的注意力空间中,从而隐式地利用了模型的演进和涌现能力。我们的在线A/B测试相比传统复杂工作流,实现了90%+的精度与50%+的延迟降低(18.7秒→8秒)。传统工业复杂业务服务标准主要依赖模块化与智能体工作流,如**路由–检索–规划–执行–表达–审查(PEER)**。实践中,这种架构不可避免地碎裂为由临时补丁构成的迷宫。为缓解特定坏案例,工程师被迫实施复杂的流量分流逻辑,创建专门的、更窄的子链路来处理诸如意图模糊澄清、用户反问或多模态输入等场景。虽然这种复杂的流水线理论上提供了故障隔离,但在强大基础模型的时代,它们正日益成为瓶颈。

这种僵化的碎片化为智能设置了上限。通过将流动的用户意图切割为静态、预定义的子步骤,大多数现有架构未能利用现代或未来基础模型固有的涌现能力。此外,这种复杂性使得错误归因成为重大挑战:当系统失效时,难以精确定位具体的责任模块,使得增量式改进系统变得极其困难。关键的是,这些模块的串行依赖性造成了级联错误累积的风险:上游模块的微小不准确(例如检索噪声或意图不对齐)在向下游传播时会被放大。在模块化系统中,最终的生成模型通常“盲目信任”这些检索到的上下文,导致产生自信但事实错误的幻觉。最后,多个流水线的串行执行可能显著增加首Token延迟,在速度至关重要的时刻损害用户体验。

为了解决这些结构性障碍并确保工业部署面向未来,我们探索了**OneModel**范式,将重点从外部工作流转向内化知识。部署于我们大规模且高风险的金融商户服务系统中,**OneModel**采用单一模型架构。通过将完整的交互循环——涵盖意图推理、工具使用与标准操作流程遵循——整合到一个统一的注意力空间中,这种方法将领域和企业知识内化为用于直接生成的内在参数。

然而,直接将易变数据(例如汇率)注入参数会产生反效果,导致“知识过时”和幻觉,因为频繁重训练的成本过高。为了协调参数刚性与操作流动性,我们提出了分层知识管理与注入策略。我们严格将持续预训练保留给静态的基本领域原理,以建立稳健的语义基础。半静态的程序化业务逻辑——包括复杂的标准操作流程和响应脚本——通过监督微调编译为直观推理。同时,强化学习用于解决易出错的细微差别和机械化的表述,强化通过持续预训练内化的知识,并针对监督微调无法覆盖的长尾失败。最后,易变的交易上下文通过动态上下文注入进行解耦,确保实时准确性而无需承担重训练的负担。

广泛的在线A/B测试确认**OneModel**有效打破了延迟、准确率与复杂度的权衡。我们还意外发现,**OneModel**能够以一种有机、类人的方式处理复杂的多轮咨询,这是传统基于规则或模块化流水线难以复制的。我们的成功部署为整个行业提供了一个引人注目的概念验证:将重心从繁重的工作流工程转向工业模型演进,对于未来自主企业智能体至关重要且关键。

## 2 现实世界应用

在蚂蚁国际,一家领先的全球支付和金融公司,我们在**全球商户服务智能体**上部署了**OneModel**。这个集中式系统是关键任务系统,自动化了数千项复杂的金融操作——从跨境支付咨询到复杂的退款纠纷和电子商务结算。鉴于金融交易的高风险性,任何部署都需要严格验证。因此,我们进行了为期数周的广泛在线A/B测试,将我们提出的**OneModel**与现有的模块化基线(标准PEER流水线)进行对比。为全面评估这一转型,我们彻底监控了三个不同的维度:系统效率(延迟)、业务有效性(解决率)和交互质量(专家标注)。

值得注意的是,我们的80亿参数**OneModel**达到了90.75%的峰值解决率,显著优于商业基线,包括Claude-3.5-Haiku (86.72%)、Gemini-2.5-Pro (87.55%) 和 GPT-5.2 (87.55%)。在业务成果方面,整体智能解决率——定义为无需升级到人工客服即可由AI智能体完全解决的用户咨询百分比——从64.3%飙升至83.3%。在操作层面,统一架构消除了模块间开销,实现了显著的57.2%延迟降低——对于面临金融不确定性的急躁用户来说,这是一项关键改进。

## 3 方法:OneModel范式

为弥合碎片化模块化工作流与整体推理需求之间的鸿沟,**OneModel**采用分层知识管理与注入策略。该方法根据易变性和复杂性将业务智能分为三个层级,并通过多阶段训练流水线将其内化。

### 3.1 分层知识管理

与将所有数据视为外部证据的传统RAG密集型系统不同,我们的框架首先区分领域知识的层次结构,以优化参数刚性与操作流动性之间的权衡:

*   **基本领域公理(静态)**:核心金融原理与多语言语义。
*   **程序化业务逻辑(半静态)**:复杂的标准操作流程与决策流。
*   **易变交易上下文(动态)**:实时数据(例如汇率)。

### 3.2 第一阶段:知识注入与反思

为摆脱对脆弱外部检索的依赖——这是传统模块化工作流中的常见瓶颈——我们将内在领域专业知识视为首要需求。我们实施持续预训练,将模型的分布从通用文本转移到我们金融生态系统的严格逻辑上。主要目标是为一个紧凑的基础模型配备“专家级”的闭卷能力,有效模拟人类专家密集的入职和考核过程。

为此,我们采用了一个双阶段内化范式,旨在不仅记忆事实,还将领域特定知识转化为可操作的参数记忆:**知识注入**和**知识反思**。

#### 阶段一:知识注入,构建参数基础。

初始阶段专注于构建一个密集的、“全栈”的业务知识背景。我们不是不加区分地输入原始文本,而是聚合了一个多样化的、多层次的数据集,包含官方业务手册、结构化的内部常见问题解答以及经严格审查的在线问答“坏案例”。通过整合标准的声明性规则和细微的、现实世界的例外情况,我们系统地消除了模型在理解业务逻辑时的关键盲点。因此,这一阶段超越了标准的语言建模;它是一个有针对性的知识注入,确保模型的参数记忆足够深入和广泛,以支持后续的高风险推理任务。

#### 阶段二:知识反思,激活记忆。

然而,建立记忆库是不够的。我们的研究结果表明,原始的参数知识往往保持“休眠”状态;如果没有适当的基于场景的刺激,模型的行为更像一个被动的信息存储库,而非主动的问题解决者。为了将休眠记忆转化为主动的认知能力,我们使用知识压缩技术实施了一个双阶段激活流水线。

首先,我们利用小批量监督微调作为验证探针,以识别和映射高影响的业务场景。这些探针帮助我们分离出用于检索、记忆和反思的基本认知触发器。在随后的合成阶段,我们利用这些经过验证的场景作为蓝图来重构原始预训练语料,最终合成了一个用于复杂推理的大规模、高质量持续预训练训练集。通过仅在经过此迭代验证后才承诺进行全规模训练,我们成功地将模型从简单的文本补全中转型,确保内化的参数完全为第二阶段的显式逻辑编译做好了准备。

### 3.3 第二阶段:逻辑编译

为将内化知识转化为可操作的推理,我们利用一种专门的监督微调范式,旨在解锁模型潜在的分析能力。为了激活在持续预训练阶段内化的知识,我们首先使用从持续预训练语料构建的极其有限的问答对开发了一个数据增强流水线。每对数据都在思考过程中增强了自我反思的推理过程,以帮助模型理解其内部记忆。然后,我们将复杂的业务标准操作流程、标准化响应模板和基本工具使用“编译”到模型的直观推理路径中。通过混合直接回答、基于检索增强生成条件的样本和结构化召回,我们确保模型能够灵活地将其参数应用于多样化的查询类型。

### 3.4 第三阶段:对齐与优化

在此阶段,我们使用强化学习来解决长尾失败、高级函数调用推理,并减少基础模型中普遍存在的机械化学表述,使我们的助手模型更具人情味。利用高保真用户模拟器,我们对模型进行微调,以处理多轮对话的细微差别并在严格遵守金融合规的同时保持拟人化的共鸣。

#### 多目标奖励建模

为使模型偏好与专业质量标准对齐,我们开发了一个多目标奖励模型,该模型在技术和行为维度的层次分类法上评估智能体性能。表10展示了详细的评分标准,可以将服务卓越性分解为细粒度指标,从客观的标准操作流程遵循和信息安全,到主观的情感共鸣和语言一致性。通过从整体评分方法转向分解的评分逻辑,我们确保模型获得密集的、多方面的反馈,明确惩罚特定的失败模式——如逻辑矛盾或程序偏差——同时奖励拟人化的灵活性。此外,该奖励模型被集成到数据飞轮架构中;该系统自动化了坏案例归因,并促进了实时数据积累,以迭代地改进跨100多个业务类别的评估标准。

#### 多维度用户模拟

为实现高保真度的多轮强化学习,我们实施了一个归纳式用户模拟器,它直接从真实服务日志中重建潜在人物画像,而不是依赖于抽象的基于规则的定义。每个人物画像通过四维属性矩阵定义:背景描述、知识盲点、操作历史和问题规格。通过从历史人机对话中提取这些属性,模拟器保留了用户意图的自然分布以及金融服务交互中固有的特定认知差距。

模拟通过两阶段训练过程进行优化。在监督微调阶段,模型在筛选后的人机对话和高质量合成数据的混合数据上进行训练,以掌握多样化的对话风格,如碎片化陈述和多轮咨询。随后是直接偏好优化阶段,它特别惩罚通过基于规则的判别器识别出的重复或机械化的响应模式,确保模拟器保持自然、类人的语言轨迹。

#### 多轮强化学习

强化学习框架优化多轮对话轨迹,使模型能够在延长的交互中改进其对话策略。通过整合检索增强生成推理,该框架确保每轮对话都基于外部知识,利用与我们i

相似文章

@oneill_c: https://x.com/oneill_c/status/2054604986269802579

X AI KOLs Timeline

文章指出,严肃的AI公司正从封装通用模型转向使用专有交互数据训练自己的专业化模型,因为在分布内智能体任务中,专业化现在经常能匹配甚至超越前沿模型,从而推动更好的单位经济效益。