@arunmoorthy05: https://x.com/arunmoorthy05/status/2099936495465631943

X AI KOLs Timeline 新闻

摘要

Pace 详细介绍了他们改进保险文档 AI 提取代理的方法,通过优化基于历史数据的子代理委派、模型路由和上下文,从而降低成本和延迟。

https://t.co/PNmKAGHq9n
查看原文
查看缓存全文

缓存时间: 2026/09/16 05:59

部署自改进代理

科技界对自改进代理热议纷纷。但在企业级代理中部署自我改进机制仍存在明显差距。核心问题在于:自我改进并非一刀切。行业的具体需求与收到的反馈类型,将深刻影响生产环境中自我改进功能的部署方式。

在 Pace 公司,我们处理的是最复杂的保险任务之一,涉及大量长文档及无数边界案例。从这些文档中提取字段并评估规则是个极其困难的任务,而这正是我们提取代理的核心职责。

部分客户每天需处理数千份文档,这引出了一个关键问题:我们如何能随时间推移提升提取代理的准确性、降低延迟并控制成本?

我们的提取代理如何工作?

Pace 的典型提取任务涉及复杂文档与大量要求提取的字段。宏观来看,我们的提取流程如下:

其中包含几个关键动态组件:

  • 子代理委派 - 采用 MapReduce 式架构,将工作分配给多个子代理,并在最后合并输出结果

  • 模型 - 驱动每个提取子代理的底层模型

  • 上下文 - 每个子代理获得的描述信息,这些信息取决于其所提取的字段

针对每个组件,我们需做出决策并解决以下问题:

  • 如何划分提取字段?这种划分是否达到最优?

  • 采用何种模型?如何为每个提取子任务选择最佳模型?

  • 需要提供哪些上下文?收到反馈后如何调整上下文?

我们的核心理念非常明确:

对于提取任务,必然存在最优的子代理委派方案、模型选择与上下文配置。随着处理任务量增加,我们能发现更多模式与边界案例,从而逐步“下降”至那个最优代理状态。

子代理委派

将工作分配给不同子代理时,我们追求最优的并行分发(fanout)效果。

此处的“最优”如何定义? 执行分发时,主要的低效来源是兄弟子代理之间的重复工作。

分发机制必不可少,因为单一代理无法处理我们平均任务涉及的所有字段。将所有字段塞入单个代理会导致成本与延迟激增,同时准确性下降。

因此,问题转化为 “如何在保持子代理并行化的同时限制重复工作?”

答案藏于历史运行数据中,但我们需先构建证据体系。

方法很简单:查找字段在历史记录中的出现位置,构建一张图来表征哪些字段倾向于相邻出现。

于是我们可以构建这样一张图:

  • 节点 = 提取字段

  • = 两个字段共享证据的置信度

通过增量构建每次历史运行的图,最终能清晰呈现哪些字段应被分组处理:

这些连接的强度取决于两个字段相邻出现的置信度。一旦计算出字段间的关联关系,就能高效创建字段分组,最终减少子代理间的重复工作量。

这不仅帮助我们实现最优分组,还能向代理“提示”这些字段在文档中的可能位置——因为我们已确定它们共享证据。

通过定期运行此图构建流程,整个提取代理系统每天都在向正确方向迈进。这种“更智能的分发”已显示出减少子代理重复阅读文档的良好效果,平均降低成本19%、延迟16%

模型路由

在确定如何划分子代理工作后,我们进入模型层。

考虑以下目标:

  • 子代理A - 提取个人身份信息(如名、姓、邮箱、住址、出生日期等)

  • 子代理B - 在基础保单及所有批改条款基础上提取最终承保条款

虽然这些是同一任务中的子代理,但不应同等对待。将每个子任务路由至合适模型是降低延迟与成本的关键。

核心难点在于:运行时评估任务难度极其困难。

提取场景中的模型路由方法之一是开发启发式规则(例如字段组描述的词元数量)来引导路由。但这类启发式规则在某些情况下会导致准确性下降,而保险理赔处理中准确性不可妥协,因此此方法行不通。

如何实施路由? 随着积累代理运行记录,我们能获取大量关于各子代理处理任务难度的信息。有利的是,我们的子代理委派是确定性的,因此可以持续跟踪每个子代理的任务难度变化。

通过分析历史执行轨迹并用不同模型重新运行提取任务,我们逐步形成子代理间模型路由策略。

模型路由的主要风险是准确性下降。在保险领域,准确性是最重要的指标,因此我们只在完全确信不会导致准确性回退时才启用模型路由。这种确信来自于用不同模型重新运行提取任务,验证准确性是否得以保持。

模型路由已被证明是降低成本与延迟的最佳杠杆。我们在部分代理上实现了68%的成本削减,且准确性未受影响

优化代理上下文

保险领域存在无尽边界案例。首次处理时,几乎不可能为代理提供覆盖所有边界案例的全部上下文,这使得自我改进变得更加重要。

如何检测错误? 提取任务有个显著优点:评估结果相对二元化——要么正确,要么错误。因此,我们依靠代理负责人与任务审核员的反馈来检测错误。

如何利用这些反馈? 收到明确反馈后,我们诊断根本原因,然后提出经过验证、相关且不过度拟合单个错误的修复方案。

我们通过审核代理与提案代理实现这一点:

  • 审核代理 - 通过分析执行轨迹识别根本原因。审核代理掌握常见故障模式、整体提取流程知识,以及失败任务的执行轨迹。

  • 提案代理 - 基于审核代理的输出,决定需要上下文修复还是工具修复,最终生成经验证的客户提案或工具修复的PR。

向客户提出上下文修复时,“不草率修改字段描述”至关重要。通过结合历史提案、客户偏好与代理当前状态对每个错误进行情境化,我们提出客户能理解的修复方案。

提案验证至关重要。评估潜在修复效果是向客户证明这确实是有效修复且不会破坏代理的基础。每个潜在修复方案都会在任务历史运行生成的评估集上测试。清晰展示提案修复解决了原始问题且未引入新问题,就成功了一半。

通过这种方法,我们看到每个流程报告的提取错误减少了75%。或许最重要的是,这增强了客户对我们代理具备自我修复能力的信心。

生产环境部署

综上,这些改进使 Pace 的提取代理在生产环境中变得更准确、更快速、更经济:

这些结果展现了自改进系统的一个片段。生产运行总会暴露边界案例与低效环节,因此将这些问题转化为解决方案是赢得客户信任的关键。

在当今时代,自我改进不仅是企业代理的附加功能,更是产品的核心要素。

相似文章

@akshay_pachaar: https://x.com/akshay_pachaar/status/2053166970166772052

X AI KOLs Timeline

The article discusses a shift in AI agent tool usage from the 'MCP vs CLI' debate to 'Code Mode,' where agents write code to dynamically import tools, significantly reducing context window usage. It highlights Anthropic's approach and Cloudflare's implementation, demonstrating a 98.7% reduction in token consumption for specific tasks.

@vasuman: https://x.com/vasuman/status/2077156239059107867

X AI KOLs Timeline

企业财务团队在AI实施中面临挑战,但专门的背景代理可以自动化发票匹配和银行对账等重复性任务,带来可量化的投资回报率。Varick Agents声称已帮助客户将月末结账时间从12天缩短至5天,每年节省4500万美元。