动态系统中的持续企业世界模型发现
摘要
本文介绍了持续企业世界模型发现,其中智能体在动态系统中学习并适应不断变化的业务规则,使用EnterpriseWorldShift基准进行评估,并展示了比先前方法更高的预测准确性。
查看缓存全文
缓存时间: 2026/09/18 09:21
# 动态系统中的持续企业世界模型发现 来源:https://arxiv.org/html/2609.19551 工作坊标题:面向企业AI智能体的持续学习(CLEA) Shambhavi Mishra†† 感谢:本文基于在ServiceNow Research的实习期间完成的工作。 通讯作者邮箱:[email protected]。 David Vazquez 所属单位:蒙特利尔理工学院 Perouz Taslakian 所属单位:ServiceNow Research 所属单位:Mila - 魁北克人工智能研究所 所属单位:麦吉尔大学 Marco Pedersoli 所属单位:LIVIA, ILLS, 蒙特利尔高等技术学院 Jose Dolz 所属单位:LIVIA, ILLS, 蒙特利尔高等技术学院 Issam H. Laradji 所属单位:ServiceNow Research 所属单位:英属哥伦比亚大学 ###### 摘要 在企业系统中,更新一个字段可能触发另一个字段变更、创建一条记录或启动一项审批流程。这些效果由业务规则产生,而这些规则并非内置于平台中,而是由每个组织编写并随时间修订。在此类系统中工作的智能体若不了解这些规则,便无法预测自身行为的结果。我们研究持续企业世界模型发现:智能体初始时对业务规则一无所知,通过与记录交互并观察结果来逐步发现这些规则。基于这些观察,智能体构建一个世界模型,并在规则变更时对其进行修订。为评估该研究,我们构建了EnterpriseWorldShift基准测试,基于一个活跃的ServiceNow环境,包含九个数据表、25条隐藏规则和600个评估动作。它呈现了同一企业世界的四个版本,其中数据表和记录保持不变,仅规则依次被修改、新增和移除,从而分别测试模型发现、修订、扩展和退役的能力。我们的持续发现智能体能够构建此类模型,并将其从一个世界迁移到下一个世界。该模型预测隐藏规则效果的准确性比先前研究中为每个问题单独查询规则的方法(baseline approach)最高提升8.98个IoU点,且智能体能基于自身模型回答问题,无需查询运行中的系统。 ## 1 引言 企业软件通常包含业务规则,智能体能观察到其效果,却不知规则内容。一个字段的变更可能更新另一个字段、创建相关记录、触发审批或启动一系列后续变更。这些规则共同决定了企业世界如何响应动作,它们并不属于平台本身。每个组织编写自己的业务规则并随时间进行修订。 企业智能体基准测试大多评估在固定环境中的任务完成情况,而唯一评估这些效果预测能力的基准测试所用的系统规则从未变更。此类设置测试的是智能体能否在规则已知的情况下行动,而非测试其能否通过交互推断规则、将其作为世界模型保存,并在规则变更时保持模型正确。 最接近我们工作的是Sethumadhavan Nair等人提出的发现智能体,它在规则保持固定的企业世界中发现业务规则。由于规则定义通常可读,DA在推理时检索相关规则并为每个问题进行推理,问题之间不保留任何信息。当世界从A变为B时,DA被重新初始化并从头开始发现B的规则。我们探究:一个构建系统模型并保留所学知识的智能体,是否比每次为每个问题重新读取规则的智能体能更准确地预测规则效果?另一个问题是:持续适应模型与每次规则变更时重建模型,哪种方式更好?答案是否取决于变更类型? 我们将此问题研究为持续企业世界模型发现。智能体初始时不了解系统规则定义,通过与记录交互来推断系统行为,维持一个世界模型,其组件是它推断出的规则。每个组件以可读形式陈述一个触发条件和效果,例如“当审批被拒绝时,其序号变为99”。附录C.3提供了完整的发现模型示例。 为在可控且现实的环境中研究此问题,我们引入了EnterpriseWorldShift基准测试,它构建于一个活跃的ServiceNow环境之上。EnterpriseWorldShift包含一个连接的企业世界,有九个数据表和一组基线业务规则(25条)。该基准测试呈现同一企业世界的四个连续版本,其中数据表和记录保持不变,仅规则发生变化。 世界A要求智能体发现初始规则。世界B修改一条现有规则的行为,测试先前发现的知识能否被修订。世界C保留该修改并新增一条规则,测试智能体在已建模系统后是否继续探索。世界D移除一条规则,测试智能体能否退役一条过去所有观察都支持的规则。这四个世界因此分离了世界模型在规则变更时必须支持的四个操作:发现、修订、扩展和退役。 图1:EnterpriseWorldShift与持续企业世界模型发现。 (a) 同一企业世界的四个版本,每个版本对应一条业务规则的不同:世界B修改规则、世界C新增规则、世界D移除规则。 (b) 智能体与记录交互并观察后续结果,从这些观察中组装一个世界模型,其组件是它推断出的业务规则。 (c) 模型被迁移而非重建。 我们的贡献如下: - 我们提出了持续发现智能体,这是首个能够持续发现变化中的企业世界模型的智能体,它维护系统业务规则的可审计世界模型,并在规则变更时进行修订。 - 我们引入了EnterpriseWorldShift,这是首个包含变化中企业世界的基准测试,其中业务规则在四个连续世界中经历受控变更。 - 在一个变化三次的企业世界中,我们证明CDA在所有测试的骨干网络上均优于DA,最高提升8.98个IoU点。 ## 2 相关工作 #### 世界模型。 世界模型通过学习环境如何响应,让智能体能预测其行为的效果,这扩展了早期将预测模型与控制分离的思想。近期研究将其应用于语言智能体,将推理框架为在模拟状态转换上的规划,适用于网络、代码执行和工具API等结构化环境。在所有这些研究中,智能体对环境的知识存储在其权重中。我们的世界模型组件是独立的业务规则,因此每个规则都可以针对其所描述的系统进行验证。 #### 企业世界模型。 管理企业系统的规则由每个组织编写并随时间修订。World of Workflows在一个规则从未变更的系统上评估规则效果预测,而Sethumadhavan Nair等人表明,当规则定义可读时,智能体可以在提问时检索相关规则,而非预先学习。我们采用他们的发现智能体作为基线,并在我们的智能体构建模型时赋予其相同的读取权限。他们的智能体在运行不同规则的不同组织上进行评估,而我们的智能体面对的是一个规则随时间变化的单一组织。 #### 企业智能体基准测试。 现有基准测试评估任务执行情况,无论通过浏览器交互、结构化API还是多领域工具使用。它们衡量智能体是否完成任务,而非是否持有正确的系统模型。EnterpriseWorldShift根据经过验证的参考实现对模型本身进行评估,场景是一个环境中的连续受控变更。评估模型而非其预测需要完整了解规则集,而生产环境不允许这样做。 #### 学习动作模型。 从观测的状态转换中恢复环境行为在自动规划和流程挖掘中有悠久历史,后者从事件日志中提取约束和决策逻辑。此后,语言模型被用于通过编写环境代码、提炼手册或通过探索获取技能来恢复此类结构。这些方法从给定的日志或固定环境中学习,而我们的智能体选择自己的干预措施,并且必须在环境未经通知变更时保持其模型正确。 #### 智能体记忆。 持久记忆被研究为可重用工作流、语言自我反思和跨任务携带的经验库,最近的基准测试探究了此类记忆随时间的行为。这里的记忆是存储有用片段,通过下游成功来评估。最接近我们的工作是,Xu等人通过连续版本演进环境,询问智能体是否会放弃与过时版本相关的行为;Chao等人询问智能体在没有任何变更提示时是否会注意到存储的信念不再有效。两者都评估智能体的行为,而我们评估其所持有的内容,因为环境不再支持的规则不仅是无用的,而且是错误的。 ## 3 EnterpriseWorldShift基准测试 EnterpriseWorldShift探究智能体能否通过交互学习企业系统的行为,以及当规则变更时它能否保持该知识正确。该基准测试运行在一个活跃的ServiceNow实例上,包含九个数据表、25条隐藏规则和600个评估动作,分布在四个版本的同一企业世界中。在生产环境中,无法列出规则,也无法控制其变更。ServiceNow允许组织创建自己的表并编写业务规则,当这些表上的记录变更时规则被触发。EnterpriseWorldShift正是通过这一机制构建的,因此平台按照规则指定的顺序运行它们。因此,每个观察到的效果都可归因于我们编写的一条规则。 一个数据表包含字段并保存具有每个字段值的记录。智能体可以列出表的字段、读取记录并在观察变化时修改一条记录。 ### 3.1 环境 环境模拟一个简化的服务管理流程。其核心实体是一个请求,例如员工提出的内部服务请求。请求可能包含行项目,并可能积累审批、升级、评论、历史条目和服水平记录。另外两个表保存类别和分组的参考信息。这些共同构成了九个相互关联的数据表,总结于表1。数据库在每次运行前填充相同的记录,因此所有智能体从相同状态开始。 表1:EnterpriseWorldShift环境。九个数据表、50个字段和252条种子记录,以请求为核心。参考表Category和Group保存查找值,规则会读取,但流程不会创建。 数据表通过隐藏的业务规则相互耦合,选择它们是为了覆盖而非广度。一条规则可能更新被编辑的记录、修改相关记录、创建新记录或激活另一条规则,因此单个动作可能产生一串变更。世界A包含25条这样的规则,组织成四个链,其中一条规则激活下一条。其中两对规则有意竞争写入同一个字段,平台以固定顺序运行它们,后一条规则最后提交。所有规则都是确定性的,因此在相同的起始状态下执行相同的动作总是产生相同的结果。智能体无法访问基准测试自身之外的任何表,因此它所观察到的内容来自我们编写的规则。它的任务是恢复这些规则作为它写下的模型。附录A.2提供了完整的规则集,以及将观察到的行为归因于这些规则的原因。 ### 3.2 变化中的世界 业务规则随策略变更而修订,新规则被引入或旧规则被废弃。因此,我们构建了四个仅在一条规则上不同的连续世界: World A⏟发现→修改一条规则→World B⏟修订→新增一条规则→World C⏟扩展→移除一条规则→World D⏟退役 \underbrace{\text{World A}}_{\text{发现}}\;\xrightarrow{\;\text{修改一条规则}\;}\;\underbrace{\text{World B}}_{\text{修订}}\;\xrightarrow{\;\text{新增一条规则}\;}\;\underbrace{\text{World C}}_{\text{扩展}}\;\xrightarrow{\;\text{移除一条规则}\;}\;\underbrace{\text{World D}}_{\text{退役}}
相似文章
企业系统是否需要学习世界模型?上下文在推断动态性中的重要性
本文探讨了企业代理是否需要学习世界模型,或者是否可以依赖运行时对系统配置的发现。文章引入了“企业发现代理”以及名为 CascadeBench 的基准测试,证明在动态企业环境中,读取运行时上下文能带来对部署偏移更好的鲁棒性。
DSWorld:面向高效自主代理的数据科学世界模型
DSWorld 提出了一种数据科学世界模型,通过预测环境状态转换来减少自主代理中代价高昂的试错过程,在强化学习训练中实现了14倍加速,推理时加速3-6倍,同时保持了有竞争力的性能。
@yingwww_: 温暖提示:你的世界模型永远不应该停止学习。介绍AdaJEPA,一个自适应的世界模型,可以规划、行动和适应……
AdaJEPA引入了一种自适应的潜在世界模型,该模型在测试期间通过闭环模型预测控制持续更新,显著提高了分布偏移下的规划成功率。
Agent-World:面向演进式通用智能体的现实世界环境合成扩展
# 论文页面 - Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence 来源:[https://huggingface.co/papers/2604.18292](https://huggingface.co/papers/2604.18292) 发布于 4 月 20 日 · 提交者[https://huggingface.co/dongguanting](https://huggingface.co/dongguanting) [](https://huggingface.co/dongguanting) [KABI](https://huggingface.co/donggua
商业世界模型
本文介绍了商业世界模型(BWM)的概念与架构。BWM是一种针对商业环境专门化的世界模型,能够编码状态、动态、约束与目标,以支持自主决策和基于目标的规划。