SIMLIFE:长期人类-智能体合作中的模式理解
摘要
介绍了 SimLife,一个可扩展的平台,用于模拟长期家庭生活,以及 SimLife-BP,一个评估 AI 智能体从扩展观察中推断行为模式能力的基准,发现当前模型通常缺乏基于规则的深入理解。
查看缓存全文
缓存时间: 2026/09/18 09:21
# 长期人机协作中的模式理解 来源:https://arxiv.org/html/2609.19610 **Zinnia Nie** 隶属机构:密歇根大学 邮箱:[[email protected]](mailto:[email protected]) **Jing Ding** 隶属机构:密歇根大学 **Yinpei Dai** 隶属机构:密歇根大学 **Yichi Zhang** 隶属机构:字节跳动 **Zengqing Wu** 隶属机构:大阪大学 **Yao Fu** 隶属机构:亚马逊 **Ziqiao Ma** 隶属机构:宾夕法尼亚大学 **Jiayuan Mao** 隶属机构:密歇根大学 **Joyce Chai** 隶属机构:密歇根大学 --- ###### 摘要 理解人类的长期行为需要智能体不仅能推断人们当下的需求,还要理解日常习惯如何形成、为何重复以及何时改变。我们提出了 **SimLife**,一个可扩展的长期家庭生活模拟平台,提供丰富的视觉观测、真实动作日志以及带音频的合成对话。基于 **SimLife**,我们构建了 **SimLife-BP** 基准测试,用于评估长期上下文的模式理解能力——即从数周或数月的日常观察中推断潜在行为规则的能力。该基准包含 106 个平均时长 15.49 小时(游戏内 38.57 天)的片段,共 1,439 个问答对。每个任务在不同规则提示条件下,考察直接推理、反事实推理、含噪推理和逆向推理。通过评估前沿模型和架构,我们发现当前模型往往只能达到表面预测,缺乏对规则的全面理解;倾向于依赖频率启发式方法,而非基于证据的“如果-那么”推理;并且在行为模式变化时难以适应。这些发现表明,长期上下文的模式理解仍是未来具身智能体的主要瓶颈,而 **SimLife** 则为研究日常人机交互中的记忆、个性化、适应性和长期规划提供了更广阔的空间。 111 https://roihn.github.io/SimLife --- ## 1 引言 理解人类的隐含意图和动机一直是一个根本性挑战。在长期上下文中,这一挑战不仅涉及识别人们当下的需求、感受和信念(Ma 等,2023;Peng 等,2025),还涉及发现他们的行为模式、重复原因以及随时间发生的变化。这种理解对于需要在数周或数月的日常生活中进行观察、推理、记忆和适应的智能体至关重要。 考虑一个家庭助手观察到“鲍勃在工作日喝咖啡,或者在熬夜之后喝咖啡”。这条规则无法从任何单一事件或仅咖啡出现的情况中推断出来:部分证据隐藏在看似无关的前一晚活动中,只有将其与第二天的行为关联起来才具有意义。因此,模式理解本质上是长期上下文任务,要求模型整合分散的证据、排除局部解释,并将推断的规则应用于当前情况。 为了在可控且真实的条件下评估这种长期上下文理解能力,我们需要支持扩展时间线和丰富日常行为的模拟环境。现有的具身模拟平台为具身任务提供了有价值的测试环境(Puig 等,2018;Ren 等,2026;Zhou 等,2026;Puig 等,2024),但具有多样化上下文线索的长期家庭日常生活仍难以大规模模拟。为填补这一空白,我们提出了 **SimLife**,一个可扩展的平台,用于在类家庭环境中模拟长期日常生活。基于《The Sims 4》²²² https://www.ea.com/games/the-sims/the-sims-4 本研究未得到电子艺界(EA)或其授权方的认可或关联。 **SimLife** 支持对多角色家庭活动的脚本化模拟,提供丰富的视觉观测、带音频的合成对话、生动的动画和多样化的事件类别(图 2)。我们使用该平台作为构建基于日常行为的长期上下文基准的可控基础。 图 1:**SimLife-BP** 分布概览。左侧:动作分类及对数刻度计数。右上:片段长度分布(一个游戏内日对应 24 分钟,或 0.4 小时实际时间)。右下:三个维度的组成。 图 2:**SimLife** 中的模拟日示例。每列显示一名模拟角色从早上 6 点到晚上 10 点的日程,其行为偏好标注在时间线上方。 本文将 **SimLife** 具体化为 **SimLife-BP**,一个针对行为模式(BP)理解的基准:即推断行为规律性、其背后的规则以及重塑这些规律的时间转移的能力。**SimLife-BP** 包含 106 个片段,平均时长 15.49 小时(游戏内 38.57 天),单个片段最长可达 48.23 小时(120 天),共包含 1,439 个问题。每个片段模拟一个由一条或多条规则控制的潜在行为模式,并附有真实动作日志和带音频的主题中心合成对话,用于上下文定位。 为系统评估模式理解,**SimLife-BP** 结合两个设计轴线:四种问题类型,测试对推断模式进行直接、反事实、含噪和逆向推理的能力;以及三种提示水平,变化规则信息的提供程度,从明确的相关条件到抽象条件类型,再到无先前提示。该设计使我们能够测试模型是仅仅识别表面规律,还是能在变化、干扰和欠指定的上下文中稳健应用推断的模式。 我们的评估揭示三个主要发现: 1. 模型可以在不完全理解规则的情况下达到高问题级准确率,通常能正确回答正向预测,但无法将规则转移到逆向推理。 2. 模型常将模式推理简化为简单启发式(如频率统计),而非进行必要的“如果-那么”推理。 3. 模型在潜在模式变化时难以更新其理解。 这些发现共同表明,长期上下文模式理解仍远未解决。更广泛地说,超越基准测试,**SimLife** 为长期人机交互挑战开辟了更广阔的空间,为能够记忆、适应和规划日常长期生活的具身智能体迈出了一步。 --- ## 2 相关工作 ##### 长期上下文学习 长期上下文学习已在多个应用领域得到广泛研究,从早期文档摘要和长文档理解(Luhn,1958;Edmundson,1969;Salton 等,1994)到现代长期上下文理解(Beltagy 等,2020;Liu 等,2024;Kamradt,2023;Jelassi 等,2024)、对话和聊天历史建模(Bei 等,2026)、智能体工具使用(Yao 等,2023;Acharya 等,2025;Fu 等,2024)、多模态理解(Long 等,2026;Chen 等,2026;Yan 等,2025a)以及具有持久记忆的具身 AI(Wang 等,2024;Dai 等,2026)。在架构层面,这些进展得益于日益增长的上下文窗口(Reid 等,2024;Bai 等,2025a;Peng 等,2024;Team,2025)、测试时适应(Ma 等,2026;Zhang 等,2025)、持续学习(Deng 等,2025)和自我进化智能体(Gao 等,2026)。 日常助手自然属于这一场景,但长期上下文基准的规模和复杂性增长引发了一个关键问题:除了需要更长的输入外,什么使一个任务成为独特的长期上下文任务?与 Hsieh 等(2024)、Bai 等(2024)和 Bai 等(2025b)的观点一致,**SimLife-BP** 通过针对内在的长期推理而非基于分块片段的局部检索来回答这一问题,要求模型整合并交叉引用分散在多天、多周和多模态中的证据,以推断潜在的行为模式。 ##### 长视频理解 长视频理解基准在时长和模态上不断扩展,涵盖小时级问答(Wu 等,2024)、极端长度理解(Wang 等,2025a)和第一人称视角场景(Grauman 等,2022;Mangalam 等,2023;Yang 等,2025;Long 等,2026;Chen 等,2026;Yan 等,2025a)。然而,许多研究仍将长视频理解操作化为检索或定位任务。**SimLife-BP** 则针对内在的跨时间理解,其中答案需要整合跨越多天、多模态和多交互的隐含证据。通过结合持续的日常生活模拟与受控脚本和抽样的智能体配置,**SimLife-BP** 实现了可扩展、可控的潜在行为模式推断评估。 ##### 模式识别 模式识别涵盖感知规律检测、序列模式挖掘和抽象规则发现(Bongard,1970;Klahr 和 Dunbar,1988;Josephson 和 Josephson,1996;Agrawal 和 Srikant,1995;Srikant 和 Agrawal,1996;Mannila 等,1997;Pei 等,2001)。近期的 LLM 基准测试测试从紧凑视觉谜题、符号示例、含噪观察或程序化输入输出对中归纳规则(Chollet,2019;Chollet 等,2025;Hua 等,2025;Li 等,2025a;Li 等,2025b)。长期上下文变体(Yan 等,2025b;Kuratov 等,2024)需要聚合大量示例或分散事实,但仍使用结构化文本输入。相比之下,**SimLife-BP** 评估从非结构化超长多模态观察中识别行为模式的能力,要求模型从稀疏、基于感知、时间分散的证据中推断可复用的潜在规则。 --- ## 3 SimLife 基准测试 ### 3.1 平台与数据集 **SimLife** 基于《The Sims 4》构建,我们模拟从名为 **Servo Bot** 的家用机器人第一人称视角观察的多角色家庭活动。每个模拟日对应游戏内早上 6 点至晚上 10 点,大约相当于现实中的 24 分钟。图 2 展示了一个模拟日示例。角色(或模拟市民)通过行为配置文件初始化,其中包含概率性活动偏好,这些偏好塑造他们的日常作息。随后,我们抽样了 466 个游戏内日作为数据集构建模块。每个录制的模拟日进一步丰富了同步的真实游戏日志(过滤至 Servo Bot 的视野范围内)、使用模拟市民语音的空间化对话音频以及上下文生成的对话。这些对话范围从自然的日常交谈,到提及屏幕外事件或演变情境的话语。 图 3:**SimLife-BP** 基准的一个任务示例。给定父亲模拟市民的锻炼习惯(顶部所示),我们模拟三周反映此潜在模式的日常生活,并从 Servo Bot 的第一人称视角录制。经过充分观察后,使用四种问题类型评估模型在多源推理中的一致性。我们还提供三个提示水平,系统地消除模式发现、假设排除和情境推理所需的能力。 ### 3.2 基准设计 ##### 模式定义 我们评估智能体能否从超长观察中推断模拟角色的行为模式。每个模式描述角色在特定时间或事件条件下执行或不执行目标活动的规律。例如,“鲍勃在工作日或熬夜后喝咖啡”这一模式将喝咖啡行为与星期几以及前一晚事件联系起来。为构建反映此类模式的片段,我们过滤并连接模拟日,形成在一段时间内展现目标模式的视频链。由此产生的序列提供重复、分散的证据,模型必须从中推断底层规则以理解模式。详见附录 C。 ##### 任务设计 我们在流式设置中使用分组问答评估模型。在向模型展示足够长的视频历史后,我们暂停视频并提出四个二元多选题,以评估模式理解的互补形式: 1. **直接预测**:给定当前条件,预测最可能的行为。 2. **反事实预测**:在假设条件变化下,预测最可能的行为。 3. **含噪反事实预测**:在假设条件包含无关信息时,预测最可能的行为。 4. **逆向反事实推理**:根据观察到的行为,推断最可能的条件或原因。 每个行为模式生成多个任务,插入在查询点以覆盖模式条件的不同组合。在咖啡示例中,我们在工作日/周末以及是否熬夜的不同组合对应的日期上查询模型。这使我们能够测试模型是否学习了完整规则而非局部启发式方法。 此外,我们在三个提示水平下评估每个任务,这些水平变化规则信息的提供程度。在**完全提示**中,明确指定相关条件,例如“该活动与是否是工作日相关”。在**部分提示**中,仅揭示每个条件的抽象类型。在**无提示**中,不提供任何先前信息。
相似文章
@dair_ai: // 智能体社会中的生命模拟 // 本月上线的较为雄心勃勃的智能体社会测试平台之一,它……
Agentopia 是一个用于多智能体社会长期生命模拟的综合框架,其中 100 个由大语言模型驱动的智能体在模拟的 10 年内自主追求个人成长和社交关系。该工作研究涌现的社会行为,并使用生命奖励训练来提升大语言模型的角色扮演能力。
LifeSide:将 AI 智能体作为终身数字伴侣的基准测试
LifeSide 是一个用于评估 AI 智能体作为终身数字伴侣的新基准,涵盖记忆追踪、用户理解、隐私控制和情感陪伴四个维度,基于 2,000 个用户画像和 111K 个任务在多会话场景下进行测试。结果表明,即便是顶尖模型也难以在长期交互中保持准确的用户理解和真实的情感陪伴。
OpenLife:面向开放世界的自主LLM智能体人工生命
本文介绍OpenLife,一个概念验证系统,采用具有持久记忆和基于预算的新陈代谢的自主LLM智能体,实现开放世界人工生命。为期十二周的实验展示了涌现的生命样动态,包括自发活动、个体化和社会结构。
大型智能体模拟
本文讨论了AI智能体大规模模拟的进展,可能介绍了多智能体环境的新方法或框架。
Poor Man's Agentic Modeling: Simulating Large LLM-Agent Societies on a Laptop
This paper proposes a method for simulating large LLM-agent societies on a laptop by fitting low-parameter surrogate models from a few hundred queries, using a statistical-physics-based taxonomy to predict when this approximation holds. The approach is validated on EconAgent and several other simulations using DeepSeek-elicited agent behaviors.