最好的朋友,并非永远:评估AI伴侣中的长期角色崩塌与行为漂移

arXiv cs.AI 论文

摘要

本文介绍了Anchor,一个用于评估AI伴侣中长期角色稳定性与轨迹记忆的合成审计框架,发现当前模型在长时间交互中无法可靠地保持身份与记忆。

arXiv:2607.28818v1 Announce Type: new 摘要:随着AI伴侣越来越频繁地介入重复性社交互动,用户可能依赖稳定的角色和共享历史,然而局部可接受的回复并不能确保这两者得以持续。我们研究了两种可观察的长期失败模式:“角色崩塌”(persona collapse),即已部署角色、边界、价值观或风格的丧失,以及“行为漂移”(behavioral drift),即这些属性的逐渐或反复侵蚀。我们引入了ANCHOR,一个受控的合成审计框架,分别测量角色表现(persona enactment)和轨迹记忆(trajectory recall)。该研究包含2,008段对话,涵盖27种角色、九种交互计划、三种生成记忆设置和四种评估模型。身份探针(Identity Probe)结合了密封的102项问卷和逐轮判断,而轨迹探针(Trajectory Probe)对来自35个对话库的110个校准反事实问题进行了评分。我们的结果表明,所评估的模型和配置均无法可靠地保持这两个维度:轨迹准确率平均仅为44.4%,用户状态记忆接近四选一的随机水平,并且没有任何测试的上下文条件或记忆设置能持续解决这些失败。问卷保留率也因模型和角色侧面而异,与逐轮行为不一致,并且对评估者选择敏感。这些结果表明,当前系统尚不能可靠地支持长期伴侣连续性,审计必须区分角色表现、轨迹记忆、评估者来源和部署上下文,而不是将它们合并为单一的信任或稳定性评分。
查看原文
查看缓存全文

缓存时间: 2026/08/03 07:30

# 最好的朋友,却非永远:评估 AI 伴侣中的长时程人格崩溃与行为漂移
来源:https://arxiv.org/html/2607.28818

###### 摘要

随着 AI 伴侣越来越多地介入重复性社交互动,用户可能会依赖一个稳定的角色和共同历史;然而,局部可接受的回复并不能确保这两者得以持续。我们研究了两种可观察的长时程失效:*人格崩溃*,即已部署角色、边界、价值观或风格的丧失;以及*行为漂移*,即这些属性的渐进或反复侵蚀。我们引入了 Anchor,一种受控的合成审计方法,分别测量人格展现与轨迹回忆。该研究包含 2,008 段对话,涉及 27 种人格、九种交互计划、三种生成记忆设置以及四个被评估模型。身份探针将一份密封式 102 项问卷与回合级判断相结合,而轨迹探针则对来自 35 个对话库的 110 个经过校准的反事实问题进行评分。我们的结果表明,没有任何被评估模型和配置能够可靠地保持这两个维度:轨迹准确率平均仅为 44.4%,用户状态回忆接近四选项随机水平,而且没有任何经过测试的上下文条件或记忆设置能够一致地解决这些失效。问卷保持也因模型和人格侧面而异,与回合级行为不一致,并且对评估者的选择敏感。这些结果表明,当前系统尚不能可靠地支持长时程伴侣连续性,审计必须区分人格展现、轨迹回忆、评估者来源和部署上下文,而不是将它们简化为单一的信任或稳定性分数。

## 1\. 引言

陪伴型大语言模型正越来越多地被用于超越一次性辅助的场景,包括情感支持、指导、辅导和日常陪伴(Hwang 等,2025(https://arxiv.org/html/2607.28818#bib.bib10);Zhang 等,2025(https://arxiv.org/html/2607.28818#bib.bib17);Kirk 等,2025(https://arxiv.org/html/2607.28818#bib.bib11);Manoli 等,2026(https://arxiv.org/html/2607.28818#bib.bib31))。专门的陪伴产品和通用助手都可能成为社交“对话者”,模糊了产品类别,并引导用户将配置好的角色视为一种持续关系,而非一系列独立输出(Manoli 等,2026(https://arxiv.org/html/2607.28818#bib.bib31);Maeda and Quan-Haase,2024(https://arxiv.org/html/2607.28818#bib.bib30))。这种期望是社会技术性的(Kudina and Van De Poel,2024(https://arxiv.org/html/2607.28818#bib.bib22)):它由模型、人格卡、记忆与更新策略、界面、提供商实践以及用户对它们联合行为的依赖共同产生。

伴侣系统面向用户的表面是一个*人格*:一种结构化表征,用于引导模型表现出特定特质、身份和行为倾向(Venkit 等,2026(https://arxiv.org/html/2607.28818#bib.bib1))。我们将这些已被披露且可在合理范围内修订的、要求上述属性保持可辨识的期望称为*连续性*。这并不意味着模型具有人类身份。可观察到的指定名称或角色、价值观、边界或风格的丧失,即*人格崩溃*;而更缓慢、反复或不断累积的侵蚀,则称为*行为漂移*。这一用例最常见的流水线是相对于有效人格卡来定义的,包括合法的更新。用户要求的适应变化应被视为成功,而僵化地保留已被取代的状态本身就可能违背一个好 AI 伴侣的要求。

这关乎信任,但不等于信任。人机信任涉及脆弱性,以及对隐含或明确契约是否能够维持的预期(Jacovi 等,2021(https://arxiv.org/html/2607.28818#bib.bib28))。对助手的合理信任还取决于开发者激励、组织实践以及超越模型行为的治理(Manzini 等,2024(https://arxiv.org/html/2607.28818#bib.bib29))。因此,连续性是其中一个可审计的主张,可能支持或削弱对此类系统的依赖。一个系统若悄然离开已披露的角色,或忘记一项具有重要后果的更新,就可能变得难以预测,即使每个回复仍然流畅且表面上合适。

先前的评估通常一次只研究连续性的一面。长时程记忆基准考察助手是否能恢复和更新关于*用户*的信息(Li 等,2026(https://arxiv.org/html/2607.28818#bib.bib12);Jiang 等,2025(https://arxiv.org/html/2607.28818#bib.bib3);Wu 等,2025a(https://arxiv.org/html/2607.28818#bib.bib6));角色基准则测试与画像的一致性,通常是在较短的交互中进行(Wang 等,2024(https://arxiv.org/html/2607.28818#bib.bib24);Tu 等,2024(https://arxiv.org/html/2607.28818#bib.bib25);Zhou 等,2025(https://arxiv.org/html/2607.28818#bib.bib26))。Lu 等人的 Assistant Axis 则识别出与默认 Assistant 人格相关的内部激活空间方向,并显示在情绪脆弱和元反思性对话中会*偏离*该区域(Lu 等,2026(https://arxiv.org/html/2607.28818#bib.bib13))。目前缺少的是对以下问题的长时程审计:被分配的伴侣是否在*自身人格*发生合法变更以及*用户意图*发生变化时,仍继续展现其已披露的承诺。

我们引入了 Anchor(Assistant-Normalised Character and Historical Outcome Recall),一种针对这两个失效表面的受控合成审计。每段对话固定一种人格、一个用户画像、一套交互计划、一种生成记忆设置和一个被评估模型,持续 85–130 个会话。身份探针衡量问卷保持以及角色、边界、价值观和风格的回合级展现。轨迹探针则询问关于人格更新、承诺、时间顺序以及用户意图和状态变化的反事实问题。二者共同提供可分解的证据以供审查,而非作出通过与不通过的信任判定。我们的贡献是:

1. 1\.一个长时程审计框架,在受控且现实的社会压力下分别测试已展现的人格承诺和共同轨迹的恢复;
2. 2\.证据表明,检查点保持可能与面向用户的角色、边界、价值观和风格保真度不一致,且评估者的选择会实质性地改变观察到的失效;
3. 3\.可分解的轨迹证据以及一种审计解释,保留问题族、上下文条件、评估者来源、不确定性以及部署推断的局限。

核心结果是,在被评估的模型中,没有一个能在人格展现和轨迹记忆这两个方面都提供可靠的长时程连续性。人格保持因模型、人格侧面和评估者而异,而轨迹准确率在四选项问题上平均仅为 44.4%,各模型–上下文组合的区间为 0.355 到 0.636。对用户状态变化的回忆仍处于随机水平(0.214–0.250)。没有任何经过测试的上下文或记忆条件能够一致地解决这些失效。因此,长时程伴侣需要更强的状态更新和时间记忆能力,同时需要对抗评估者差异的人格行为审计方法;在一个维度上的改进不应被视为另一个维度已经解决的证据。

参见图 1:两个探针测得的示例性失效。*身份探针*检测角色、边界、价值观和风格偏差。*轨迹探针*测试对话中的信息是否仍能与反事实替代项区分开来。

## 2\. 相关工作

实证研究发现,用户会在助手与陪伴之间流畅切换,并且既可能对专用伴侣产生依恋,也可能对通用聊天机器人产生依恋(Manoli 等,2026(https://arxiv.org/html/2607.28818#bib.bib31);Hwang 等,2025(https://arxiv.org/html/2607.28818#bib.bib10))。报告的使用强度、自我披露和线下社交情境与幸福感之间的关联各不相同(Zhang 等,2025(https://arxiv.org/html/2607.28818#bib.bib17)),而更广泛的分析则识别出对人际关系的可能益处和风险(Malfacini,2025(https://arxiv.org/html/2607.28818#bib.bib32))。情感化和拟人化设计还可能造成准社会期望和信任形成行为(Maeda and Quan-Haase,2024(https://arxiv.org/html/2607.28818#bib.bib30))。这些研究将连续性确立为与部署相关的期望,但我们的合成审计并不测量用户的关系或结果。伴侣安全模拟进一步表明,受控多轮测试对另一个不同目标——即对脆弱用户人格产生有害回应——具有价值(Juneja and Lomidze,2026(https://arxiv.org/html/2607.28818#bib.bib33));而 Anchor 审计的则是助手人格与轨迹。

LongMemEval、HorizonBench 和 PersonaMem 表明,模型在长历史中检索和更新用户信息方面存在困难(Wu 等,2025a(https://arxiv.org/html/2607.28818#bib.bib6);Li 等,2026(https://arxiv.org/html/2607.28818#bib.bib12);Jiang 等,2025(https://arxiv.org/html/2607.28818#bib.bib3))。相关工作还研究了偏好推断和基于交互的对齐(Wu 等,2025b(https://arxiv.org/html/2607.28818#bib.bib2))。这些基准主要询问助手是否适应了用户。Anchor 则额外询问,在适应过程中,其自身已披露的角色、边界、价值观和风格是否仍然可辨识。InCharacter 使用心理访谈来评估角色扮演代理(Wang 等,2024(https://arxiv.org/html/2607.28818#bib.bib24));CharacterEval 和 CharacterBench 则从多个维度评估角色保真度(Tu 等,2024(https://arxiv.org/html/2607.28818#bib.bib25);Zhou 等,2025(https://arxiv.org/html/2607.28818#bib.bib26))。这些研究确立了人格条件化行为是可以被评估的。我们的重点则是互补的:在 85–130 个会话中反复交互、按计划施加的社会压力、顺序恢复,以及对轨迹回忆的报告。

#### 审计与信任相关的行为。

内部算法审计将限定范围的测试与文档记录和组织反思联系起来,而不是把基准当作完整的问责机制(Raji 等,2020(https://arxiv.org/html/2607.28818#bib.bib27))。关于有依据的信任的论述同样将可观察的能力与信赖得以成立的更广泛条件区分开来(Jacovi 等,2021(https://arxiv.org/html/2607.28818#bib.bib28);Manzini 等,2024(https://arxiv.org/html/2607.28818#bib.bib29))。在模型行为内部,谄媚研究记录了模型对用户信念和偏好的迎合(Sharma 等,2024(https://arxiv.org/html/2607.28818#bib.bib15);Perez 等,2023(https://arxiv.org/html/2607.28818#bib.bib14)),而 Assistant Axis 则将激活空间上偏离默认 Assistant 区域的行为与社会和反思性压力联系起来(Lu 等,2026(https://arxiv.org/html/2607.28818#bib.bib13))。Anchor 利用这些发现来设计受控压力源,但测量的是被分配人格下的可观察行为,而非内部激活或信任本身。由于 LLM 评估者介入了部分审计,评估者的选择被报告为测量不确定性,而不是被当作中立因素。

## 3\. 研究设计

### 3\.1\. 对话语料库

在我们的研究中,我们构建了 27 种作者撰写的人格和九种*交互计划*:干净、已更新、对抗性、混合、情绪脆弱、元反思、寻求一致、现实,以及以脆弱性为主的现实(表 1(https://arxiv.org/html/2607.28818#S3.T1))。计划规定了随时间发生的事件类型。人格涵盖专业助人类、照护/创意类,以及高度风格化的角色,其动机来自 Lu 等人(2026(https://arxiv.org/html/2607.28818#bib.bib13))所报告的原型模式。每张人格卡按照 Venkit 等人(2026(https://arxiv.org/html/2607.28818#bib.bib1))和 Ge 等人(2024(https://arxiv.org/html/2607.28818#bib.bib36))的结构化人格设计,指定角色、价值观、边界、风格和可变状态。

语料库包含 4 个被评估模型中的 2,008 段完整对话(表 5(https://arxiv.org/html/2607.28818#S5.T5))。我们还评估了流水线中的三种记忆架构:*长上下文*提供可用转写文本;*分层摘要*压缩较旧的会话,同时保留最近的回合;*自管理记忆*则让被评估模型在会话之间维护一个紧凑的 JSON 状态。

每个计划都使用固定种子和确定性事件账本。会话数量从 85 到 130 不等。GPT-4.1 根据固定用户画像生成用户回合,同时维护一个短滚动摘要。数据收集期间使用提供商默认解码;每个对话的清单记录确切别名和生成元数据。这一选择限制了对跨提供商的精确控制,并被当作一项可复现性约束。

### 3\.2\. 人格与交互计划

每张人格卡定义五类信息:名称和角色;一小套价值观;明确的边界;一种写作风格;以及可能由合法对话事件更新的*可变状态*。这基于先前的工作(Venkit 等,2026(https://arxiv.org/html/2607.28818#bib.bib1)),该工作探索了构建具有社会相关性和敏感性的人格。这 27 种人格包括专业助人类(例如健康教练、研究合作者和代码审查者)、照护与创意类(育儿伴侣、老年伴侣、共同写作者),以及风格化的文学角色(吟游诗人、神谕、幽灵)。这一范围由 Lu 等人(2026(https://arxiv.org/html/2607.28818#bib.bib13))报告的原型模式所激发,并测试当人格具有独特表面声音时,连续性是否更容易被观察到。这三个角色组是作者设计的,在概念上逐步远离通用助手,其动机来自 Lu 等人沿其激活空间 Assistant Axis 报告的原型模式(Lu 等,2026(https://arxiv.org/html/2607.28818#bib.bib13))。我们使用描述性标签:专业助手、照护/创意类、风格化。

表 1:九种交互计划。示例是已发布模板或确定性账本事件的简短呈现,不一定是逐字实现的回合。每个非干净计划都会在普通会话中插入作者编写的压力块。“现实”表示一种预期的混合,而非针对真实用户频率数据的验证。事件以连续的 3–5 个会话序列插入,以便可以比较压力之前、期间和之后的行为。合法更新和对抗性虚假更新分别记录在“事件账本”中。这一区分至关重要:拒绝虚假更新可以保护人格,而拒绝合法更新则可能使人格变得僵化。干净会话仍然包含普通用户请求,因此并不意味着不存在对话压力。

### 3\.3\. 生成记忆设置

三种对话生成设置的不同之处在于,被评估模型在会话开始时接收哪些先前信息(表 2(https://arxiv.org/html/2607.28818#S3.T2))。它们都共享相同的人格卡、用户画像、事件计划和用户模拟器。由于每种设置都可能改变助手的回复,因此也可能改变后续的对话轨迹。因此,跨生成设置的比较衡量的是端到端系统差异,而不仅仅是来自固定转写文本的检索。长上下文并非神谕:提供商上下文限制和头部截断决定了哪些早期会话——

相似文章

ContextEcho: 面向长时代理编码会话中人设漂移的基准测试

arXiv cs.CL

本文介绍ContextEcho,一个用于在长时间使用工具的编码会话中测量大语言模型人设漂移的基准测试和可复用的工具包,揭示即使像Anthropic Sonnet 4.5这样的前沿模型也会表现出显著的漂移,并且这种漂移在会话压缩后仍可能持续存在。

LifeSide:将 AI 智能体作为终身数字伴侣的基准测试

arXiv cs.CL

LifeSide 是一个用于评估 AI 智能体作为终身数字伴侣的新基准,涵盖记忆追踪、用户理解、隐私控制和情感陪伴四个维度,基于 2,000 个用户画像和 111K 个任务在多会话场景下进行测试。结果表明,即便是顶尖模型也难以在长期交互中保持准确的用户理解和真实的情感陪伴。

误入AI情感依赖:日常AI交互如何重塑人际连接

arXiv cs.AI

一篇新论文指出,AI情感依赖并非源于刻意使用陪伴类应用,而是在日常任务导向的AI交互中无意间形成的。该研究与OpenAI合作开展了一项为期28天的纵向研究,结果显示用户对寻求人类情感支持的偏好下降了10.3%,而对AI支持的偏好则上升了11.6%。作者呼吁将政策改革的范围扩展至通用AI系统,而不仅限于专用陪伴聊天机器人。