TRACE Bench:任务驱动的角色扮演智能体清单评估
摘要
TRACE Bench 是一个任务驱动的角色扮演智能体清单评估框架,它将角色设定分解为清单,使用用户智能体进行自然对话,并将得分追溯到清单项目和对话证据。其覆盖率高达 99.91%,优于 MiniMax Role-play Benchmark 的 73.74%,并支持跨越 26 个模型的闭环基准演进。
arXiv:2608.11236v1 公告类型:新
摘要:角色扮演评估不应仅仅给出一个分数:它应该揭示哪些角色要求被测试了,哪些失败了,以及哪些对话证据支持这一判断。我们提出了 TRACE Bench,一个任务驱动的智能体清单评估框架。它离线将每个角色设定分解为固定清单,然后使用用户智能体与目标角色扮演模型自然对话,同时根据模型回应私下更新清单状态。因此,分数可以追溯到清单项目和支撑性对话轮次,而非黑盒式的整体印象。在覆盖率交叉验证中,我们使用相同的角色衍生清单,对 MiniMax Role-play Benchmark 发布的 M2 自由对话记录进行了审核。已发布的自由聊天记录仅覆盖关键角色设定要点的 73.74%,而 TRACE Bench 在更少的轮次内达到了 99.91% 的覆盖率。鲁棒性实验表明,在重复运行和更换用户智能体的情况下,排名保持稳定。在 26 个模型上,TRACE Bench 报告了整体排名以及能力细分和清单追踪。它还支持闭环基准演进,从失败的追踪中提炼出经过验证的有效方法,使后续评估能够更可靠地引出并检查观察到的失败模式。
查看缓存全文
缓存时间: 2026/08/13 15:25
# 1 TRACE Bench 框架概览。来源:https://arxiv.org/html/2608.11236 ![[无题图]](https://arxiv.org/html/2608.11236v1/asset/gamemind_logo_cropped.png) GameMind TRACE Bench:任务驱动的角色扮演智能体检查清单评测 Kuaishou GameMind Lab 参见贡献(https://arxiv.org/html/2608.11236#Sx1)一节获取完整作者列表。角色扮演评测不应只给出一个分数:它应当揭示哪些角色要求被测试了、哪些失败了,以及哪些对话证据支持该判断。我们提出 TRACE Bench,一个任务驱动的智能体检查清单评测框架。它离线将每个角色档案分解为固定检查清单,然后使用用户智能体与目标角色扮演模型自然对话,同时根据模型回复私下更新检查清单状态。因此,分数可追溯到检查清单条目和支持性对话轮次,而非黑盒的整体印象。为了交叉验证覆盖率,我们使用同一角色派生检查清单,审计了 MiniMax Role-play Benchmark 发布的 M2 自由对话记录。发布的自由聊天记录仅覆盖关键角色档案要点的 73.74%,而 TRACE Bench 在更少的轮次内达到 99.91% 的覆盖率。鲁棒性实验显示,在重复运行和替换用户智能体下排名保持稳定。在 26 个模型上,TRACE Bench 报告总体排名、能力细分和检查清单轨迹。它还支持闭环基准演进,从失败轨迹中提炼出被证明有效的验证方法,使后续评测能够更可靠地引发和检查观察到的失败模式。 ![[无题图]](https://arxiv.org/html/2608.11236v1/x1.png) 图 1:TRACE Bench 框架概览。 ## 1 引言 角色扮演基准测试一项具体能力:语言模型在给定角色档案下,能否持续产生符合角色身份、背景约束、交互目标和行为边界的回复。它们不只是询问模型是否“了解”一个角色,也不只是统计对话持续了多久。一个有效的角色扮演基准至少应当定义角色档案、交互场景、应当被引发和验证的检查清单要求,以及在评分过程中可追踪的证据。我们将角色扮演视为一个角色条件化的交互式生成问题。这个定义涵盖虚拟角色、服务型人设、训练模拟器、辅导角色和故事世界智能体:场景不同,但评测问题相同——即模型能否在开放、多轮、动态交互中稳定遵守其被分配的角色。 现有角色扮演基准大致可分为三类。第一类是静态基准。它们将角色档案转化为问答、选择题、单轮回复或基于历史上下文的单轮回复,并用这些测试用例检查模型是否把握了角色事实、说话风格或局部行为。这些基准成本低、可复现,但很容易将角色扮演简化为记忆和局部生成;模型可能正确回答角色知识问题,却仍然无法维持角色身份和角色能力边界。第二类是动态基准。它们引入预定义场景流程或有界的多轮对话,使评测比静态基准更接近真实交互。问题是自由对话可能偏离过大且带有很高不确定性,这意味着对话可能无法覆盖角色档案中的关键要求,也可能无法充分评测模型是否稳定遵循预期的角色设定。第三类是智能体基准。这些方法使用用户智能体、评测智能体或模拟环境动态生成交互,从而更自然地探索对话空间。它们可以推动和约束对话的方向与进展,使整体对话过程更可控、更易管理,从而能够更全面地评测模型是否符合预期角色设定。 这三个家族各自解决了角色扮演评测的一部分,但留下了一个关键空白。静态基准有稳定的测试目标,但缺乏多轮交互中的主动引发;自由聊天基准更接近自然对话,但难以确认哪些检查清单要求被实际覆盖;现有智能体基准可以探索对话空间,但如果没有固定测试目标和显式状态轨迹,其结果仍然难以审计。TRACE Bench 通过在固定检查清单要求上进行自适应交互,并将最终分数建立在要求状态证据之上,填补了这一空白。 TRACE Bench 采用智能体方法:它首先将角色档案转化为检查清单,然后让该检查清单驱动多轮交互。给定完整角色档案后,数据创建流水线使用技能生成用例、提取任务驱动检查清单,然后进行验证、修复和人工审查,确保每个用例都有明确的检查清单要求可测试,且每个检查清单条目都有意义。在评测时,用户智能体扮演用户档案所指定的场景用户,并与目标模型进行自然对话。在内部,它维护固定检查清单状态,并根据对话历史主动引发未覆盖的检查清单条目。每个检查清单条目按状态更新并关联到具体证据;最终分数由检查清单状态轨迹聚合而成,而非来自不受约束的整体印象。基于这一设计,TRACE Bench 能更系统地暴露当前角色扮演模型中的失败模式,并将模型分数追溯到具体的检查清单条目和对话证据。 我们的实验围绕这一效度论证展开:我们首先测试已发布的自由聊天记录是否实际覆盖检查清单要求,然后验证智能体引发能否恢复覆盖率,检查在重复运行和替换用户智能体下的协议稳定性,并将同一协议应用于 26 个模型。我们进一步引入闭环基准演进作为基准自我进化机制。在角色档案和检查清单要求保持不变的情况下,它改变用户智能体在后续对话中组织验证的方式。具体而言,它可以将失败的轨迹中被证明有效的验证方法提炼为可复用的验证流程,供后续用户智能体使用。当真实用户交互数据可用时,它还可以总结在线用户的提问风格、追问路径和边界试探模式,使后续评测中的用户智能体更好地匹配真实用户的提问行为。 本文做出四项贡献。第一,我们提出 TRACE Bench 基准框架:它包含基于技能的数据创建流水线和智能体检查清单评测流程,将角色要求转化为可引发、可记录、可审计的多轮评测状态。第二,我们发布一个包含 200 个评测用例的数据集:78 个源自 CharacterEval 的用例和 122 个场景生成用例,共 5,498 个检查清单条目,用于评估模型在不同角色和任务场景下的行为。第三,我们构建了一个覆盖 26 个模型的排行榜:在相同评测协议下,我们比较主流角色扮演模型并报告总分、能力细分和检查清单轨迹,使排行榜不仅对模型排名,还能解释模型失败发生在何处。第四,我们引入闭环基准演进:TRACE Bench 可以从失败轨迹中提取有效验证方法,并将其转化为后续评测的验证流程。 ## 2 相关工作 为了比较角色扮演评测方法,我们沿两个独立维度组织先前工作:评测如何与目标角色模型交互,以及它如何将交互结果转化为分数或判断。第一个维度是交互策略:静态评测使用离线或预定测试项;自由聊天评测将模型置于多轮交互中;智能体评测允许用户、评测者或环境智能体根据当前轨迹或评测状态改变策略。第二个维度是评分策略:基于规则的评分使用金答案、指标、惩罚或确定性状态聚合;LLM 即评委被动评估生成回复或轨迹;智能体即评委则将判断建立在交互过程中产生的状态跟踪、证据收集或条目级聚合之上。这两个维度是正交的:一个基准可以使用自由聊天交互加 LLM 评委,也可以使用智能体交互加基于规则的条目聚合。图 2(https://arxiv.org/html/2608.11236#S2.F2)给出了示意定位。见图注 图 2:角色扮演评测基准的时间线图景。x 轴显示以月为分辨率的首次公开发布日期,2020–2022 区间被压缩;y 轴按交互策略对基准分组:静态、自由聊天和智能体。标记颜色编码主要评分机制:基于规则的评分、LLM 即评委或智能体即评委。标记填充编码基准范围:实心标记表示直接评测角色、人设或角色档案保真度的角色扮演基准,空心标记表示评测相关交互能力但并非设计为狭义角色扮演保真度基准的相邻社会或世界环境。标记形状编码证据粒度:圆形表示条目级或轮次级证据,正方形表示轨迹级或会话级证据,菱形表示要求状态级证据——即显式角色要求在交互过程中被跟踪和更新。小的垂直偏移和标注轨仅用于可读性。TRACE Bench 被定位为一个近年出现的智能体基准,它使用智能体即评委对要求状态证据进行评分。 ### 2.1 交互策略 ##### 静态评测。 静态评测使用离线或预定的问题、上下文、场景或局部回复任务。这里,“静态”并不意味着所有测试项必须提前手工编写。相反,评测开始后,测试目标和评分对象基本固定,评测策略通常不会根据目标模型的中间回复持续调整追问或覆盖目标。RoleLLM/RoleBench [18](https://arxiv.org/html/2608.11236#bib.bib46) 从角色语料和角色档案构建角色条件化生成任务,覆盖角色知识和角色风格,并结合自动文本指标、模型评分和人工评测。RoleEval [11](https://arxiv.org/html/2608.11236#bib.bib49) 将角色事实、背景和相关推理转化为双语选择题,主要以金答案准确率评分。CharacterBench [25](https://arxiv.org/html/2608.11236#bib.bib42) 使用大规模角色设定和角色问题,并通过 CharacterJudge 和人工标签在多个角色扮演维度上评估开放回复。CharacterEval [13](https://arxiv.org/html/2608.11236#bib.bib47) 基于多轮角色对话和对话上下文评估角色回复。InCharacter [16](https://arxiv.org/html/2608.11236#bib.bib50) 将心理量表转化为角色访谈问题,并通过量表一致性答案来测量人格保真度。PersonaGym [10](https://arxiv.org/html/2608.11236#bib.bib43) 选择与 persona 相关的环境并生成任务特定问题来评估 persona 遵循度;其动态部分主要体现在环境和问题生成中,而非在对话期间维护要求状态覆盖率。LifeChoice [21](https://arxiv.org/html/2608.11236#bib.bib55) 和 HPD [2](https://arxiv.org/html/2608.11236#bib.bib51) 也为 persona 驱动的决策或角色一致对话提供静态评测。这些基准廉价、稳定且易于复现,但孤立的条目表现好并不能保证模型能在交互中维持身份、能力边界、长期目标和行为一致性等维度。 ##### 自由聊天评测。 自由聊天评测将模型置于开放或脚本化的多轮对话设置中。PingPong [5](https://arxiv.org/html/2608.11236#bib.bib44) 让一个玩家模型扮演目标角色,使用询问者模型模拟用户并提出多轮问题,然后依靠评委模型集成来评分角色一致性、娱乐价值和语言流畅度。RMTBench [20](https://arxiv.org/html/2608.11236#bib.bib67) 构建以用户为中心的多轮角色交互,强调显式用户动机和用户意图满足,并使用多轮对话模拟来评估用户意图与角色回复之间的交互。DMT-RoleBench [22](https://arxiv.org/html/2608.11236#bib.bib65) 从预定义评测意图动态生成多轮交互,并使用 DMT-RM 和 DMT-Score 进行评分。SocialBench [1](https://arxiv.org/html/2608.11236#bib.bib48) 进一步在个体和群体层面评估角色扮演智能体的社交性,重点关注多轮社交互动中的表现。这些方法比静态探测更容易暴露风格漂移、记忆不一致、弱的用户适应和长上下文退化。但更长的对话本身并不意味角色要求覆盖更完整。关键区别不在于评测是否多轮,而在于其交互策略是否显式针对要求覆盖率。 ##### 智能体评测。 智能体评测允许用户智能体、评测智能体或环境根据当前轨迹、任务状态、观察到的失败或未完成目标来改变行为。CoSER 的情境表演 [17](https://arxiv.org/html/2608.11236#bib.bib45) 要求 LLM 在书中场景里依次扮演多个角色。CharacterBox [15](https://arxiv.org/html/2608.11236#bib.bib64) 让角色智能体在基于文本的虚拟世界中与叙述者或环境智能体交互,产生用于角色行为分析的细粒度轨迹。LIGHT [14](https://arxiv.org/html/2608.11236#bib.bib75) 提供一个带语言、动作、世界状态和与其他角色交互的具身游戏环境;SOTOPIA [26](https://arxiv.org/html/2608.11236#bib.bib78) 评估目标驱动的谈判、竞争或合作中的社会智能。两者都是有价值的社交/世界环境,但它们并不是针对固定角色档案保真度的狭义基准。RoleMRC [8](https://arxiv.org/html/2608.11236#bib.bib59) 在压力测试多轮角色交互、能力边界、回复/拒绝/尝试决策和嵌套指令优先级方面与本工作接近。RAIDEN-R1 和 RAIDEN 基准 [19](https://arxiv.org/html/2608.11236#bib.bib70) 使用角色感知信号测试基于脚本的知识和对话记忆。近期的会话级和模拟基准,如 DynSess [23](https://arxiv.org/html/2608.11236#bib.bib73) 和 PersonaArena [12](https://arxiv.org/html/2608.11236#bib.bib72),也表明相关工作正朝着长时程、动态模拟和社会情境化评测方向发展。这些工作共同表明,角色扮演评测正朝着更动态的交互、更丰富的环境和更可审计的评分方向发展。
相似文章
TeamBench:在强制角色分离下评估智能体协同
本文介绍了 TeamBench,这是一个用于评估在强制角色分离下智能体协同能力的基准测试,旨在解决仅靠提示词定义角色可能绕过预期约束的问题。
超越借用历史:面向交互式角色扮演评估的个性化用户模拟
介绍了PALATE,一个可扩展的基准,用于评估角色扮演智能体,使用个性化对齐的LLM模拟用户和个性化评分标准,解决了固定历史评估的局限性。
使用多智能体评估对角色扮演语言智能体进行对抗性压力测试
本文提出了一个模块化的多智能体平台,用于对角色扮演语言智能体进行对抗性压力测试,通过策略驱动的审讯智能体和自动化评判智能体,揭示多轮对话中累积的行为失败。跨三个人设和三类LLM家族的实验表明,多策略对抗评估将鲁棒性得分降低0.17-0.20,并识别出常见的失败模式,且与人类评判高度一致。
TOBench:面向真实世界工具使用智能体的任务导向全模态基准
TOBench是一个新的基准测试,用于评估AI智能体在真实世界、任务导向的工具使用中的表现,涉及多模态输入和闭环验证。实验表明,像Qwen 3.5 Plus这样的顶级模型仅达到41%的成功率,远低于94%的人类基准,凸显了显著的差距。
EnterpriseClawBench:基于真实工作会话的智能体基准测试
EnterpriseClawBench 提出了一个基于真实工作场景的企业智能体基准,包含 852 个可复现任务以及超越单一性能分数的综合评估指标。