KC-Bench: 一个用于评估LLM智能体中知识冲突的动态交互式基准

arXiv cs.AI 论文

摘要

KC-Bench 是一个动态交互式基准,用于评估LLM智能体如何检测和解决用户指令、参数知识与环境观察之间的知识冲突,评估显示没有模型能可靠地处理所有冲突类型。

arXiv:2609.03588v1 Announce Type: new 摘要: 随着LLM越来越多地通过工具执行操作,它们必须在执行前调和用户指令、参数知识和动态环境观察。我们推出了KC-Bench,一个受控的多轮基准,用于衡量在世界知识冲突、输入不一致性和多源时间冲突中这一能力。其238个任务是从1,000多个生成候选中手动筛选的,并结合了用户模拟器、有状态工具、确定性环境断言、开源自然语言评估器和人工轨迹验证。对九款模型的评估,包括DeepSeek-V4-Flash、GLM-5.2和MiniMax-M3,显示出显著的跨领域差异:没有模型能在所有设置中可靠地处理事实纠正、身份一致性检查和时间冲突解决。在模拟环境中,遗漏的冲突可能传播到工具调用或合成受保护数据流。KC-Bench 隔离了这种模型级别的行为,而不是对完整的智能体框架进行排名,并为开发冲突感知推理和执行保障措施提供了可复现的诊断工具。
查看原文
查看缓存全文

缓存时间: 2026/09/04 06:08

# KC-Bench:一个用于评估LLM智能体知识冲突的动态交互基准
来源:https://arxiv.org/html/2609.03588
###### 摘要
随着大语言模型越来越多地通过工具执行操作,它们必须在执行前协调用户指令、参数化知识和动态环境观察。我们引入了KC-Bench,一个受控的多轮基准,用于衡量智能体在处理世界知识冲突、输入不一致和多源时间冲突方面的能力。其238个任务是从1000多个生成的候选任务中人工筛选而来,结合了用户模拟器、有状态工具、确定性环境断言、开源自然语言评估器和人类轨迹验证。对包括DeepSeek-V4-Flash、GLM-5.2和MiniMax-M3在内的九个模型的评估显示出显著的跨领域差异:没有模型能在所有设置中可靠地处理事实纠正、身份一致性检查和时间冲突解决。在模拟环境中,未检测到的冲突可能会传播到工具调用或合成的受保护数据流中。KC-Bench隔离的是这种模型级别的行为,而非对完整智能体框架进行排名,并为开发具有冲突感知的推理和执行安全机制提供了一个可复现的诊断工具。
¹上海人工智能实验室 ²香港大学 ³厦门大学马来西亚分校 ⁴北京邮电大学
[email protected]
代码—https://github.com/ASTAR123/KC-Bench

## 引言
LLM智能体越来越多地部署在必须根据多个证据来源(而非单一提示)来决定如何行动的环境中。一个用户请求可能结合了参数化知识、数据库记录、API响应、工具反馈以及先前的交互历史(Wang et al. 2024a (https://arxiv.org/html/2609.03588#bib.bib20); Guo et al. 2024 (https://arxiv.org/html/2609.03588#bib.bib8); Xi et al. 2025 (https://arxiv.org/html/2609.03588#bib.bib23); Luo et al. 2025 (https://arxiv.org/html/2609.03588#bib.bib14))。这种多源设置功能强大但也很脆弱:当这些来源不一致时,智能体必须在提交外部操作之前识别冲突。否则,一个看似普通的任务可能会演变成执行层面的安全失败,例如查询错误的账户、泄露私人信息或使用过时的工具输出。

现有评估只部分覆盖了这个问题。知识冲突基准主要研究静态生成或问答任务,通常将冲突构建为检索到的上下文与参数化知识之间的分歧(Chen et al. 2023 (https://arxiv.org/html/2609.03588#bib.bib4); Xie et al. 2023 (https://arxiv.org/html/2609.03588#bib.bib24); Xu et al. 2024 (https://arxiv.org/html/2609.03588#bib.bib26); Su et al. 2024 (https://arxiv.org/html/2609.03588#bib.bib17); Wang et al. 2023 (https://arxiv.org/html/2609.03588#bib.bib21))。交互式智能体基准则侧重于任务完成、工具使用或动态环境中的对抗鲁棒性(Liu et al. 2023 (https://arxiv.org/html/2609.03588#bib.bib13); Xu et al. 2025a (https://arxiv.org/html/2609.03588#bib.bib25); Yao et al. 2024 (https://arxiv.org/html/2609.03588#bib.bib28); Barres et al. 2025 (https://arxiv.org/html/2609.03588#bib.bib1))。KC-Bench并不声称其用户模拟、有状态工具或基于断言的评估方法本身是新颖的。它的贡献在于在这些领域的交叉点上,将一个独特的目标操作化:即作为智能体的LLM是否能在执行有重大影响的操作**之前**,检测并安全解决参数化知识、用户指令和动态环境观察之间的冲突。

评估智能体中的知识冲突具有挑战性,因为冲突来源和所需的安全行为因领域而异。在某些情况下,冲突发生在用户错误的假设与通用世界知识之间。在另一些情况下,冲突仅在工具调用后出现,例如当一封邮件解析到一个数据库配置文件,但其名称与用户声称的身份不符。更复杂的案例需要在多个具有时间或状态不一致性的记录上进行推理。因此,一个有用的基准需要定义可操作的冲突类型,通过逼真的交互来暴露这些冲突,并对最终任务完成情况以及智能体在行动前是否验证了证据进行评分。

图1:传统LLM主要面临参数化知识与用户输入之间的文本层面冲突,而LLM智能体必须解决来自环境和工具的动态多源冲突,其中未检测到的不一致可能导致执行层面的风险,如隐私泄露。我们引入了**KC-Bench**,一个用于评估LLM智能体知识冲突处理能力的动态交互基准。图1 (https://arxiv.org/html/2609.03588#Sx1.F1)展示了从标准LLM设置中的文本层面冲突到智能体设置中多源冲突的转变,其中未解决的不一致可能触发执行层面的风险。KC-Bench将冲突分为三种操作类型:
- **世界知识冲突**:用户输入与事实或常识相矛盾。
- **输入不一致**:捕捉用户提供的信息与外部输出之间的不匹配。
- **多源冲突**:源自陈旧、不完整或不一致的信息源,需要时间推理和上下文推理。

基于此分类法,我们推出了**KC-Bench**,一个涵盖零售客服和个人助理任务等实际领域的多轮基准,旨在评估智能体在知识冲突下的鲁棒性。我们的主要贡献如下:
- • **我们形式化了用于智能体评估的知识冲突。**我们定义了三种操作冲突类型,将异构证据来源映射到期望的安全行为,使得冲突处理的评估可以超越文本层面的事实性。
- • **我们引入了KC-Bench,一个用于冲突感知智能体评估的动态基准。**KC-Bench包含跨三个领域的238个多轮任务,并评估智能体是否检测冲突、执行必要的验证或澄清,并避免不安全的下游操作。
- • **我们对冲突证据下的智能体失败进行了实证分析。**在包括三个在初始评估后添加的最新智能体导向模型在内的九个模型上进行的实验揭示了在事实纠正、身份一致性检查和时间冲突解决方面持续存在但强烈依赖领域的弱点。

## 相关工作
### 智能体安全与执行空间风险
随着外部工具集成,LLM已发展成为能够进行多步规划和行动的自主智能体(Wang et al. 2024a (https://arxiv.org/html/2609.03588#bib.bib20); Guo et al. 2024 (https://arxiv.org/html/2609.03588#bib.bib8); Xi et al. 2025 (https://arxiv.org/html/2609.03588#bib.bib23); Luo et al. 2025 (https://arxiv.org/html/2609.03588#bib.bib14))。现有安全研究主要关注输入端威胁,包括越狱(Mao et al. 2025 (https://arxiv.org/html/2609.03588#bib.bib15))、提示注入(Debenedetti et al. 2024 (https://arxiv.org/html/2609.03588#bib.bib5); Lee and Tiwari 2024 (https://arxiv.org/html/2609.03588#bib.bib11); Shi et al. 2025 (https://arxiv.org/html/2609.03588#bib.bib16))和后门攻击(Wang et al. 2024b (https://arxiv.org/html/2609.03588#bib.bib22); Zhu et al. 2025 (https://arxiv.org/html/2609.03588#bib.bib29))。然而,除了对抗性输入,智能体在执行合法任务时也面临执行空间风险,不安全的操作可能源于误解系统约束(Wang, Poskitt, and Sun 2025 (https://arxiv.org/html/2609.03588#bib.bib19))、对工具输出验证不足(Doshi et al. 2026 (https://arxiv.org/html/2609.03588#bib.bib7); Li 2025 (https://arxiv.org/html/2609.03588#bib.bib12))或对环境反馈推理错误(Chen et al. 2025 (https://arxiv.org/html/2609.03588#bib.bib2))。

### LLM中的知识冲突与认知挑战
知识冲突已在问答(Tan et al. 2024 (https://arxiv.org/html/2609.03588#bib.bib18); Chen, Zhang, and Choi 2022 (https://arxiv.org/html/2609.03588#bib.bib3))和检索增强生成(Xie et al. 2023 (https://arxiv.org/html/2609.03588#bib.bib24); Jin et al. 2024 (https://arxiv.org/html/2609.03588#bib.bib10))中得到研究,主要关注外部上下文与参数化知识之间的冲突。然而,在智能体环境中,问题变得更加广泛,因为智能体必须对多个动态且可能不一致的信息源进行推理(Xu et al. 2025b (https://arxiv.org/html/2609.03588#bib.bib27); Liu et al. 2023 (https://arxiv.org/html/2609.03588#bib.bib13); Xu et al. 2025a (https://arxiv.org/html/2609.03588#bib.bib25); Yao et al. 2024 (https://arxiv.org/html/2609.03588#bib.bib28))。因此,知识冲突超越了文本事实性,直接影响智能体系统中的决策制定和操作安全。

### 动态交互评估与面向过程的故障诊断
近期工作提出了交互式基准,通过在更真实的环境中评估LLM智能体,超越了静态的单轮问答,方法包括引入工具使用(Liu et al. 2023 (https://arxiv.org/html/2609.03588#bib.bib13); Xu et al. 2025a (https://arxiv.org/html/2609.03588#bib.bib25))、状态跟踪(Deng et al. 2024 (https://arxiv.org/html/2609.03588#bib.bib6); Jimenez et al. 2023 (https://arxiv.org/html/2609.03588#bib.bib9))和用户模拟(Yao et al. 2024 (https://arxiv.org/html/2609.03588#bib.bib28); Barres et al. 2025 (https://arxiv.org/html/2609.03588#bib.bib1))。现有基准主要评估任务成功率和效率,忽略了由知识冲突引起的失败。我们引入了一个新基准,它明确包含知识冲突,从而能够分析智能体如何检测、解决冲突并在冲突下行动。

## KC-Bench
### 问题表述与3级分类法
我们将智能体-环境交互建模为部分可观测马尔可夫决策过程(图2 (https://arxiv.org/html/2609.03588#Sx3.F2))。在步骤t,策略πθ接收三个信息来源:
- **参数化记忆**:在预训练期间获得的世界知识和常识。
- **用户指令**:对话历史和当前请求。
- **环境观察**:由外部工具或数据库返回的状态。

当发生以下情况时,存在冲突:
概念分歧:D[P(v|Kparam) ‖ P(v|U, Oε)]
或概念矛盾:U ∧ Oε ⊭ ⊥

这里,D表示概念分歧,⊥表示逻辑矛盾;两者都不需要被估计。该基准测试三种交互复杂度递增的冲突类型,并评估智能体是否在采取违反策略的操作之前解决它们。

图2:KC-Bench的动态执行流程。它展示了任务驱动的用户模拟器和LLM智能体之间的交互循环,智能体必须调用工具和查询数据库,在特定领域策略下识别和检测注入的知识冲突。

**级别1:世界知识冲突**
此级别测试一个捏造的用户前提Ffake,它与参数化记忆中的真实事实Ftrue相矛盾,即U ⊧ Ffake 且 Ffake ∧ Ftrue = ⊥。
期望的策略是拒绝错误前提:π*(areject | U, Kparam) → 1
基于Ffake执行操作是一个认知失败。

**级别2:输入不一致**
此级别测试相互矛盾的用户凭证和数据库观察结果。对于用户身份信息和环境观察,当v_u1 = v_t1 但 v_u2 ≠ v_t2(例如,邮箱匹配但姓名不匹配)时,冲突发生。智能体必须在执行敏感操作之前进行澄清:a_t = a_clarify(v_t2, v_u2) 应在 a_write/query_private 之前执行。绕过此约束是一个检测和执行失败。

**级别3:多源冲突**
此级别测试多个来源返回的记录R中时间或状态上的矛盾:∃ i, j s.t. r(i) ∧ r(j) = ⊥ 且 t(i) < t(j)(例如,旧记录与新记录矛盾)。智能体必须对时间戳、完整性标记或状态转换进行推理,以决定采纳哪个来源,或在采取依赖于特定版本的操作前请求更新。错误地解决这种冲突会导致级联的操作错误或状态污染。

相似文章

AISE-Bench:面向学术知识图谱信息检索的全流程精选基准

arXiv cs.AI

本文介绍了AISE-Bench,一个包含1,133个问答对的精选基准,用于评估LLM智能体在学术知识图谱上的多步API规划和基于源的可信摘要。该基准显示,即使是最强的模型也仅达到中等性能,凸显了步骤正确性和可追踪推理方面的挑战。