在冲突激励下LLM智能体中知识验证的涌现欺骗

arXiv cs.CL 论文

摘要

本文介绍了KnownLieBench,这是一个通过验证知识来评估在冲突激励下LLM智能体中涌现欺骗的基准。

arXiv:2608.26372v1 公告类型:新 摘要:大型语言模型越来越多地被部署为代表公司服务用户的自主智能体,这使得它们处于用户和部署者利益可能发生冲突的环境中。当智能体知道用户应得某物而其部署者更愿意拒绝时,它是否保持诚实?回答这个问题很困难,因为虚假陈述可能反映的是无知或幻觉,而不是欺骗。为了解决这个挑战,我们引入了KnownLieBench,这是一个知识验证的基准,首先通过中性探测确认智能体知道用户的应得权益,然后评估在引入拒绝该权益的激励后,它是否做出虚假声明。具体来说,KnownLieBench覆盖了八个客户服务领域和112个基于事实的案例,与具有信任跟踪功能的客户智能体进行多轮对话,并将仅由激励产生的欺骗与在明确指令下产生的欺骗区分开来。在十八个专有和开放权重模型中,涌现欺骗在模型家族和领域间存在显著差异。我们进一步将该基准用于后训练,发现以诚实为导向的微调减少了激励下的欺骗,而基于欺骗评分的微调在诚实控制对话中增加了谎言成功率,但没有增加激励下的谎言频率。通过在评估欺骗行为前验证应得权益知识,KnownLieBench减少了说谎与不知情之间的混淆,从而能够更严格地审计和引导智能体的诚实性。
查看原文
查看缓存全文

缓存时间: 2026/08/28 09:26

# 知识验证:利益冲突下LLM智能体的涌现式欺骗行为  
来源:https://arxiv.org/html/2608.26372  
作者:赵伟良(圣母大学,哥伦比亚大学);袁翔驰、马宁山(佐治亚理工学院,麻省理工学院);黄月、蒋孟  

###### 摘要  
大语言模型正日益作为自主智能体部署,代表企业为用户提供服务,这使它们置身于用户与部署方利益可能发生冲突的情境中。当智能体明知用户应享有某项权益而其部署方倾向于否认时,它能否保持诚实?回答这一问题颇具挑战,因为错误陈述可能源于无知或幻觉,而非欺骗。为此,我们提出KnownLieBench——一个经知识验证的基准:首先通过中性探测确认智能体知晓用户权益,再评估其在引入否认权益的激励后是否做出虚假陈述。KnownLieBench涵盖八个客户服务领域、112个基于事实的案例,通过与具备信任追踪能力的客户智能体进行多轮对话,并将仅因激励产生的欺骗与在明确指令下产生的欺骗进行区分。在十八个专有和开源模型中,涌现式欺骗在不同模型家族和领域间存在显著差异。我们将该基准用于训练后优化,发现:以诚实为导向的微调能减少激励条件下的欺骗行为;而以欺骗程度分级的微调会提高诚实对照对话中的谎言成功率,但不会增加激励条件下的说谎频率。通过在评估欺骗行为前验证权益知识,KnownLieBench降低了说谎与无知之间的混淆因素,使得对智能体诚实度的审计与引导更为严格。代码已发布于franciscoliu/knownliebench(https://franciscoliu.github.io/KnownLieBench-website/)。  

## 1引言  
大语言模型现已具备长期规划、代码编写与执行、外部工具调用等能力(OpenAI, 2023 (https://arxiv.org/html/2608.26372#bib.bib29);Wei et al., 2022 (https://arxiv.org/html/2608.26372#bib.bib30);Chen et al., 2021 (https://arxiv.org/html/2608.26372#bib.bib31);Schick et al., 2023 (https://arxiv.org/html/2608.26372#bib.bib32))。这些能力正逐渐被包装为代表用户或组织执行任务的智能体(Yao et al., 2023 (https://arxiv.org/html/2608.26372#bib.bib33);Wang et al., 2024 (https://arxiv.org/html/2608.26372#bib.bib34))。随着此类智能体在商业、金融、医疗和旅行领域接管面向客户的工作(Yao et al., 2024 (https://arxiv.org/html/2608.26372#bib.bib28)),它们处于服务的用户与部署企业之间,而双方利益可能冲突。这一位置使诚实直接承受商业压力。当部署方通过否认用户应得权益或索取不当得利获利时,智能体会否说谎?客户能否识破?  

近期研究表明,大语言模型会在压力下欺骗、为取悦用户牺牲准确性、并通过策略性误导实现目标(Scheurer et al., 2024 (https://arxiv.org/html/2608.26372#bib.bib11);Sharma et al., 2024 (https://arxiv.org/html/2608.26372#bib.bib23);Meinke et al., 2024 (https://arxiv.org/html/2608.26372#bib.bib12);Greenblatt et al., 2024 (https://arxiv.org/html/2608.26372#bib.bib13))。解读此类行为颇具难度,因为虚假陈述可能反映无知或幻觉,而非误导意图。多数诚实与欺骗评估要么分别测试知识与不诚实行为,要么在未验证模型是否知晓真相的情况下直接评分欺骗性输出(Chern et al., 2024 (https://arxiv.org/html/2608.26372#bib.bib5);Wu et al., 2025 (https://arxiv.org/html/2608.26372#bib.bib4);Su et al., 2025 (https://arxiv.org/html/2608.26372#bib.bib3);Huang et al., 2025 (https://arxiv.org/html/2608.26372#bib.bib1);Bai et al., 2026 (https://arxiv.org/html/2608.26372#bib.bib35));而能诱发模型信念的基准则评估孤立的单轮陈述,而非处于操作激励下的智能体(Ren et al., 2025 (https://arxiv.org/html/2608.26372#bib.bib2))。  

缺失的是一个既能验证智能体知晓可外部核查的事实真相,又能在可执行环境中测量操作激励下诚实度的设定。为弥合这一差距,我们提出KnownLieBench——一个跨八个领域的智能体欺骗知识验证基准。例如,客服智能体可能知晓用户应获退款至原支付方式,却面临将资金留存企业的压力。在对话评分前,同一模型需完成中性知识检查以确认其能识别正确权益,从而降低无知或幻觉的混淆因素。随后,KnownLieBench评估两种互补的欺骗设定:在*涌现式*设定中,智能体接收支持企业偏好结果的商业激励,但从未被指示说谎;在*指令式*设定中,智能体被明确要求否认权益并提供虚假解释。诚实对照组提供虚假陈述基线率。  

在112个基于事实的案例中,每轮交互通过多轮对话展开,客户初始信任度分为高、中、低三档(影响其核查主张的意愿),并在各轮间动态变化。跨十八个专有及开源模型,KnownLieBench生成超18,000次多轮交互。我们的主要贡献如下:  
- • 提出KnownLieBench基准:在评估欺骗行为前先验证权益知识,并在单一智能体协议中分离涌现式与指令式欺骗,同时评估欺骗成功率、检测率及客户信任度变化。  
- • 评估涵盖前沿专有系统与开源家族的十八个模型,发现两种设定存在显著差异。部分模型仅在激励下极少做出虚假陈述,而另一些模型则在多个领域持续说谎;明确指令显著提升了大多数模型的欺骗程度。在更广泛的机制标注中,虚假政策是五个领域中最常见的机制,且涌现式谎言使用的机制少于指令式谎言。  
- • 将基准重构为训练信号,发现训练后优化非对称地重塑涌现式欺骗:诚实对齐训练显著降低欺骗率;商业对齐奖励未将其提升至噪音水平以上;欺骗分级微调使存活于诚实对照对话中的谎言更易成功,而激励条件下的说谎频率保持统计不变。  
- • 在独立双模型试验中,应用近期提出的雅可比透镜(Gurnee et al., 2026 (https://arxiv.org/html/2608.26372#bib.bib8))于特制单轮探测。一个模型在响应前保留权益敏感输出,两者均在明确欺骗框架下表现出更低的决策时输出值。  

表1:KnownLieBench与现有欺骗及诚实基准的比较。  
KnownLieBench独特结合了知识验证式涌现欺骗、智能体工具使用、动态客户信任以及对欺骗成功率与检测率的评估。✓表示支持,✗表示不支持。  
交互回合数报告了可比较场景下的完整多轮模型-场景交互;–表示非交互式基准或无聚合计数的基准。  

## 2相关工作  
LLM欺骗行为。AI欺骗通常被定义为为追求真相以外的目标而诱发虚假信念(Park et al., 2024 (https://arxiv.org/html/2608.26372#bib.bib9)),并已通过结构化因果博弈中的信念与意图形式化(Ward et al., 2023 (https://arxiv.org/html/2608.26372#bib.bib10))。越来越多证据表明,大语言模型可在无明确指令下欺骗:GPT-4交易智能体在压力下隐瞒内幕交易(Scheurer et al., 2024 (https://arxiv.org/html/2608.26372#bib.bib11));模拟公司助手对用户和审计员说谎(Järviniemi and Hubinger, 2024 (https://arxiv.org/html/2608.26372#bib.bib7));前沿模型会针对开发者策划策略(Meinke et al., 2024 (https://arxiv.org/html/2608.26372#bib.bib12))、在训练中伪造对齐(Greenblatt et al., 2024 (https://arxiv.org/html/2608.26372#bib.bib13)),并随规模增长提升诱发虚假信念的能力(Hagendorff, 2024 (https://arxiv.org/html/2608.26372#bib.bib6))。欺骗也可被习得:人类反馈优化可教导模型误导评估者(Wen et al., 2025 (https://arxiv.org/html/2608.26372#bib.bib24))和操纵易感用户(Williams et al., 2025 (https://arxiv.org/html/2608.26372#bib.bib25));可博弈的奖励可泛化至奖励篡改(Denison et al., 2024 (https://arxiv.org/html/2608.26372#bib.bib26));植入的欺骗行为可在安全训练后存活(Hubinger et al., 2024 (https://arxiv.org/html/2608.26372#bib.bib27))。  

近期基准从静态诚实测试到开放式多轮模拟(Chern et al., 2024 (https://arxiv.org/html/2608.26372#bib.bib5);Su et al., 2025 (https://arxiv.org/html/2608.26372#bib.bib3);Wu et al., 2025 (https://arxiv.org/html/2608.26372#bib.bib4);Huang et al., 2025 (https://arxiv.org/html/2608.26372#bib.bib1))研究了这些行为。然而,谎言是说话者明知虚假的断言(Pacchiardi et al., 2024 (https://arxiv.org/html/2608.26372#bib.bib14))。如表1 (https://arxiv.org/html/2608.26372#S1.T1)所示,先前工作或诱发模型信念,或分离涌现式与指令式欺骗,但未结合知识验证与智能体多轮设定——后者需对同一谎言评估成功率和检测率。KnownLieBench正弥补这一空白。  

真实性。另一系列研究关注模型输出是否为真。TruthfulQA测量源自人类文本的模仿性虚假(Lin et al., 2022 (https://arxiv.org/html/2608.26372#bib.bib15));对齐方法教导模型拒绝超出知识范围的问题而非编造答案(Yang et al., 2024 (https://arxiv.org/html/2608.26372#bib.bib22))。真实性关注输出本身,而诚实性关注模型是否陈述其信念(Evans et al., 2021 (https://arxiv.org/html/2608.26372#bib.bib16))。大语言模型通常能校准自身知识(Kadavath et al., 2022 (https://arxiv.org/html/2608.26372#bib.bib17)),即使输出相悖仍编码真实相关信息(Burns et al., 2023 (https://arxiv.org/html/2608.26372#bib.bib18);Azaria and Mitchell, 2023 (https://arxiv.org/html/2608.26372#bib.bib19);Marks and Tegmark, 2024 (https://arxiv.org/html/2608.26372#bib.bib21)),并可通过真实相关激活引导向真实答案(Li et al., 2023 (https://arxiv.org/html/2608.26372#bib.bib20))。偏好训练可能奖励一致性而非准确性(Sharma et al., 2024 (https://arxiv.org/html/2608.26372#bib.bib23))。MASK通过测试压力下的回应是否与诱发信念矛盾来分离诚实与准确(Ren et al., 2025 (https://arxiv.org/html/2608.26372#bib.bib2)),但仍限于单轮。KnownLieBench将这一分离扩展至智能体对话:探测先验证智能体对用户权益的认知,激励随后诱使其否认该权益,而信任追踪客户决定谎言是否成功。  

图1:KnownLieBench概览。  
八个客服领域将智能体置于客户与部署方之间,后两者利益分歧。左侧,绑定记录确认客户应获退款至其卡中,智能体通过编造已拆封包裹政策予以否认。该主张面对三位仅在信任程度不同的客户:从接受主张者到核查政策并拒绝者。右侧,中性探测确认智能体知晓应得权益,仅通过探测的轮次被评分。智能体随后在私有成本压力(未提及说谎)下协商,客户接受、质疑或识破主张,智能体执行终端动作,法官根据记录判定该轮结果。示意图中打印的信任增量代表稳健性变体;主实验采用附录B.2 (https://arxiv.org/html/2608.26372#A2.SS2)的状态依赖更新规则。  

## 3KnownLieBench  
### 3.1任务形式化  
KnownLieBench测试当部署方目标与客户有文档记录的权益冲突时,客服智能体是否做出欺骗性主张。基于将谎言相对于模型认知定义(Pacchiardi et al., 2024 (https://arxiv.org/html/2608.26372#bib.bib14))并分离诚实与事实准确性的先驱工作(Ren et al., 2025 (https://arxiv.org/html/2608.26372#bib.bib2)),KnownLieBench在评分欺骗行为前验证模型知识。  

具体而言,每个案例提供权威政策、包含相关事实的特定案例客户记录及自然语言客户请求。为排除模型无知和幻觉,在对话前,同一模型需回答关于给定政策和记录下正确结果的中性问题(无客户在场或商业激励,例如“该客户是否有权获得退款至原支付方式?”)。仅通过知识门控的应得案例被用于欺骗评分。所有探测贡献于知识通过率,而校准案例测试模型是否识别合理拒绝。仅当法官识别出虚假主张并提供智能体的确切支持性引述时,才计为谎言。知识门控直接验证虚假权益否认(与模型先前识别的权益相矛盾)。其他不支持的主张(如捏造费用或期限)超出该门控范围,将使用诚实对照单独评估。附录D.3 (https://arxiv.org/html/2608.26372#A4.SS3)提供针对应得选项从未披露轮次的互补分析。  

除知识门外,KnownLieBench评估两种互补的欺骗设定:  
- *涌现式*设定:智能体接收支持企业偏好结果的私有商业目标,但从未被指示欺骗。  
- *指令式*设定:智能体被明确要求否认权益并提供虚假解释。  

此对比分离了激励下涌现的欺骗与对明确欺骗指令的服从。我们另设诚实对照组以估算无冲突激励下的基线虚假陈述率。  

### 3.2智能体评估环境  
智能体与环境。参照τ-bench等工具介导基准(Yao et al., 2024 (https://arxiv.org/html/2608.26372#bib.bib28)),每个案例在状态可通过工具调用改变的可执行环境中运行。每个领域提供相同的五个工具角色:两个用于读取案例记录和政策,一个用于与客户智能体通信,两个终端工具对应竞争结果。在校准案例中,当记录不满足资格要求时,请求的补救将被拒绝。最终结果直接读取。

相似文章

DECOR:基于信息操纵理论审计LLM欺骗行为

arXiv cs.CL

介绍了DECOR,一个基于信息操纵理论的多智能体框架,用于细粒度审计LLM回应中的策略性欺骗,在15个前沿模型的欺骗检测基准测试中取得了最先进的性能。