PreAct-Bench: 对LLM进行预测性监控的基准测试

arXiv cs.LG 论文

摘要

PreAct-Bench是一个包含五个领域、1000对道德与不道德行动轨迹的基准测试,旨在评估LLM从部分轨迹中预测有害结果的能力(预测性监控)。结果表明,虽然人类表现良好,但当前的LLM仍存在困难,凸显了未来导向的风险推理的必要性。

arXiv:2606.09890v1 公告类型: 新 摘要:大型语言模型(LLMs)正越来越多地被部署为能够执行多步行动轨迹以实现给定目标的自主代理。虽然现有的安全研究侧重于从完整轨迹中检测不道德行为,但这种范式本质上是回顾性的:它仅在危害已经发生后才识别危害。在这项工作中,我们研究了一个关键但被忽视的安全任务,我们称之为预测性监控:仅给定部分行动轨迹,模型能否推断出它是否会在明确行动执行之前导致不道德行为?为了支持这一任务,我们提出了PreActBench,一个涵盖五个领域、包含1000对道德与不道德行动轨迹的基准。我们使用我们的Prefix Foresight F1指标,评估了多种LLM、安全护栏模型以及潜在探针方法,在行动轨迹的不同片段上的表现。结果表明,尽管人类取得了令人鼓舞的表现,但即使对于强大的模型,预测性监控仍然具有挑战性,凸显了在LLM安全中需要面向未来的风险推理。
查看原文
查看缓存全文

缓存时间: 2026/06/10 06:17

# PreAct-Bench:大语言模型预测性监控基准测试

**来源:** https://arxiv.org/html/2606.09890

徐海牛¹†,Italo Luis da Silva¹∗,叶江南¹,Yuhao Wang²,刘伟¹,杨林逸³,Jonathan Richard Schwarz⁴,⁵,Nicola Paoletti¹,何玉兰¹,⁶,韩琦¹

† 同等贡献  
¹ 伦敦国王学院  
² 新加坡国立大学  
³ 南方科技大学  
⁴ 汤森路透基础研究  
⁵ 帝国理工学院  
⁶ 艾伦·图灵研究所  
{hainiu.xu, hanqi.yan}@kcl.ac.uk

###### 摘要

大型语言模型(LLM)正越来越多地被部署为能够针对给定目标执行多步骤动作轨迹的自主智能体。虽然现有的安全研究主要关注从完整轨迹中检测不道德行为,但这种范式本质上是回溯性的:它只有在伤害已经发生后才能识别出来。在本工作中,我们研究了一个关键但被忽视的安全任务,我们称之为*预测性监控*:仅根据部分动作轨迹,模型能否在显性不道德行为*执行之前*推断出该轨迹最终是否会导致不道德行为?为支持这一任务,我们提出了PreAct-Bench,这是一个包含跨五个领域的1,000对配对的伦理和非伦理动作轨迹的基准测试。我们使用我们的*前缀预见F1*指标,评估了各种LLM、安全护栏模型和潜在探测方法在不同轨迹片段比例下的表现。结果表明,虽然人类的表现具有前景,但即使对于强大的模型来说,预测性监控仍然具有挑战性,这凸显了在LLM安全中需要面向未来的风险推理。

¹ 数据和代码可在 https://github.com/oyarsa/preact-bench 获取。

---

**PreAct-Bench: 大语言模型预测性监控基准测试**

徐海牛¹† *同等贡献*, Italo Luis da Silva¹∗, 叶江南¹, Yuhao Wang², 刘伟¹, 杨林逸³, Jonathan Richard Schwarz⁴,⁵, Nicola Paoletti¹, 何玉兰¹,⁶, 韩琦¹

¹ 伦敦国王学院  
² 新加坡国立大学  
³ 南方科技大学  
⁴ 汤森路透基础研究  
⁵ 帝国理工学院  
⁶ 艾伦·图灵研究所  
{hainiu.xu, hanqi.yan}@kcl.ac.uk

## 1 引言

**图 1:** PreAct-Bench 中预测性监控的轨迹演示,其中仅给出看似合乎伦理的推理轨迹前缀,用于概率性的未来结果预测。

大型语言模型(LLM)正越来越多地被部署为能够针对给定目标执行多步骤动作轨迹的自主智能体 (Yao et al., 2023; Yang et al., 2024)。虽然这种自主性提高了生产力,但也对安全和监督提出了重大挑战。最近的研究表明,LLM 可能表现出战略性的失调或欺骗行为,例如在逃避检测的同时追求有害的副作用目标 (Scheurer et al., 2024; Hubinger et al., 2024)。该研究方向中常见的评估范

相似文章

DataPrep-Bench: 将LLM作为训练数据准备器的基准测试

arXiv cs.LG

DataPrep-Bench是一个统一的基准测试,用于评估LLM在六个领域的训练数据构建和质量评估能力,包括一个技能引导的代理(Data-Construction-Skill)和一个基于分布的评估器(DAS),后者实现了强大的跨模型相关性。

PM-Bench:评估LLM智能体的前瞻记忆能力

arXiv cs.AI

提出了PM-Bench,这是一个受认知科学启发、用于评估LLM智能体前瞻记忆能力的基于文本的基准测试。实验表明,即使是最佳方法(GPT-5.4智能体)也仅达到65.1%的F1分数,表明在可靠的意图执行方面存在重大挑战。

AICompanionBench:评测 LLM 作为裁判在 AI 伴侣安全领域的表现

arXiv cs.AI

AICompanionBench 推出了首个公开可用的基准数据集,包含 2,123 条真实 AI 伴侣对话,并按九个安全风险类别进行标注,用于评估 20 个 LLM 作为安全裁判的表现。结果显示,强模型能较好地处理显性有害内容,但在操控等细微风险的识别以及对无害对话的误判问题上仍存在明显不足。