LPDS:通过逻辑保持难度缩放评估LLM鲁棒性

arXiv cs.LG 论文

摘要

介绍LPDS,一个通过缩放逻辑保持变体的难度来系统评估LLM鲁棒性的框架,发现性能下降高达随机采样的5倍,并在更难变体上训练提高了鲁棒性。

arXiv:2605.15393v1 公告类型:新 摘要:随着大语言模型(LLM)越来越多地被部署用于执行最少人工监督的任务,这些模型的鲁棒性至关重要。特别是,一个能够解决给定问题的模型不应仅仅因为某些实体——如名称、数字或其他上下文细节——发生了变化而底层问题逻辑保持不变时失败。先前的研究表明,当前的LLM仍然难以应对这种鲁棒性形式:它们通常能成功解决某个问题的某些变体,但在其他变体上失败。然而,现有的评估通常缺乏一种系统的方法来识别哪些逻辑保持变体最可能导致失败。相反,它们通常测试允许变体的随机子集,这可能会夸大鲁棒性。为了解决这一差距,我们引入了逻辑保持难度缩放(LPDS),这是一个框架,它(i)量化问题变体的难度,并(ii)系统搜索允许变体的空间,以找到那些最大化难度并暴露失败变体的变体。我们表明,随着难度增加,性能下降,模型推理链中的错误变得更加明显。我们进一步证明,LPDS高效地找到模型的高难度问题变体,导致性能下降比随机采样高出5倍。最后,我们表明,在更难变体上进行微调比在较容易变体上训练能带来更一致的鲁棒性提升。
查看原文
查看缓存全文

缓存时间: 2026/05/18 06:40

# LPDS:通过逻辑保持难度缩放评估大语言模型鲁棒性
来源:https://arxiv.org/abs/2605.15393
查看PDF (https://arxiv.org/pdf/2605.15393)

> 摘要:随着大语言模型(LLMs)越来越多地被部署用于在最小人工监督下执行任务,这些模型的鲁棒性变得至关重要。特别是,一个能够解决给定问题的模型,不应该仅仅因为某些实体——例如名称、数字或其他上下文细节——已经改变而底层问题逻辑保持不变就失败。先前的研究表明,当前的LLMs在这种鲁棒性上仍然存在困难:它们常常在某些问题变体上成功,但在其他变体上失败。然而,现有评估往往缺乏系统性的方法来识别哪些逻辑保持的变体最可能引发失败。相反,它们通常测试一个允许变体的随机子集,这可能会高估鲁棒性。为填补这一空白,我们引入了逻辑保持难度缩放(LPDS),这是一个框架,它(i)量化问题变体的难度,并(ii)系统性地搜索允许变体的空间,以找到那些最大化难度并暴露失败的变体。我们表明,随着难度增加,性能下降,并且模型推理链中的错误变得更加明显。我们进一步证明,LPDS能高效地找到针对模型的高难度问题变体,导致性能下降幅度高达随机采样的5倍。最后,我们表明,对更困难的变体进行微调比在较容易的变体上训练能带来更一致的鲁棒性提升。

## 提交历史

来自:Philipp Mondorf [查看邮件](https://arxiv.org/show-email/68e3a037/2605.15393) **\[v1\]** 2026年5月14日星期四 20:26:59 UTC (431 KB)

相似文章

鲁棒批评者:防御LLMs免受多轮攻击

arXiv cs.AI

本文提出对话批评者引导采样(DCGS)框架,通过从对话历史推断用户意图,并利用基于价值/遗憾的批评者对回复进行评分,在不进行微调的情况下提高鲁棒性,从而防御LLMs免受多轮对抗性攻击。