LPDS:通过逻辑保持难度缩放评估LLM鲁棒性
摘要
介绍LPDS,一个通过缩放逻辑保持变体的难度来系统评估LLM鲁棒性的框架,发现性能下降高达随机采样的5倍,并在更难变体上训练提高了鲁棒性。
arXiv:2605.15393v1 公告类型:新
摘要:随着大语言模型(LLM)越来越多地被部署用于执行最少人工监督的任务,这些模型的鲁棒性至关重要。特别是,一个能够解决给定问题的模型不应仅仅因为某些实体——如名称、数字或其他上下文细节——发生了变化而底层问题逻辑保持不变时失败。先前的研究表明,当前的LLM仍然难以应对这种鲁棒性形式:它们通常能成功解决某个问题的某些变体,但在其他变体上失败。然而,现有的评估通常缺乏一种系统的方法来识别哪些逻辑保持变体最可能导致失败。相反,它们通常测试允许变体的随机子集,这可能会夸大鲁棒性。为了解决这一差距,我们引入了逻辑保持难度缩放(LPDS),这是一个框架,它(i)量化问题变体的难度,并(ii)系统搜索允许变体的空间,以找到那些最大化难度并暴露失败变体的变体。我们表明,随着难度增加,性能下降,模型推理链中的错误变得更加明显。我们进一步证明,LPDS高效地找到模型的高难度问题变体,导致性能下降比随机采样高出5倍。最后,我们表明,在更难变体上进行微调比在较容易变体上训练能带来更一致的鲁棒性提升。
查看缓存全文
缓存时间: 2026/05/18 06:40
# LPDS:通过逻辑保持难度缩放评估大语言模型鲁棒性 来源:https://arxiv.org/abs/2605.15393 查看PDF (https://arxiv.org/pdf/2605.15393) > 摘要:随着大语言模型(LLMs)越来越多地被部署用于在最小人工监督下执行任务,这些模型的鲁棒性变得至关重要。特别是,一个能够解决给定问题的模型,不应该仅仅因为某些实体——例如名称、数字或其他上下文细节——已经改变而底层问题逻辑保持不变就失败。先前的研究表明,当前的LLMs在这种鲁棒性上仍然存在困难:它们常常在某些问题变体上成功,但在其他变体上失败。然而,现有评估往往缺乏系统性的方法来识别哪些逻辑保持的变体最可能引发失败。相反,它们通常测试一个允许变体的随机子集,这可能会高估鲁棒性。为填补这一空白,我们引入了逻辑保持难度缩放(LPDS),这是一个框架,它(i)量化问题变体的难度,并(ii)系统性地搜索允许变体的空间,以找到那些最大化难度并暴露失败的变体。我们表明,随着难度增加,性能下降,并且模型推理链中的错误变得更加明显。我们进一步证明,LPDS能高效地找到针对模型的高难度问题变体,导致性能下降幅度高达随机采样的5倍。最后,我们表明,对更困难的变体进行微调比在较容易的变体上训练能带来更一致的鲁棒性提升。 ## 提交历史 来自:Philipp Mondorf [查看邮件](https://arxiv.org/show-email/68e3a037/2605.15393) **\[v1\]** 2026年5月14日星期四 20:26:59 UTC (431 KB)
相似文章
鲁棒批评者:防御LLMs免受多轮攻击
本文提出对话批评者引导采样(DCGS)框架,通过从对话历史推断用户意图,并利用基于价值/遗憾的批评者对回复进行评分,在不进行微调的情况下提高鲁棒性,从而防御LLMs免受多轮对抗性攻击。
从零阶选择到二阶判断:组合硬化暴露前沿大语言模型的组合性缺陷
本文介绍了 LogiHard,这是一个利用组合硬化来暴露前沿大语言模型组合性缺陷的框架,展示了模型在逻辑推理任务中准确率的显著下降。
Decoding-Level Taboo:一种针对LLM鲁棒性的解码级诊断压力测试
本文介绍了Decoding-Level Taboo,这是一种运行时logit空间压力测试,通过迫使LLM偏离其常规生成路径来评估路径外鲁棒性,结果表明鲁棒性随模型规模和指令对齐程度的提高而改善。
LLMEval-Logic:一个经过求解器验证的、带有对抗性加固的大语言模型逻辑推理中文基准
LLMEval-Logic 是一个新的中文基准,专门评估大语言模型的逻辑推理能力,具有求解器验证的答案和对抗性加固。该基准揭示了当前模型的显著差距,最佳模型在困难项目上仅达到37.5%的准确率。
RLearner-LLM:通过混合直接偏好优化平衡大语言模型的逻辑基础与流畅性
本文介绍了RLearner-LLM,一个使用混合直接偏好优化(Hybrid-DPO)的框架,旨在平衡LLM生成解释的逻辑正确性和流畅性。该框架在多个领域和基础模型上实现了显著的NLI蕴含改进,同时减轻了标准偏好信号中的冗长偏差。