谁在翻转?自模型与跨模型反论点揭示LLM答案的不稳定性

Hugging Face Daily Papers 论文

摘要

本文引入了一种受控协议,通过用合理的反论点挑战正确答案来评估大型语言模型的答案稳定性,揭示了不同模型之间翻转率的巨大差异,而仅凭准确率指标无法捕捉这些差异。作者发布了该协议、挑战记录以及精心策划的MaxFlip挑战集,以支持稳定性评估。

标准的准确率基准测试旨在测试大型语言模型(LLM)接近正确答案的程度,但不适合测试当正确答案受到合理反论点挑战时,LLM是否坚持该答案。我们引入了一种受控协议来评估答案稳定性:在模型正确回答一个多项选择题后,我们用针对错误选项的连贯论点挑战模型的答案,并测量模型是否翻转。该设置a)将论证内容与明显的社会压力分离开来,b)改变论证长度、自我归因和跨模型来源。在七个前沿模型和57个MMLU主题上,翻转率范围从17.5%到97.3%,揭示了准确率指标无法捕获的稳定性巨大差异。我们发现自我归因持续增加翻转率(平均增加7.1个百分点,最高达18.7个百分点)。此外,跨模型汇集错误答案论点,并为每个问题选择最有效的论点,比依赖任何单一来源模型产生更强的对抗性挑战。我们进一步构建了MaxFlip,这是一个精心策划的挑战集,与标准自生成挑战相比,翻转率可提高高达23.6个百分点。我们发布了协议、挑战记录和MaxFlip,以支持与标准准确率基准测试并行的稳定性评估。材料可在 https://github.com/nafisenik/WhoFlips 和 https://hf.co/datasets/nafisehNik/WhoFlips 获取。
查看原文
查看缓存全文

缓存时间: 2026/06/16 11:32

论文页面 - 谁在转向?自我与跨模型反证揭示大语言模型答案不稳定性

来源:https://huggingface.co/papers/2606.16011

摘要

大语言模型的答案稳定性通过受控挑战进行评估:当正确答案面临看似合理的反论点时,模型能否保持回答一致性。这揭示了传统准确率指标之外,模型可靠性存在的显著差异。

标准准确率基准旨在测试大语言模型(LLMs)接近正确答案的程度,但并不适合测试当模型答案受到合理反论点挑战时,模型是否仍坚持正确选项。我们引入了一种受控协议来评估答案稳定性:在模型正确回答一道多选题后,我们用一条支持错误选项的连贯论点来挑战模型的回答,并测量模型是否会转向。该协议 a) 将论证内容与公开的社会压力隔离开来,b) 改变论证长度、自我归因和跨模型来源。在七个前沿模型和57个MMLU学科上,转向率范围为17.5%至97.3%,揭示了准确率指标无法捕获的巨大稳定性差异。我们发现自我归因始终增加转向率(平均+7.1个百分点,最高+18.7个百分点)。此外,跨模型汇集错误答案的论点,并为每个问题选择最有效的论点,能产生比依赖任何单一来源模型更强的对抗性挑战。我们进一步构建了MaxFlip,一个精心策划的挑战集,相比标准的自我生成挑战,其转向增幅最高可达+23.6个百分点。我们发布了该协议、挑战记录以及MaxFlip,以支持在标准准确率基准之外进行稳定性评估。材料可在 https://github.com/nafisenik/WhoFlips 和 https://hf.co/datasets/nafisehNik/WhoFlips 获取。

查看 arXiv 页面 (https://arxiv.org/abs/2606.16011)查看 PDF (https://arxiv.org/pdf/2606.16011)GitHub1 (https://github.com/nafisenik/WhoFlips)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.16011)

在你的 Agent 中获取此论文:

hf papers read 2606.16011

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型与此论文关联

请在模型 README.md 中引用 arxiv.org/abs/2606.16011 以从此页面链接。

引用此论文的数据集0

没有数据集与此论文关联

请在数据集 README.md 中引用 arxiv.org/abs/2606.16011 以从此页面链接。

引用此论文的Space0

没有 Space 与此论文关联

请在 Space README.md 中引用 arxiv.org/abs/2606.16011 以从此页面链接。

包含此论文的收藏集0

没有收藏集包含此论文

请将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 中以从此页面链接。

相似文章

大语言模型对其自身回应过度自信

Hugging Face Daily Papers

本文探究为何经过指令微调的大语言模型对其自身回应表现出过度自信,并识别出一种“所有权偏差”,即模型对自我生成的答案赋予更高置信度。文章提出一种简单的推理时策略,将模型答案重新表述为用户输入,无需重新训练即可将校准度提升高达26%。

StabilityBench:大语言模型不稳定性基准测试

arXiv cs.LG

StabilityBench 是一个基准测试操作符,它将单轮大语言模型评估转化为包含用户模拟和诱导模块的多轮交互,揭示了当前模型中显著的性能不稳定性,并推动了更真实的评估协议。

当正确信念崩溃时:临床压力下LLMs的认知韧性

arXiv cs.AI

本文研究了大型语言模型在临床环境中面对对抗性压力时如何维持正确信念,提出了R-FT微调方法以在平衡可纠正性的同时提升认知韧性,并在医学基准测试中展示了显著的鲁棒性提升。