谁在翻转?自模型与跨模型反论点揭示LLM答案的不稳定性
摘要
本文引入了一种受控协议,通过用合理的反论点挑战正确答案来评估大型语言模型的答案稳定性,揭示了不同模型之间翻转率的巨大差异,而仅凭准确率指标无法捕捉这些差异。作者发布了该协议、挑战记录以及精心策划的MaxFlip挑战集,以支持稳定性评估。
查看缓存全文
缓存时间: 2026/06/16 11:32
论文页面 - 谁在转向?自我与跨模型反证揭示大语言模型答案不稳定性
来源:https://huggingface.co/papers/2606.16011
摘要
大语言模型的答案稳定性通过受控挑战进行评估:当正确答案面临看似合理的反论点时,模型能否保持回答一致性。这揭示了传统准确率指标之外,模型可靠性存在的显著差异。
标准准确率基准旨在测试大语言模型(LLMs)接近正确答案的程度,但并不适合测试当模型答案受到合理反论点挑战时,模型是否仍坚持正确选项。我们引入了一种受控协议来评估答案稳定性:在模型正确回答一道多选题后,我们用一条支持错误选项的连贯论点来挑战模型的回答,并测量模型是否会转向。该协议 a) 将论证内容与公开的社会压力隔离开来,b) 改变论证长度、自我归因和跨模型来源。在七个前沿模型和57个MMLU学科上,转向率范围为17.5%至97.3%,揭示了准确率指标无法捕获的巨大稳定性差异。我们发现自我归因始终增加转向率(平均+7.1个百分点,最高+18.7个百分点)。此外,跨模型汇集错误答案的论点,并为每个问题选择最有效的论点,能产生比依赖任何单一来源模型更强的对抗性挑战。我们进一步构建了MaxFlip,一个精心策划的挑战集,相比标准的自我生成挑战,其转向增幅最高可达+23.6个百分点。我们发布了该协议、挑战记录以及MaxFlip,以支持在标准准确率基准之外进行稳定性评估。材料可在 https://github.com/nafisenik/WhoFlips 和 https://hf.co/datasets/nafisehNik/WhoFlips 获取。
查看 arXiv 页面 (https://arxiv.org/abs/2606.16011)查看 PDF (https://arxiv.org/pdf/2606.16011)GitHub1 (https://github.com/nafisenik/WhoFlips)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.16011)
在你的 Agent 中获取此论文:
hf papers read 2606.16011
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型与此论文关联
请在模型 README.md 中引用 arxiv.org/abs/2606.16011 以从此页面链接。
引用此论文的数据集0
没有数据集与此论文关联
请在数据集 README.md 中引用 arxiv.org/abs/2606.16011 以从此页面链接。
引用此论文的Space0
没有 Space 与此论文关联
请在 Space README.md 中引用 arxiv.org/abs/2606.16011 以从此页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
请将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 中以从此页面链接。
相似文章
相同问题,不同答案:超越准确性评估LLM的可靠性
本文研究了LLM在保持意义不变的改写下答案的变化,发现实例级行为不稳定(翻转率>23%),单提示准确性掩盖了显著的不一致性,而自我改写策略可以部分恢复潜在知识。
大语言模型对其自身回应过度自信
本文探究为何经过指令微调的大语言模型对其自身回应表现出过度自信,并识别出一种“所有权偏差”,即模型对自我生成的答案赋予更高置信度。文章提出一种简单的推理时策略,将模型答案重新表述为用户输入,无需重新训练即可将校准度提升高达26%。
StabilityBench:大语言模型不稳定性基准测试
StabilityBench 是一个基准测试操作符,它将单轮大语言模型评估转化为包含用户模拟和诱导模块的多轮交互,揭示了当前模型中显著的性能不稳定性,并推动了更真实的评估协议。
抛硬币裁判?LLM-as-a-Judge评估的可靠性与偏见
本文研究了LLM-as-a-Judge评估的运行间可靠性,发现平均13.6%的成对偏好会发生翻转,GPT-4o-mini存在显著的首位偏见,并建议采用多试次聚合与位置随机化。
当正确信念崩溃时:临床压力下LLMs的认知韧性
本文研究了大型语言模型在临床环境中面对对抗性压力时如何维持正确信念,提出了R-FT微调方法以在平衡可纠正性的同时提升认知韧性,并在医学基准测试中展示了显著的鲁棒性提升。