无标签策略下准确率与顺序敏感性的分歧
摘要
本文测试了无标签策略以减少多项选择基准中的位置偏差,但发现它们不能可靠地提高准确率或减少偏差。只有显示所有选项并使用LLM匹配器才能保持基线性能,而循环排列有时有帮助。
查看缓存全文
缓存时间: 2026/08/18 23:54
论文页面 - 无标签策略下准确率与选项顺序敏感性的差异
来源:https://huggingface.co/papers/2608.11947
摘要
在回答过程中阻止模型查看选项标签并不能可靠地减少位置偏差或提高多选题准确率,而仅向LLM匹配器展示所有选项才能保持基线性能。
多选题基准测试(https://huggingface.co/papers?q=Multiple-choice%20benchmarks)被广泛用于评估大语言模型,但其评分结果混淆了模型的知识掌握程度与对选项顺序(https://huggingface.co/papers?q=option%20order)的敏感性,这使得它们难以成为衡量模型知识的可靠指标。本文测试了在决定答案时阻止模型查看选项标签是否能消除位置影响(https://huggingface.co/papers?q=positional%20influence),进而提升模型表现。我们评估了两种不同的偏差缓解策略:第一种采用生成后匹配(https://huggingface.co/papers?q=generation-then-matching)的方法,第二种则独立评估各选项(该方法在设计上具备位置无偏性)。这两种策略均未能可靠地提高准确率。全面分解分析显示,瓶颈在于隐藏选项本身,而非匹配步骤。唯一能够稳定保持基线性能的配置是:向模型展示所有选项并配合LLM匹配器(https://huggingface.co/papers?q=LLM%20matcher)。然而,即使完全消除位置影响(https://huggingface.co/papers?q=positional%20influence)也仍无法可靠地带来准确率提升,而循环置换(https://huggingface.co/papers?q=cyclic%20permutation)策略则常能改进表现。对于两阶段提示方法,无论是召回率不平衡(https://huggingface.co/papers?q=recall%20imbalance)的聚合指标还是针对单题的顺序敏感性(https://huggingface.co/papers?q=order%20sensitivity)直接度量,均未能展现出可靠的去偏效果。
查看arXiv页面 (https://arxiv.org/abs/2608.11947) 查看PDF (https://arxiv.org/pdf/2608.11947) 项目页面 (https://arxiv.org/abs/2608.11947) GitHub仓库 (https://github.com/cotenthusiast/choicebench) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.11947)
通过代理获取本文:
hf papers read 2608\.11947
尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
无模型链接本文
在模型的README.md中引用 arxiv.org/abs/2608.11947 即可从本页面建立链接。
引用本文的数据集0
无数据集链接本文
在数据集的README.md中引用 arxiv.org/abs/2608.11947 即可从本页面建立链接。
引用本文的Space0
无Space链接本文
在Space的README.md中引用 arxiv.org/abs/2608.11947 即可从本页面建立链接。
包含本文的收藏0
无收藏包含本文
将本文添加到收藏夹 (https://huggingface.co/new-collection) 即可从本页面建立链接。
相似文章
无标签策略下准确性与顺序敏感性出现分化
本文研究了多项选择基准上的无标签策略能否消除大型语言模型对选项顺序的敏感性,发现两阶段提示和独立假设评分均无法可靠地提高准确性。
隔离LLM词汇偏见:一种无需人工筛选的三角测量偏好阶段学习指标
介绍了一种无需人工筛选的指标(Triangulated Preference Shift),用于隔离和量化LLM在偏好学习过程中诱导的词汇偏见,无需手动筛选,覆盖六个模型家族。
量化破坏对齐:压缩大语言模型中偏见在不同模型与精度下的涌现
本文研究了训练后量化如何在指令调优的大语言模型中引入新偏见,发现3位精度导致6-21%之前无偏见的项目发展出刻板印象,而像困惑度这样的标准指标未能检测到这种退化。
长度偏差下的准确率与归一化准确率:分析、指导原则与贝叶斯替代方法
该论文分析了基于似然度的多项选择评估中的长度偏差,显示标准准确率与长度归一化准确率分别引入了偏向较短答案和较长答案的偏差。它提出了贝叶斯准确率,这是一种使用显式的答案长度先验来消除线性长度效应的评分规则,并在多个基准测试中始终表现出更低的经验偏差。
相同问题,不同答案:超越准确性评估LLM的可靠性
本文研究了LLM在保持意义不变的改写下答案的变化,发现实例级行为不稳定(翻转率>23%),单提示准确性掩盖了显著的不一致性,而自我改写策略可以部分恢复潜在知识。