无标签策略下准确率与顺序敏感性的分歧

Hugging Face Daily Papers 论文

摘要

本文测试了无标签策略以减少多项选择基准中的位置偏差,但发现它们不能可靠地提高准确率或减少偏差。只有显示所有选项并使用LLM匹配器才能保持基线性能,而循环排列有时有帮助。

多项选择基准广泛用于评估大型语言模型,但MCQ分数将知识与选项顺序的敏感性混为一谈,这使得它们成为不可靠的模型知识衡量标准。在本文中,我们测试了在承诺回答时防止模型看到选项标签是否能消除位置影响,从而提高性能。我们评估了两种不同的减轻偏差的策略。第一种使用生成后匹配的方法,第二种独立评分选项,这在设计上是位置无偏的。两者都不能可靠地提高准确率。完全分解显示瓶颈在于隐藏选项,而不是匹配步骤。唯一一致匹配基线的配置是显示模型所有选项并配对LLM匹配器。然而,完全消除位置影响仍然不能可靠地带来准确率提升,而循环排列通常能改善它们。对于两阶段提示,回忆不平衡的综合衡量和每个问题的顺序敏感性直接衡量都未能显示出可靠的去偏差效果。
查看原文
查看缓存全文

缓存时间: 2026/08/18 23:54

论文页面 - 无标签策略下准确率与选项顺序敏感性的差异

来源:https://huggingface.co/papers/2608.11947

摘要

在回答过程中阻止模型查看选项标签并不能可靠地减少位置偏差或提高多选题准确率,而仅向LLM匹配器展示所有选项才能保持基线性能。

多选题基准测试(https://huggingface.co/papers?q=Multiple-choice%20benchmarks)被广泛用于评估大语言模型,但其评分结果混淆了模型的知识掌握程度与对选项顺序(https://huggingface.co/papers?q=option%20order)的敏感性,这使得它们难以成为衡量模型知识的可靠指标。本文测试了在决定答案时阻止模型查看选项标签是否能消除位置影响(https://huggingface.co/papers?q=positional%20influence),进而提升模型表现。我们评估了两种不同的偏差缓解策略:第一种采用生成后匹配(https://huggingface.co/papers?q=generation-then-matching)的方法,第二种则独立评估各选项(该方法在设计上具备位置无偏性)。这两种策略均未能可靠地提高准确率。全面分解分析显示,瓶颈在于隐藏选项本身,而非匹配步骤。唯一能够稳定保持基线性能的配置是:向模型展示所有选项并配合LLM匹配器(https://huggingface.co/papers?q=LLM%20matcher)。然而,即使完全消除位置影响(https://huggingface.co/papers?q=positional%20influence)也仍无法可靠地带来准确率提升,而循环置换(https://huggingface.co/papers?q=cyclic%20permutation)策略则常能改进表现。对于两阶段提示方法,无论是召回率不平衡(https://huggingface.co/papers?q=recall%20imbalance)的聚合指标还是针对单题的顺序敏感性(https://huggingface.co/papers?q=order%20sensitivity)直接度量,均未能展现出可靠的去偏效果。

查看arXiv页面 (https://arxiv.org/abs/2608.11947) 查看PDF (https://arxiv.org/pdf/2608.11947) 项目页面 (https://arxiv.org/abs/2608.11947) GitHub仓库 (https://github.com/cotenthusiast/choicebench) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.11947)

通过代理获取本文:

hf papers read 2608\.11947

尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

无模型链接本文

在模型的README.md中引用 arxiv.org/abs/2608.11947 即可从本页面建立链接。

引用本文的数据集0

无数据集链接本文

在数据集的README.md中引用 arxiv.org/abs/2608.11947 即可从本页面建立链接。

引用本文的Space0

无Space链接本文

在Space的README.md中引用 arxiv.org/abs/2608.11947 即可从本页面建立链接。

包含本文的收藏0

无收藏包含本文

将本文添加到收藏夹 (https://huggingface.co/new-collection) 即可从本页面建立链接。

相似文章

长度偏差下的准确率与归一化准确率:分析、指导原则与贝叶斯替代方法

arXiv cs.AI

该论文分析了基于似然度的多项选择评估中的长度偏差,显示标准准确率与长度归一化准确率分别引入了偏向较短答案和较长答案的偏差。它提出了贝叶斯准确率,这是一种使用显式的答案长度先验来消除线性长度效应的评分规则,并在多个基准测试中始终表现出更低的经验偏差。