@rohanpaul_ai: 即使模型知道答案,但因提问方式不同仍可能失败。新IBM论文介绍了BenchDrift……
摘要
一篇新的IBM论文介绍了BenchDrift,这是一个审计框架,测量LLM性能随问题重新表述的变化,揭示了显著的准确率差距,并突出了基准可靠性问题。
查看缓存全文
缓存时间: 2026/08/20 08:52
措辞效应:量化大语言模型基准性能的双向偏移
模型可能知道答案却仍然答错,仅仅是因为你换了一种方式提问。
IBM 的一篇新论文提出了 BenchDrift——一个针对现有基准测试的审计框架。它系统性地对相同问题进行改写而不改变答案,然后衡量模型得分纯粹因措辞变化而产生的偏移程度。
在 8 个模型和 3 个基准测试中,最佳情况与最差情况下的准确率差距平均达到 74.7 个百分点。
更强的模型实际上更容易受到影响。
对于基线准确率超过 60% 的所有模型-基准测试组合而言,改写导致正确答案丢失的数量超过了其恢复的数量。
置信度也未能解决这一问题。
即使在置信度最高的组别中,仍有 18.5% 的正确答案在保持语义的措辞变换后丢失。
因此,如果你的模型选择依赖微小的分数差异,建议测试多种等价表达方式,或报告分数的波动范围。
– arxiv.org/abs/2608.11694
相似文章
The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance
This paper introduces BenchDrift, a method for quantifying how LLM benchmark performance changes when problems are rephrased without changing meaning or answer. It shows that rephrasing causes bidirectional correctness flips across models and benchmarks, with stronger models becoming more sensitive to phrasing.
@rohanpaul_ai:Meta的论文显示,量化推理模型常常因为反复怀疑正确答案而非完成推理而失败…
Meta的论文表明,量化推理模型常常失败,因为压缩使它们对正确答案产生怀疑,但通过对“wait”或“but”等犹豫词施加轻微惩罚,可以将推理长度缩短12-23%,同时保持或提高准确性。
@rohanpaul_ai: 这篇论文揭示了AI推理中的一个奇怪弱点:模型可以解决数学问题,却无法判断推理过程。令人不安的是…
这篇论文提出了Valid-Answer-Invalid-Reasoning (VAIR)基准测试,旨在揭示AI推理模型中的生成-评估差距,即模型可以生成正确答案,但无法检测出有缺陷的推理过程,暴露了答案确认偏差。
@rohanpaul_ai: 德克萨斯大学论文显示AI智能体在部署后可能逐渐变得不那么可靠,即使模型本身并未变…
德克萨斯大学的一篇论文介绍了AgingBench,这是一个基准测试,揭示了AI智能体在部署后可能因记忆和维护衰减而变得不那么可靠,即使底层模型保持不变。
前沿大型语言模型的响应漂移
一项针对10个前沿大语言模型、涵盖62个问题的大规模人类评估发现,所有模型都表现出响应漂移,其中大多数模型收敛到78-81%的偏差上限,而两个模型实现了较低的偏差。漂移程度因领域和问题而异,自动指标几乎无法解释人类判断,这凸显了人类评估的必要性。