标签
本文研究了多项选择基准上的无标签策略能否消除大型语言模型对选项顺序的敏感性,发现两阶段提示和独立假设评分均无法可靠地提高准确性。
本文测试了无标签策略以减少多项选择基准中的位置偏差,但发现它们不能可靠地提高准确率或减少偏差。只有显示所有选项并使用LLM匹配器才能保持基线性能,而循环排列有时有帮助。
本文介绍了 LLM-NRM,一种用于多选题基准的选项级心理测量框架,它对答案选择的完整分布进行建模,而不是二元正确性,表明错误回答携带了有用的测量信息,并提高了能力估计和基准测试的效率。
该论文分析了基于似然度的多项选择评估中的长度偏差,显示标准准确率与长度归一化准确率分别引入了偏向较短答案和较长答案的偏差。它提出了贝叶斯准确率,这是一种使用显式的答案长度先验来消除线性长度效应的评分规则,并在多个基准测试中始终表现出更低的经验偏差。
本文揭示了“基准幻觉”现象:经过剪枝的大语言模型在多项选择基准测试中表现良好,但在开放生成中却无法回答相同的问题,这表明压缩模型应针对生成任务进行测试,而不仅仅是识别任务。
本文研究了多模态大语言模型(MLLMs)在视频理解任务中检测正确答案缺失的能力,发现模型系统性地失败,倾向于选择合理的干扰项而非识别出没有有效选项。该失败在时序推理和密集帧采样中更为严重,而思维链提示仅能部分缓解问题。
本文提出对Transformer编码器进行端到端微调,用于多项选择阅读理解项目的无响应项目难度建模,包括组件变体和多任务变体,表明多任务学习在小样本情况下有所改进。
# 当选择成为风险:多选题约束下大语言模型的安全失效 来源:[https://arxiv.org/html/2604.16916](https://arxiv.org/html/2604.16916) Yuheng Chen1 Zhiyu Wu2 Bowen Cheng3 Tetsuro Takahashi1 1鹿儿岛大学 2复旦大学 3中国石油大学(北京) [email protected] ###### 摘要 大语言模型(LLMs)的安全性对齐主要在开放式生成环境进行评估,模型可通过拒绝回应来规避风险……