multiple-choice

标签

Cards List
#multiple-choice

无标签策略下准确性与顺序敏感性出现分化

arXiv cs.CL · 2026-08-13 缓存

本文研究了多项选择基准上的无标签策略能否消除大型语言模型对选项顺序的敏感性,发现两阶段提示和独立假设评分均无法可靠地提高准确性。

0 人收藏 0 人点赞
#multiple-choice

无标签策略下准确率与顺序敏感性的分歧

Hugging Face Daily Papers · 2026-08-12 缓存

本文测试了无标签策略以减少多项选择基准中的位置偏差,但发现它们不能可靠地提高准确率或减少偏差。只有显示所有选项并使用LLM匹配器才能保持基线性能,而循环排列有时有帮助。

0 人收藏 0 人点赞
#multiple-choice

每个错误答案都算数:LLM 多选题基准的选项级心理测量学

arXiv cs.CL · 2026-08-05 缓存

本文介绍了 LLM-NRM,一种用于多选题基准的选项级心理测量框架,它对答案选择的完整分布进行建模,而不是二元正确性,表明错误回答携带了有用的测量信息,并提高了能力估计和基准测试的效率。

0 人收藏 0 人点赞
#multiple-choice

长度偏差下的准确率与归一化准确率:分析、指导原则与贝叶斯替代方法

arXiv cs.AI · 2026-07-15 缓存

该论文分析了基于似然度的多项选择评估中的长度偏差,显示标准准确率与长度归一化准确率分别引入了偏向较短答案和较长答案的偏差。它提出了贝叶斯准确率,这是一种使用显式的答案长度先验来消除线性长度效应的评分规则,并在多个基准测试中始终表现出更低的经验偏差。

0 人收藏 0 人点赞
#multiple-choice

基准幻觉:经过剪枝的大语言模型可以通过多项选择题但无法回答问题

arXiv cs.CL · 2026-06-17 缓存

本文揭示了“基准幻觉”现象:经过剪枝的大语言模型在多项选择基准测试中表现良好,但在开放生成中却无法回答相同的问题,这表明压缩模型应针对生成任务进行测试,而不仅仅是识别任务。

0 人收藏 0 人点赞
#multiple-choice

当没有正确答案时:诊断视频理解中多模态大语言模型的缺失答案检测

arXiv cs.AI · 2026-06-09 缓存

本文研究了多模态大语言模型(MLLMs)在视频理解任务中检测正确答案缺失的能力,发现模型系统性地失败,倾向于选择合理的干扰项而非识别出没有有效选项。该失败在时序推理和密集帧采样中更为严重,而思维链提示仅能部分缓解问题。

0 人收藏 0 人点赞
#multiple-choice

基于微调Transformer的无响应项目难度建模用于多项选择题:组件表示与多任务学习

arXiv cs.CL · 2026-05-19 缓存

本文提出对Transformer编码器进行端到端微调,用于多项选择阅读理解项目的无响应项目难度建模,包括组件变体和多任务变体,表明多任务学习在小样本情况下有所改进。

0 人收藏 0 人点赞
#multiple-choice

当选择成为风险:多选题约束下大语言模型的安全失效

arXiv cs.CL · 2026-04-21 缓存

# 当选择成为风险:多选题约束下大语言模型的安全失效 来源:[https://arxiv.org/html/2604.16916](https://arxiv.org/html/2604.16916) Yuheng Chen1 Zhiyu Wu2 Bowen Cheng3 Tetsuro Takahashi1 1鹿儿岛大学 2复旦大学 3中国石油大学(北京) [email protected] ###### 摘要 大语言模型(LLMs)的安全性对齐主要在开放式生成环境进行评估,模型可通过拒绝回应来规避风险……

0 人收藏 0 人点赞
← 返回首页

提交意见反馈