mcqa

标签

Cards List
#mcqa

Persona Non Grata: LLM角色驱动生成在MCQA中在不同维度上不稳定

arXiv cs.CL · 2026-07-02 缓存

本文研究了大型语言模型在多选题问答(MCQA)任务中角色驱动生成的不稳定性,提出了三个衡量指标来评估模型族、模型规模和问题域的性能、结果和正确性稳定性。研究发现,不稳定性的变化具有一致性,数学和常识问题表现出更大的不稳定性,并且任务提示格式比其他超参数(如温度)引入了更多的不稳定性。

0 人收藏 0 人点赞
#mcqa

小型语言模型的代码引导推理:可执行MCQA脚手架评估

Hugging Face Daily Papers · 2026-05-12 缓存

本文介绍了代码引导推理(CGR),一种评估协议,用于衡量可执行推理脚手架如何提升小型语言模型在多项选择问答任务上的表现,结果显示其准确率相较于直接回答有显著提升。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈