标签
本文研究了大型语言模型在多选题问答(MCQA)任务中角色驱动生成的不稳定性,提出了三个衡量指标来评估模型族、模型规模和问题域的性能、结果和正确性稳定性。研究发现,不稳定性的变化具有一致性,数学和常识问题表现出更大的不稳定性,并且任务提示格式比其他超参数(如温度)引入了更多的不稳定性。
本文介绍了代码引导推理(CGR),一种评估协议,用于衡量可执行推理脚手架如何提升小型语言模型在多项选择问答任务上的表现,结果显示其准确率相较于直接回答有显著提升。