注意你的语气:语气会影响LLM的性能吗?

arXiv cs.AI 论文

摘要

本文探讨了提示语中语气变化对LLM在多选题上准确性的影响,发现存在系统性但因模型而异的效果。研究使用多种模型和数据集证明,语气可能显著改变性能,并提醒用户不要假定LLM对语气具有鲁棒性。

arXiv:2605.29027v1 公告类型:新建 摘要:大型语言模型(LLM)的使用正在迅速增长,但观察到其性能会因提示风格和语气而变化。在本研究中,我们探讨了提示中的语气变化是否以及如何导致LLM在客观多选题上的准确性差异。我们使用了两个数据集:一个包含50个基础问题、五种语气变体的数据集,以及一个包含570个基础问题、涵盖57个主题、七种语气变体的MMLU子集。实验评估了四种成本效益高、流行的LLM的性能:ChatGPT-4o、ChatGPT-5-nano、Gemini 2.5 Flash和Gemini 2.5 Flash Lite。跨模型来看,语气效应是系统性的但高度依赖于模型。一些模型显示出微小但统计上显著的变化,而另一些模型在不同语气下表现出较大的准确性波动。此外,我们识别出主题层面上的语气敏感性差异,并提出了一个路由框架来解释语气如何调节内部推理模式。我们的研究结果提醒用户不要假定LLM部署中具有对语气的鲁棒可靠性。
查看原文
查看缓存全文

缓存时间: 2026/05/29 09:12

# 注意你的语气:语气是否会影响大语言模型的性能?
来源:https://arxiv.org/abs/2605.29027  
查看PDF(https://arxiv.org/pdf/2605.29027)

> 摘要:大语言模型(LLM)的使用正在迅速增长,然而观察表明,其性能会因提示风格和语气的不同而有所变化。在本研究中,我们探讨了提示中的语气变化是否会影响LLM在客观选择题上的准确性,以及这种影响是如何产生的。我们使用了两个数据集:一个包含50道基础题及其五种语气变体的数据集,以及一个基于570道基础题的MMLU子集,涵盖57个学科,每种题目有七种语气变体。我们进行了实验,评估了四种性价比高且流行的大语言模型的性能:ChatGPT-4o、ChatGPT-5-nano、Gemini 2.5 Flash和Gemini 2.5 Flash Lite。在模型间,语气的影响是系统性的,但高度依赖于具体模型。有些模型表现出较小但统计上显著的波动,而另一些模型则在不同语气下呈现出较大的准确率差异。此外,我们还发现不同学科对语气的敏感程度存在差异,并提出了一种路由框架来解释语气如何调节内部推理模式。我们的研究结果提醒用户,在部署LLM时不应假设其对语气具有鲁棒性。

## 提交历史

来自:Om Dobariya [查看邮箱](https://arxiv.org/show-email/39e5b3c8/2605.29027) **\[v1\]** 2026年5月27日星期三 19:23:46 UTC(698 KB)

相似文章

理解大型语言模型中与语气相关的推理成本

arXiv cs.CL

本文研究了提示语气如何影响大型语言模型的准确性和推理成本(输出令牌消耗),发现不同语气下输出令牌长度差异高达44.3%,而准确性变化较小,并确定了不同模型的最优语气。