@rohanpaul_ai: LLMs 会根据语气、确定性和语法形式的不同,以不同方式接受相同的虚假主张。措辞的微小变化…

X AI KOLs Timeline 论文

摘要

本文介绍了 EoBench,这是一个基准测试,用于测试 LLMs 对以 19 种不同风格表述的虚假主张的接受程度,发现语气、确定性和语法形式显著影响模型响应,而更大的模型和经过指令调优的模型显示出更强的抵抗力。

LLMs 会根据语气、确定性和语法形式的不同,以不同方式接受相同的虚假主张。 措辞的微小变化可能使 LLMs 接受虚假主张,而更大的模型和经过指令调优的模型则更能抵抗它们。 模型必须决定是相信用户的新主张,还是依赖训练中存储的事实。 EoBench 通过约 66,000 条以 19 种风格(涵盖形式、证据、确定性和语气)编写的虚假主张来测试这一选择。 研究团队评估了 18 个 Gemma、Llama 和 Qwen 模型,然后保留了每个模型已知正确事实的案例。 命令、针对儿童的语言、正式语言和权威主张最能说服模型,而较弱的主张和反事实主张说服力最弱。 在 Llama 和 Gemma 中,更大的模型较少遵循虚假上下文,而指令调优通常减少了这种行为。 该发现表明,提示措辞可以悄无声息地改变模型答案,因此评估和产品安全措施必须直接测试语言框架。 --- – arxiv. org/abs/2607.18232 Title: "It's Not What You Say, It's How You Say It: Evaluating LLM Responses to Expressions of Belief"
查看原文
查看缓存全文

缓存时间: 2026/07/22 06:23

LLM 可能因虚假陈述的语气、确定性程度和语法形式不同,而接受同样的错误主张。

措辞上的细微变化可让 LLM 接受错误说法,而更大规模及经过指令微调的模型更能抵抗这类错误。

模型必须判断是相信用户提出的新主张,还是依赖训练中存储的事实。

EoBench 用约 6.6 万条虚假陈述来测试这一抉择,这些陈述涵盖形式、证据、确定性和语气等 19 种风格。

研究团队评估了 Gemma、Llama 和 Qwen 的 18 个模型,并筛选出每个模型已知正确事实的案例。

命令式、儿童化用语、正式语言以及权威性主张对模型的劝说效果最强,而语气较弱的主张和反事实陈述效果最弱。

在 Llama 和 Gemma 中,更大的模型较少跟随虚假上下文,而指令微调通常会减少这种行为。

该发现表明,提示措辞可能悄无声息地改变模型答案,因此评估和产品防护措施必须直接测试语言框架的影响。


– arxiv.org/abs/2607.18232

标题:“重要的不是你说什么,而是你如何说:评估 LLM 对信念表达的反应”

相似文章

注意你的语气:语气会影响LLM的性能吗?

arXiv cs.AI

本文探讨了提示语中语气变化对LLM在多选题上准确性的影响,发现存在系统性但因模型而异的效果。研究使用多种模型和数据集证明,语气可能显著改变性能,并提醒用户不要假定LLM对语气具有鲁棒性。