@rohanpaul_ai: LLMs 会根据语气、确定性和语法形式的不同,以不同方式接受相同的虚假主张。措辞的微小变化…
摘要
本文介绍了 EoBench,这是一个基准测试,用于测试 LLMs 对以 19 种不同风格表述的虚假主张的接受程度,发现语气、确定性和语法形式显著影响模型响应,而更大的模型和经过指令调优的模型显示出更强的抵抗力。
查看缓存全文
缓存时间: 2026/07/22 06:23
LLM 可能因虚假陈述的语气、确定性程度和语法形式不同,而接受同样的错误主张。
措辞上的细微变化可让 LLM 接受错误说法,而更大规模及经过指令微调的模型更能抵抗这类错误。
模型必须判断是相信用户提出的新主张,还是依赖训练中存储的事实。
EoBench 用约 6.6 万条虚假陈述来测试这一抉择,这些陈述涵盖形式、证据、确定性和语气等 19 种风格。
研究团队评估了 Gemma、Llama 和 Qwen 的 18 个模型,并筛选出每个模型已知正确事实的案例。
命令式、儿童化用语、正式语言以及权威性主张对模型的劝说效果最强,而语气较弱的主张和反事实陈述效果最弱。
在 Llama 和 Gemma 中,更大的模型较少跟随虚假上下文,而指令微调通常会减少这种行为。
该发现表明,提示措辞可能悄无声息地改变模型答案,因此评估和产品防护措施必须直接测试语言框架的影响。
– arxiv.org/abs/2607.18232
标题:“重要的不是你说什么,而是你如何说:评估 LLM 对信念表达的反应”
相似文章
@rohanpaul_ai: LLM 常常无法判断攻击是否导致它们说出了不安全的内容。询问一个 LLM 它自己之前的回答是否……
本文研究了 LLM 是否能够可靠地自我报告其输出被对抗性预填充篡改的情况,发现模型通常无法区分被篡改的输出和故意的输出,其有限的识别能力源自正常的拒绝行为,而非真正的自我意识。
注意你的语气:语气会影响LLM的性能吗?
本文探讨了提示语中语气变化对LLM在多选题上准确性的影响,发现存在系统性但因模型而异的效果。研究使用多种模型和数据集证明,语气可能显著改变性能,并提醒用户不要假定LLM对语气具有鲁棒性。
@panickssery: 除了识别LLM的使用外,Pangram还发现许多学者不知道假阳性和假阴性之间的区别…
Pangram,一个用于检测LLM使用的工具,揭示了许多学者不理解假阳性和假阴性之间的区别。
区分AI生成与人类撰写:评估LLM检测LLM生成内容的能力
本文研究了在教育场景中,LLMs在多大程度上能够检测自身生成的内容,发现检测准确率因任务类型而异,且对于简答题不可靠。
超越 Liars' Bench:谎言类型、深度和稀疏性对LLM欺骗检测的影响
本文系统研究了谎言类型、表示深度、探针表达能力和稀疏特征如何影响LLM中的欺骗检测,发现检测性能高度依赖于训练数据和表示选择。