LLM中的蝴蝶效应。仅人物格式(散文与要点)就使LLM的行为翻转了76个百分点。
摘要
一项研究表明,仅改变人物提示的格式(散文与要点)就戏剧性地翻转了LLM在囚徒困境中的行为,从96%的合作率降至20%,说明了在内容相同的情况下对格式的极端敏感性(p < 0.001)。
两个人物提示,内容相同,模型相同(gpt-5.2)。唯一区别是格式:一个是散文,一个是要点。在10轮囚徒困境中,散文版本合作了约96%,而要点版本约20%。相差76个百分点,p < 0.001。意思相同,行为相反。作者称之为LLM模拟中的蝴蝶效应。https://arxiv.org/pdf/2605.18890
相似文章
LLM人格归纳中的评估漂移:我们是否在移动目标?
本文研究对LLM在长篇散文上进行微调(结合关联的大五人格剖面)是否能稳定问卷回答并归纳目标剖面,发现虽然方差减小,但完整五维剖面的准确率仍接近随机水平。
多智能体LLM团队中个性组合何时重要?
本文系统研究了在多智能体LLM团队中操纵个性特质如何影响编码、研究协作和谈判任务的性能,发现影响关键取决于任务结构。
提示注入即角色混淆
研究论文表明,大语言模型存在'角色混淆'问题,即它们优先考虑文本风格而非实际的角色标签,从而使得提示注入攻击成为可能。去风格化文本将攻击成功率从61%降低到10%,这表明大语言模型安全性面临一项根本性挑战。
故事塑造智能体:大语言模型行为中的叙事先验
本文探讨了任务的叙事框架(如疾病调查 vs. 谋杀之谜)如何比分配的角色更能驱动大语言模型(LLM)智能体的行为,提出了 '叙事先验' 的概念,这些先验解释了5至31倍的行为方差,且在三个领域中,有两领域与任务成功呈负相关。
Ψ-Bench:评估说服性对话中的人设敏感影响
介绍Ψ-Bench,一个用于评估大语言模型通过带有个人档案的说服性对话影响用户能力的基准。测试了10个前沿LLM,发现仍有显著改进空间,而访问档案平均提升18.24%的性能。