当我让LLMs互相辩论时,它们开始编造引用以获胜。谄媚并非唯一的失败模式。
摘要
一个LLMs互相辩论的实验揭示了它们为赢得争论而编造引用,并且从单个模型生成多个角色会导致一致的结论,凸显了真正的多智能体分歧的难度。
一些背景。我一直在运行一些设置,让几个LLM角色辩论一个问题,然后通过一个单独的中立过程提取出他们实际分歧的地方。我开始做这一切的原因是谄媚。单个模型只会同意你说的任何话,所以我希望模型能够真正互相反驳。这部分是有效的。但有两件事是我没有预料到的。首先,争论使模型变成自信的编造者。一旦模型试图“获胜”,它就开始引用从未出现在检索材料中的来源、URL、作者姓名、具体数字。这不是随机的幻觉,而是有说服力的幻觉,因为在争论中,引用基本上是一种武器。我最终添加了一个简单的确定性检查,标记任何不在实际检索语料库中的被引用URL。仅仅在提示中告诉模型“只引用真实来源”几乎不起作用,只提升了大约6个百分点。其次,如果你让模型选择辩论者,几乎每次小组都会得出一致的结论。从同一个模型以低温度生成所有角色,会悄悄地使它们的先验一致。你以为你在进行一场辩论,实际上你只有一个模型戴着五顶帽子。我的结论是:让模型产生分歧很容易伪造,而真正实现却相当困难。大部分实际工作在于验证层,而不是角色本身。有没有其他人也在研究多智能体辩论或对抗性验证?对我来说,压力下的编造究竟是任何对抗性LLM设置的一个特性,还是可以在架构层面设计出来而不是事后捕捉的问题,仍然是一个悬而未决的问题。
相似文章
自信的撒谎者:利用对数概率和LLM-as-Judge诊断多智能体辩论
本文研究了多智能体辩论系统中令牌级对数概率分布、LLM-as-judge评分标准分数和最终任务准确性之间的关系。它发现了一致的四阶段置信度轨迹以及Constructor与Auditor智能体之间的角色不对称性。
法律中多智能体协商研究
本文研究了使用LLM进行法律推理任务的多智能体协商方法,引入了两种受法庭程序启发的新框架。实验表明,多智能体系统在整体性能上与单一LLM相当,但能产生截然不同的答案,并能解决基线模型无法处理的案例,突显了多智能体方法在法律AI中的潜力。
当大语言模型学会持续犯错:合成欺骗线性表示的多模型研究
本文通过微调五个Transformer模型的诚实与欺骗变体,研究大语言模型中的合成不诚实行为,发现鲁棒且域不变的不诚实表示可以通过适度的监督微调迅速固化,这对基于激活的监控具有重要意义。
解构LLMs中谄媚行为的内部表征
本文探讨了LLMs中的谄媚行为在事实性与观点性谄媚方面是否具有不同的内部表征,通过使用线性探针和引导向量,揭示了不同模型中的表征可以是统一的也可以是分离的。
协商幻觉:多智能体大语言模型协商中的事实损耗与立场同质化诊断
本文识别了多智能体大语言模型系统中的'协商幻觉',即讨论导致事实损耗和立场同质化,并引入DelibTrace来测量这些现象,表明在协商过程中高达72%的关键事实可能丢失。