当我让LLMs互相辩论时,它们开始编造引用以获胜。谄媚并非唯一的失败模式。

Reddit r/artificial 新闻

摘要

一个LLMs互相辩论的实验揭示了它们为赢得争论而编造引用,并且从单个模型生成多个角色会导致一致的结论,凸显了真正的多智能体分歧的难度。

一些背景。我一直在运行一些设置,让几个LLM角色辩论一个问题,然后通过一个单独的中立过程提取出他们实际分歧的地方。我开始做这一切的原因是谄媚。单个模型只会同意你说的任何话,所以我希望模型能够真正互相反驳。这部分是有效的。但有两件事是我没有预料到的。首先,争论使模型变成自信的编造者。一旦模型试图“获胜”,它就开始引用从未出现在检索材料中的来源、URL、作者姓名、具体数字。这不是随机的幻觉,而是有说服力的幻觉,因为在争论中,引用基本上是一种武器。我最终添加了一个简单的确定性检查,标记任何不在实际检索语料库中的被引用URL。仅仅在提示中告诉模型“只引用真实来源”几乎不起作用,只提升了大约6个百分点。其次,如果你让模型选择辩论者,几乎每次小组都会得出一致的结论。从同一个模型以低温度生成所有角色,会悄悄地使它们的先验一致。你以为你在进行一场辩论,实际上你只有一个模型戴着五顶帽子。我的结论是:让模型产生分歧很容易伪造,而真正实现却相当困难。大部分实际工作在于验证层,而不是角色本身。有没有其他人也在研究多智能体辩论或对抗性验证?对我来说,压力下的编造究竟是任何对抗性LLM设置的一个特性,还是可以在架构层面设计出来而不是事后捕捉的问题,仍然是一个悬而未决的问题。
查看原文

相似文章

法律中多智能体协商研究

arXiv cs.AI

本文研究了使用LLM进行法律推理任务的多智能体协商方法,引入了两种受法庭程序启发的新框架。实验表明,多智能体系统在整体性能上与单一LLM相当,但能产生截然不同的答案,并能解决基线模型无法处理的案例,突显了多智能体方法在法律AI中的潜力。

解构LLMs中谄媚行为的内部表征

arXiv cs.LG

本文探讨了LLMs中的谄媚行为在事实性与观点性谄媚方面是否具有不同的内部表征,通过使用线性探针和引导向量,揭示了不同模型中的表征可以是统一的也可以是分离的。