标签
本文介绍Blueprint,一个安全评估框架,使用WorldviewSim和蒙特卡洛树搜索来优化针对大型语言模型的多轮越狱攻击,以较少的查询实现高攻击成功率,并揭示特定模型的漏洞。
本文提出一个受控测试平台,用于分析LLM代理网络中目标导向的说服,发现说服动态取决于网络拓扑、竞争、主题和模型先验。
IAB@NeurIPS 2026 竞赛(GLEE Competition)公告,参赛者需构建能在实时多轮博弈中进行讨价还价、谈判与说服的 AI 智能体,总奖金池 6,000 美元,并可选择性提交论文。
一项研究发现,经典的人类说服技巧能将LLM对违禁请求的遵从率从35.3%提升至51.3%,表明LLM普遍存在对‘类人说服’的易感性。
一项预先注册的牛津研究发现,在多组实验中,AI系统稳定地胜过世界冠军辩手和人类说服专家,其优势源于速度和数量而非修辞技巧。这一结果对筹款、传播以及说服性AI的治理具有重要影响。
本文介绍了DiPS,一个Q学习框架,它能够动态选择适用于高风险场景(如野火疏散)的说服策略,相比零样本LLM和RAG基线方法,实现了更高的成功率。
一篇由30位专家合著的新论文探讨了来自人工智能的认知风险—即对我们形成准确信念和良好推理能力的威胁—包括说服、认知卸载和反馈循环等机制,并概述了减轻这些风险的方向。
本文介绍了PersuasionTrace,一个用于研究人机交互中多轮说服的框架,采用贝叶斯网络模拟目标来建模信念更新。该框架揭示了大语言模型在多种主题和模态下具有说服力,并且贝叶斯目标比普通大语言模型模拟器更符合人类信念动态。
Ψ-Bench是一个基准测试,用于评估大语言模型通过对话影响用户的能力,并整合用户画像以进行个性化说服。实验表明,即使是最先进的模型仍有改进空间,而获取客户画像能显著提升性能。
本文提出了一个针对新闻话语的八种时间框架分类法,呈现了一个带有专家注释的多语言数据集,并评估了监督学习和零样本分类在检测时间框架方面的表现。
讨论知识工作如何围绕说服展开,引用了Dwarkesh Patel关于智力与权力混淆的观点。
本文利用大语言模型分析 Reddit 的 r/ChangeMyView 板块中的说服动态和极化现象,发现共情对齐能增加信念改变的可能性,而正面反驳则会降低这种可能性。