LLM助手可验证的社会推理
摘要
本文介绍Fuse,一个多智能体模拟框架,用于评估LLM助手的社会推理能力。它通过用户介导的交互提供可验证的真实依据,并通过人类研究进行了验证,应用于12个LLM。
查看缓存全文
缓存时间: 2026/09/18 19:02
论文页面 - 面向LLM助手的可验证社会推理
来源:https://huggingface.co/papers/2609.17496 发布于 9月15日
·
提交者 https://huggingface.co/zorik
Zorik (https://huggingface.co/zorik) 于 9月18日
摘要
LLM助手被广泛用于日常社交建议,然而在这些咨询场景中评估其社会推理能力仍然具有挑战性,因为(i)这需要助手从用户的主观叙述中了解社交情境,而(ii)社交属性(如他人意图)通常缺乏可验证的基准事实。为应对这些挑战,我们推出了Fuse,一个用于研究用户中介社会推理的多智能体模拟框架。在Fuse中,一个具有隐藏动机的目标智能体与其他智能体(包括一个代表用户的智能体)进行交互,然后用户向被评估的助手咨询以推断目标的动机,从而通过构造提供可验证的基准事实。模拟的忠实度通过一项包含2.4万条注释的人类研究进行了验证。我们将Fuse应用于12个大语言模型,并通过系统性地隔离关键因素展示了其分析效用,表明(i)用户中介放大了社会推理固有的难度;(ii)大语言模型对带偏见的用户表述表现出系统性的敏感性;(iii)模型可能需要比人类做出正确预测所需的更多细节;以及(iv)尽管为澄清性提问提供了机会,更长的对话并不总能提升性能。我们开源了Fuse框架和一个包含2.1万个示例的数据集。
查看arXiv页面 (https://arxiv.org/abs/2609.17496) 查看PDF (https://arxiv.org/pdf/2609.17496) 项目页面 (https://github.com/google-research/google-research/tree/master/user_mediated_social_reasoning) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.17496)
获取此论文到您的代理中:
hf papers read 2609\.17496
没有最新CLI? curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2609.17496 以从本页链接。
引用此论文的数据集0
无数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2609.17496 以从本页链接。
引用此论文的Spaces0
无Space链接此论文
在Space的 README.md 中引用 arxiv.org/abs/2609.17496 以从本页链接。
包含此论文的收藏集0
无收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页链接。
相似文章
FALSIFYBENCH:利用规则发现游戏评估大语言模型的归纳推理能力
FalsifyBench 是一个用于评估大语言模型归纳推理能力的新型评测框架,灵感来源于 Wason 2-4-6 任务。在该框架中,智能体通过提出示例并接收反馈来发现隐藏的语义规则。对 12 个大语言模型的评估结果表明,推理模型的表现优于指令微调模型,而负面测试(即假设证伪)是决定成败的关键因素。
模拟、推理、决策:基于LLM的科学推理驱动仿真决策
密歇根大学的研究人员推出了MechSim——一个基于机制的神经符号推理框架,使LLM智能体能够对科学模拟器的内部假设、依赖关系和执行行为进行推理,而非将其视为黑盒。该框架在医疗、金融和公共政策等高风险领域提升了解释质量与决策可靠性。
让LLMs相互评判:用于医学问答的多智能体同行评审推理
本文介绍了一种多智能体同行评审推理方法,其中多个LLM独立生成思维链推理,然后相互评估输出以选择最佳答案。该方法在医学问答基准测试中优于单模型推理和多数投票。
法律中多智能体协商研究
本文研究了使用LLM进行法律推理任务的多智能体协商方法,引入了两种受法庭程序启发的新框架。实验表明,多智能体系统在整体性能上与单一LLM相当,但能产生截然不同的答案,并能解决基线模型无法处理的案例,突显了多智能体方法在法律AI中的潜力。
INSIDE the Student's Mind: Jointly Modeling Latent Reasoning and Action in LLM Student Simulators
This paper presents INSIDE, a framework that fine-tunes LLMs to generate internal dialogue grounded in Bloom's Taxonomy, enabling student simulators to model both latent reasoning and observable actions. Evaluations show improved action fidelity and reasoning alignment compared to prompting baselines.