LLM助手可验证的社会推理

Hugging Face Daily Papers 论文

摘要

本文介绍Fuse,一个多智能体模拟框架,用于评估LLM助手的社会推理能力。它通过用户介导的交互提供可验证的真实依据,并通过人类研究进行了验证,应用于12个LLM。

LLM助手广泛用于日常社交建议,然而在这样的咨询环境中评估它们的社会推理能力仍然具有挑战性,因为(i)这需要助手从主观用户叙述中学习社交情境的设置,以及(ii)社交属性,如他人意图,通常缺乏可验证的真实依据。为解决这些挑战,我们介绍了Fuse,一个用于研究用户介导社会推理的多智能体模拟框架。在Fuse中,一个带有隐藏动机的目标智能体与其他智能体(包括一个代表用户的智能体)交互,然后用户咨询被评估的助手以推断目标的动机,通过设计提供可验证的真实依据。模拟的真实性通过一项包含2.4万标注的人类研究得到验证。我们将Fuse应用于12个LLM,并通过系统性地隔离关键因素来展示其分析效用,表明(i)用户介导加剧了社会推理的固有难度;(ii)LLM对有偏见的用户框架表现出系统性敏感性;(iii)模型可能需要比人类更多的细节才能得出正确预测;以及(iv)尽管提供了澄清问题的机会,更长的对话并不总是能提高性能。我们开源了Fuse和一个包含2.1万示例的数据集。
查看原文
查看缓存全文

缓存时间: 2026/09/18 19:02

论文页面 - 面向LLM助手的可验证社会推理

来源:https://huggingface.co/papers/2609.17496 发布于 9月15日

·

提交者 https://huggingface.co/zorik

Zorik (https://huggingface.co/zorik) 于 9月18日

摘要

LLM助手被广泛用于日常社交建议,然而在这些咨询场景中评估其社会推理能力仍然具有挑战性,因为(i)这需要助手从用户的主观叙述中了解社交情境,而(ii)社交属性(如他人意图)通常缺乏可验证的基准事实。为应对这些挑战,我们推出了Fuse,一个用于研究用户中介社会推理的多智能体模拟框架。在Fuse中,一个具有隐藏动机的目标智能体与其他智能体(包括一个代表用户的智能体)进行交互,然后用户向被评估的助手咨询以推断目标的动机,从而通过构造提供可验证的基准事实。模拟的忠实度通过一项包含2.4万条注释的人类研究进行了验证。我们将Fuse应用于12个大语言模型,并通过系统性地隔离关键因素展示了其分析效用,表明(i)用户中介放大了社会推理固有的难度;(ii)大语言模型对带偏见的用户表述表现出系统性的敏感性;(iii)模型可能需要比人类做出正确预测所需的更多细节;以及(iv)尽管为澄清性提问提供了机会,更长的对话并不总能提升性能。我们开源了Fuse框架和一个包含2.1万个示例的数据集。

查看arXiv页面 (https://arxiv.org/abs/2609.17496) 查看PDF (https://arxiv.org/pdf/2609.17496) 项目页面 (https://github.com/google-research/google-research/tree/master/user_mediated_social_reasoning) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.17496)

获取此论文到您的代理中:

hf papers read 2609\.17496

没有最新CLI? curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型链接此论文

在模型的 README.md 中引用 arxiv.org/abs/2609.17496 以从本页链接。

引用此论文的数据集0

无数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2609.17496 以从本页链接。

引用此论文的Spaces0

无Space链接此论文

在Space的 README.md 中引用 arxiv.org/abs/2609.17496 以从本页链接。

包含此论文的收藏集0

无收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页链接。

相似文章

FALSIFYBENCH:利用规则发现游戏评估大语言模型的归纳推理能力

arXiv cs.AI

FalsifyBench 是一个用于评估大语言模型归纳推理能力的新型评测框架,灵感来源于 Wason 2-4-6 任务。在该框架中,智能体通过提出示例并接收反馈来发现隐藏的语义规则。对 12 个大语言模型的评估结果表明,推理模型的表现优于指令微调模型,而负面测试(即假设证伪)是决定成败的关键因素。

模拟、推理、决策:基于LLM的科学推理驱动仿真决策

arXiv cs.AI

密歇根大学的研究人员推出了MechSim——一个基于机制的神经符号推理框架,使LLM智能体能够对科学模拟器的内部假设、依赖关系和执行行为进行推理,而非将其视为黑盒。该框架在医疗、金融和公共政策等高风险领域提升了解释质量与决策可靠性。

法律中多智能体协商研究

arXiv cs.AI

本文研究了使用LLM进行法律推理任务的多智能体协商方法,引入了两种受法庭程序启发的新框架。实验表明,多智能体系统在整体性能上与单一LLM相当,但能产生截然不同的答案,并能解决基线模型无法处理的案例,突显了多智能体方法在法律AI中的潜力。