SoCRATES: 迈向跨领域与社会认知变化的主动式LLM调解的可靠自动评估
摘要
SoCRATES提出了一个真实的多领域基准,用于评估主动式LLM调解器,显示顶尖模型在冲突解决中仅能弥合约三分之一的共识差距。
查看缓存全文
缓存时间: 2026/06/08 11:15
论文页面 - SoCRATES:面向跨领域和社会认知变化的主动式 LLM 调解可靠自动化评估
来源:https://huggingface.co/papers/2606.05563
摘要
SoCRATES 提出了一个现实的多领域基准,用于评估跨各种社会认知适应轴的主动式 LLM 调解器,结果表明即使是性能最好的模型也只能解决冲突中约三分之一的共识差距。
评估 LLM 调解器 (https://huggingface.co/papers?q=LLM%20mediators) 仍具挑战性,因为调解是一个由争议方不断变化的情绪、意图和情境塑造的实时轨迹 (https://huggingface.co/papers?q=real-time%20trajectory)。现有的测试平台依赖少数专家撰写的领域,主要变化策略姿态,并对每一轮针对每个主题进行评分,引入了偏离主题的噪声。我们引入了 SoCRATES,一个在现实、多领域测试平台 (https://huggingface.co/papers?q=multi-domain%20testbeds) 中评估主动式 LLM 调解器 (https://huggingface.co/papers?q=LLM%20mediators) 的基准。它通过一个代理流水线 (https://huggingface.co/papers?q=agentic%20pipeline) 从真实冲突中构建场景,覆盖八个领域,探测五个社会认知适应 (https://huggingface.co/papers?q=socio-cognitive%20adaptation) 轴(策略姿态、当事人组成、历史长度、情绪反应性和文化身份),并通过一个主题局部评估器 (https://huggingface.co/papers?q=topic-localized%20evaluator) 仅对推动该主题的轮次进行评分。该评估器与人类专家的对齐度达到 0.82,比每轮基线提高一倍以上。对八个前沿 LLM 进行基准测试后,我们发现即使在多样且现实的测试平台下,最强的调解器也只能弥合约三分之一的未调解共识差距 (https://huggingface.co/papers?q=consensus%20gap),且性能因社会认知轴差异显著,突显出进展在于对不同条件的社会适应。
查看 arXiv 页面 (https://arxiv.org/abs/2606.05563)
查看 PDF (https://arxiv.org/pdf/2606.05563)
项目页面 (https://disl-lab.github.io/SoCRATES/)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.05563)
在你的代理中获取此论文:
hf papers read 2606.05563
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2606.05563 以从本页面链接。
引用此论文的数据集0
没有数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.05563 以从本页面链接。
引用此论文的 Spaces0
没有 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2606.05563 以从本页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面链接。
相似文章
人类谈判的自动化调解器:通过结构化LLM流水线进行前期调解
本文介绍了一种用于人类谈判的自动化调解器,它使用结构化LLM模块流水线进行前期调解。在人类受试者实验中,该系统在偏好推断方面降低了误差,同时实现了与专业人类调解员相当的准备效果。
LivingArena:LLM是否知道其他LLM不知道的?同伴探查作为可扩展评估
本文介绍LivingArena,这是一个自动化的评估框架,其中LLM通过生成问题来探查彼此弱点,实现抗污染和可扩展的评估,并能随模型改进而适应。
Chain-of-Models: Cross-Model Auditing for Bias-Robust LLM Judges
A research paper introducing Chain-of-Models (CoM), an automated pipeline where a second LLM audits a first model's reasoning trace to correct cognitive biases. It finds that auditor effectiveness depends on model family and bias type, and proposes a bias-specific auditor selection rule that improves judgment accuracy.
衡量共享决策实践(OPTION12):对开源小型LLMs(OS-sLLMs)在更好隐私与可持续性方面的研究
本文研究了使用开源小型LLMs(OS-sLLMs)自动化编码临床会诊中的共享决策,采用OPTION12工具,旨在提升隐私性和可持续性。初步结果显示,Mistral7b等通用领域模型优于医学领域模型,表明医学OS-sLLMs仍需进一步发展。
前沿大语言模型中的领域级元认知监控:一份33个模型图谱
本研究提出了一份涵盖33个模型的图谱,利用MMLU基准分析了前沿大语言模型中的领域级元认知监控,揭示了聚合指标所掩盖的不同知识领域中置信度校准的显著差异。