DRInQ:通过受控上下文变化评估会话含义
摘要
介绍DRInQ,一个用于评估疑问话语中会话含义的基准,揭示了LLMs尽管能够生成合理的语用场景,但在推理时往往无法恢复预期的含义。
arXiv:2605.24267v1 公告类型:新
摘要:人类对话在很大程度上依赖于会话含义,即说话者传达的是暗示而非明确陈述的含义。尽管最近的大型语言模型表现出强大的对话流畅性,但当解释依赖于整合社会性和语境线索的推理时(这一过程在文本中很少被阐述),它们仍然不可靠。我们引入了DRinQ,一个用于评估疑问话语中会话含义的语用推理的基准,旨在在保持每个问题的表面形式固定的同时,隔离语用变化。为了支持可扩展的评估,我们提出了一个半自动化的流水线,该流水线生成具有系统性变化的问题-上下文-解释实例。在各种评估中,我们发现了一致的生成-推理不对称性:虽然最先进的模型在被引导时可以生成合理的语用场景,但它们往往在推理时无法恢复预期的含义。对于较小的模型,结构化提示可以改善与人类判断的一致性。一项比较写作研究进一步揭示了互补优势:人类作者倾向于产生更安全、可预测的上下文,而模型生成的场景多种多样,其解释有时超出上下文支持。这些发现凸显了建模会话含义方面的持续挑战,并推动了更多上下文敏感评估框架的发展。
查看缓存全文
缓存时间: 2026/05/26 09:01
# DRInQ:通过受控语境变化评估会话含义 来源:https://arxiv.org/abs/2605.24267 查看PDF(https://arxiv.org/pdf/2605.24267) > 摘要:人类对话高度依赖于会话含义,即说话者传达的是暗示而非明示的意义。尽管近期的大型语言模型展现出较强的对话流畅性,但当理解需要整合社交和语境线索(这一过程的文本中鲜有明确阐述)的推理时,它们仍然不可靠。我们提出了DRinQ,一个用于评估问题话语中关于会话含义的语用推理的基准,旨在保持每个问题的表层形式不变的同时,隔离语用变化。为了支持可扩展的评估,我们提出了一个半自动化流程,该流程能生成具有系统性变化的“问题-语境-解释”实例。在各项评估中,我们发现了一致的生成-推理不对称性:虽然最先进的模型在引导下能够生成合理的语用场景,但它们在推理时常常无法恢复预期的含义。对于较小的模型,结构化提示能够改善与人类判断的对齐程度。一项对比写作研究进一步揭示了互补的优势:人类作者倾向于生成更安全、可预测的语境,而模型则生成多样化的场景,其解释有时会超出语境支持的范围。这些发现凸显了在建模会话含义方面持续存在的挑战,并推动了更多语境敏感评估框架的发展。 ## 提交历史 来自:Hirona Arai \[查看邮件(https://arxiv.org/show-email/4a4baa7b/2605.24267)\] **\[v1\]**2026年5月22日,星期五,22:39:32 UTC(2,527 KB)
相似文章
LLM中的条件性认知偏差:有偏见的用户轮次如何调节上下文推理
本文引入了一个三条件实验框架和一个包含24,300个提示的基准,研究在多轮交互中,有偏见的用户轮次如何调节前沿LLM中的认知偏差表达。研究发现,在大多数模型中,有偏见的对话上下文会放大偏差,而明确的偏差线索可能触发与对齐相关的抑制行为。
在现实对话环境中评估语言模型
本文介绍了UPHELD,这是一个用于评估LLMs人类规模对话能力的大型基准,并提出了一个Mixture-of-Judges框架,将与人类评估的相关性提高了约30%。
LLMs 能推断文化背景但回应时未能应用
本文介绍了 CAPRI,一个用于评估 LLMs 是否能够从对话线索中推断用户文化背景并相应调整回应(例如使用适当的计量单位)的数据集。实验表明,LLMs 能够推断文化背景,但除非明确提示,否则常常未能应用这一信息。
通过隐含意义识别与取消评估大语言模型中的交际信念更新
本文评估了大语言模型识别未言明信念(隐含意义)以及通过隐含意义取消来理解信念更新的能力,并引入了专家标注的ImplicatureX数据集。结果表明,大语言模型在自然场景中尤其落后于人类。
Context Is Not Control:面向LLM的源边界评估
一篇介绍《Context Is Not Control》的论文,该基准评估LLM在处理受控文本中介证据时的源边界失效问题。附带开放权重模型和前沿API模型的复现包。