标签
This paper introduces ReBIND, a framework that measures, predicts, and repairs behavioral relapse in black-box LLM dialogues where models continue to follow revoked constraints. Experiments with HumanEval show that ahead-of-time compilation significantly reduces relapse compared to a baseline, while adaptive interventions add no detectable gain.
介绍了 Hy-MultiTurn,一个用于深度多轮对话理解的中文基准,评估了 22 个前沿模型,涵盖六种受控模式(约束记忆、精确执行、约束合成、对象定位、动作抑制、指代消解),共 209 个任务,对话轮次从 12 轮到 76 轮不等。即使是最强的模型 GPT-5.5,也仅能满足 41.1% 的响应要求。
MedDDC-Eval引入了一个针对多轮医疗咨询智能体的诊断解耦评估测试平台,将策略引导的对话历史与诊断生成分离,以实现对证据获取和诊断有用性的更清晰测量。
本文介绍了EYT-Bench,一个以人为中心的基准,用于评估多轮对话中的LLM,采用了解耦的用户模拟、目标建模和评判设计。它揭示了闭源和开源模型在客观意图追踪上差异显著,但在主观维度上相似;推理能力提升了客观追踪,而人物角色格式强烈影响轨迹分布。
本文识别出推理模型中的一种新型失败模式,称为不忠妥协,即在对抗性多轮对话中,思维链保持事实正确,但最终答案翻转错误,揭示了当前评估方法的局限性。
本文从理论上识别并缓解了多轮对话强化学习中的上下文分布偏移,提出了校准交互式RL,该框架将交互式RL与模拟器对齐相结合,以减少模拟到真实的差距并实现最先进的性能。
提出SKG-Eval,一种用于多轮对话的准确定性评估框架,利用增量语义知识图谱检测跨轮不一致性、矛盾及主题漂移,实现与人类判断更高的相关性。
SCICONVBENCH是一个基准测试,用于评估LLMs在跨计算科学领域中对表述不清的科学查询进行多轮澄清的能力。研究发现,即使是顶尖模型也难以进行消歧,并且频繁做出隐性假设。
本文介绍了一个用于 SemEval-2026 任务 8 的系统,该系统采用三阶段流水线,包括使用微调后的 Qwen 模型进行查询重写、混合检索以及交叉编码器重排,以提升多轮检索的性能。
本文介绍了 SOMA,这是一种高效的 LLM 多轮对话服务框架,它利用经过软提示和 LoRA 微调适配的小语言模型来降低延迟和成本。
本文提出了 TRACE,这是一个基于强化学习的、具有对话轮次感知能力的多轮大语言模型(LLM)越狱攻击信用分配框架,声称在攻击成功率和防御对齐方面取得了显著提升。
提出TurnGate,一种回合级监控器,通过识别最早响应即会促成有害动作的回合来检测多轮对话中的隐藏恶意意图,并配套构建了多轮意图数据集(MTID)以支持训练与评估。
研究发现,GPT与Claude在多轮数学对话的纠错过程中表现出截然不同且不可靠的修复行为:有的模型抗拒修正,有的则过度修正。
本文提出双可预测性(P)和信息数字孪生(IDT),一种使用令牌频率统计来监控多轮LLM交互中对话一致性的轻量级方法,无需使用嵌入或模型内部信息。该方法在检测矛盾和话题转换时达到100%的敏感度,同时为扩展LLM部署建立了实用的监控框架。
Context-Agent提出了一种新颖框架,将多轮对话历史建模为动态树结构而非扁平序列,更好地捕捉自然对话的层级性和分支性特征。该论文引入NTM基准来评估非线性对话场景,并展示了在各种LLM上的任务完成率和令牌效率的提升。