标签
本文系统研究了基于多轮LLM的搜索智能体中的上下文干扰问题,发现干扰主要来自最新检索到的文档,并提出了一种基于蒸馏的上下文精炼器来缓解该问题。将上下文精炼纳入RL训练流程可显著提升可靠性和效率。
本文提出了一种用于多轮共情对话的双循环自我进化框架,利用可验证的情感反馈来优化策略并调整训练分布。在SAGE上,它将Qwen3-8B的Overall得分从53.87提升至79.24,比均匀情感奖励强化学习高出7.23个百分点。
本文引入了一个三条件实验框架和一个包含24,300个提示的基准,研究在多轮交互中,有偏见的用户轮次如何调节前沿LLM中的认知偏差表达。研究发现,在大多数模型中,有偏见的对话上下文会放大偏差,而明确的偏差线索可能触发与对齐相关的抑制行为。
本文提出DASH-OPD,一种用于多轮LLM智能体训练中同策略蒸馏的差异感知切换方法,它根据漂移和恢复证据自适应地在教师和学生执行器之间切换,以提高效率和性能。
M3-DuplexBench is a new multi-turn, multilingual, multidomain benchmark for evaluating full-duplex spoken dialogue systems, supporting English and Japanese across casual conversation and question answering domains.
MMShopBench 引入了一个面向多模态、多轮购物代理的真实日志基准,要求从用户图像和对话中进行联合推断,并配备离线沙盒和训练集以提升开源模型性能。
介绍CMT-RAG,一种用于多轮多跳对话式RAG的互补记忆框架,通过子问题级推理轨迹将对话记忆与检索对齐。同时提出了MuMu-QA,一个具有跨轮子问题依赖关系的基准测试。
介绍了PALATE,一个可扩展的基准,用于评估角色扮演智能体,使用个性化对齐的LLM模拟用户和个性化评分标准,解决了固定历史评估的局限性。
本文提出了一种利用具有挑战性的真实临床案例对多轮多模态诊断推理进行评估的方法,旨在衡量AI模型处理复杂医疗场景的能力。
CallBench是一个中文基准测试,用于评估电话助手中的双目标协调能力,包含50,000轮跨越六个场景的多轮对话,并采用预设感知的评估协议,覆盖语义理解、安全性和对话节奏。
EvoCode-Bench 是一个多轮编码基准,包含 5 个领域的 26 个任务,旨在评估 AI 代理在持续演变规格和累积测试下的表现,揭示单轮得分会严重高估可靠性。
本文引入了一个受控的多轮环境,以系统研究基础模型智能体在预训练、后训练(通过GRPO与在线策略蒸馏)以及集成(通过多教师在线策略蒸馏)阶段的长程规划能力。
本文提出一个框架,将静态任务转化为动态的多轮对话,以评估LLMs追踪不断演变的用户意图的能力,结果发现强大的静态性能并不能迁移到动态场景中。
StabilityBench 是一个基准测试操作符,它将单轮大语言模型评估转化为包含用户模拟和诱导模块的多轮交互,揭示了当前模型中显著的性能不稳定性,并推动了更真实的评估协议。
本文识别并描述了基于LLM的自主代理中的两种故障模式——安全漂移和操作幻觉——并提出了一种轻量级架构层,可在无假阳性情况下拦截违规行为。
用户报告称,Gemma 4 在多轮代理任务中表现懒散且不佳,相比 Qwen、DeepSeek 和 GPT-OSS 等其他模型,尽管它是一款优秀的聊天机器人。
LAPO提出了一种用于多轮搜索推理中自生成过程奖励的单轮剔除归因方法,无需外部奖励模型即可实现细粒度的信用分配。该方法在七个数据集上取得了最先进的结果。
本文提出 ReOPD,一种用于 LLM 智能体的在线策略蒸馏方法,该方法重用预先收集的教师轨迹作为重放前缀,无需新的环境交互即可提高效率和准确性。
本文介绍了ThReadMed-QA多轮医疗对话数据集,并评估了五种大语言模型在纠正患者误解方面的表现,发现后续轮次中性能显著下降。
本文提出了DC-GRPO,一种面向多轮LLM越狱学习的回合级信用分配框架,在多个基准测试中实现了超过98%的攻击成功率,优于现有方法。