multi-turn

标签

Cards List
#multi-turn

缓解上下文干扰以实现可靠高效的搜索智能体

arXiv cs.CL · 4天前 缓存

本文系统研究了基于多轮LLM的搜索智能体中的上下文干扰问题,发现干扰主要来自最新检索到的文档,并提出了一种基于蒸馏的上下文精炼器来缓解该问题。将上下文精炼纳入RL训练流程可显著提升可靠性和效率。

0 人收藏 0 人点赞
#multi-turn

基于可验证情感反馈的多轮共情对话双循环自我进化

arXiv cs.CL · 4天前 缓存

本文提出了一种用于多轮共情对话的双循环自我进化框架,利用可验证的情感反馈来优化策略并调整训练分布。在SAGE上,它将Qwen3-8B的Overall得分从53.87提升至79.24,比均匀情感奖励强化学习高出7.23个百分点。

0 人收藏 0 人点赞
#multi-turn

LLM中的条件性认知偏差:有偏见的用户轮次如何调节上下文推理

arXiv cs.CL · 2026-08-07 缓存

本文引入了一个三条件实验框架和一个包含24,300个提示的基准,研究在多轮交互中,有偏见的用户轮次如何调节前沿LLM中的认知偏差表达。研究发现,在大多数模型中,有偏见的对话上下文会放大偏差,而明确的偏差线索可能触发与对齐相关的抑制行为。

0 人收藏 0 人点赞
#multi-turn

DASH-OPD:用于同策略蒸馏的具有滞回的差异感知切换

arXiv cs.LG · 2026-08-03 缓存

本文提出DASH-OPD,一种用于多轮LLM智能体训练中同策略蒸馏的差异感知切换方法,它根据漂移和恢复证据自适应地在教师和学生执行器之间切换,以提高效率和性能。

0 人收藏 0 人点赞
#multi-turn

M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models

arXiv cs.CL · 2026-08-03 缓存

M3-DuplexBench is a new multi-turn, multilingual, multidomain benchmark for evaluating full-duplex spoken dialogue systems, supporting English and Japanese across casual conversation and question answering domains.

0 人收藏 0 人点赞
#multi-turn

MMShopBench:面向多模态、多轮购物代理的真实日志基准

arXiv cs.AI · 2026-08-03 缓存

MMShopBench 引入了一个面向多模态、多轮购物代理的真实日志基准,要求从用户图像和对话中进行联合推断,并配备离线沙盒和训练集以提升开源模型性能。

0 人收藏 0 人点赞
#multi-turn

CMT-RAG: 多轮多跳RAG的互补记忆轨迹

arXiv cs.CL · 2026-07-30 缓存

介绍CMT-RAG,一种用于多轮多跳对话式RAG的互补记忆框架,通过子问题级推理轨迹将对话记忆与检索对齐。同时提出了MuMu-QA,一个具有跨轮子问题依赖关系的基准测试。

0 人收藏 0 人点赞
#multi-turn

超越借用历史:面向交互式角色扮演评估的个性化用户模拟

Hugging Face Daily Papers · 2026-07-30 缓存

介绍了PALATE,一个可扩展的基准,用于评估角色扮演智能体,使用个性化对齐的LLM模拟用户和个性化评分标准,解决了固定历史评估的局限性。

0 人收藏 0 人点赞
#multi-turn

多轮多模态诊断推理在具有挑战性的真实临床案例上的评估

arXiv cs.CL · 2026-07-29 缓存

本文提出了一种利用具有挑战性的真实临床案例对多轮多模态诊断推理进行评估的方法,旨在衡量AI模型处理复杂医疗场景的能力。

0 人收藏 0 人点赞
#multi-turn

CallBench:电话助手双目标协调基准测试

arXiv cs.AI · 2026-07-28 缓存

CallBench是一个中文基准测试,用于评估电话助手中的双目标协调能力,包含50,000轮跨越六个场景的多轮对话,并采用预设感知的评估协议,覆盖语义理解、安全性和对话节奏。

0 人收藏 0 人点赞
#multi-turn

@_philschmid: https://x.com/_philschmid/status/2081744861829414977

X AI KOLs Timeline · 2026-07-27 缓存

EvoCode-Bench 是一个多轮编码基准,包含 5 个领域的 26 个任务,旨在评估 AI 代理在持续演变规格和累积测试下的表现,揭示单轮得分会严重高估可靠性。

0 人收藏 0 人点赞
#multi-turn

多轮长程规划的物理学:通过单教师与多教师在线策略智能体蒸馏从预训练到后训练

Hugging Face Daily Papers · 2026-07-27 缓存

本文引入了一个受控的多轮环境,以系统研究基础模型智能体在预训练、后训练(通过GRPO与在线策略蒸馏)以及集成(通过多教师在线策略蒸馏)阶段的长程规划能力。

0 人收藏 0 人点赞
#multi-turn

LLMs在追踪不断演变的用户意图时迷失方向

arXiv cs.LG · 2026-07-24 缓存

本文提出一个框架,将静态任务转化为动态的多轮对话,以评估LLMs追踪不断演变的用户意图的能力,结果发现强大的静态性能并不能迁移到动态场景中。

0 人收藏 0 人点赞
#multi-turn

StabilityBench:大语言模型不稳定性基准测试

arXiv cs.LG · 2026-07-24 缓存

StabilityBench 是一个基准测试操作符,它将单轮大语言模型评估转化为包含用户模拟和诱导模块的多轮交互,揭示了当前模型中显著的性能不稳定性,并推动了更真实的评估协议。

0 人收藏 0 人点赞
#multi-turn

AI代理中的操作幻觉与安全漂移

arXiv cs.AI · 2026-07-22 缓存

本文识别并描述了基于LLM的自主代理中的两种故障模式——安全漂移和操作幻觉——并提出了一种轻量级架构层,可在无假阳性情况下拦截违规行为。

0 人收藏 0 人点赞
#multi-turn

Gemma 4 仍然偷懒

Reddit r/LocalLLaMA · 2026-07-20

用户报告称,Gemma 4 在多轮代理任务中表现懒散且不佳,相比 Qwen、DeepSeek 和 GPT-OSS 等其他模型,尽管它是一款优秀的聊天机器人。

0 人收藏 0 人点赞
#multi-turn

LAPO:多轮搜索推理中自生成过程奖励的单轮剔除归因方法

arXiv cs.AI · 2026-07-16 缓存

LAPO提出了一种用于多轮搜索推理中自生成过程奖励的单轮剔除归因方法,无需外部奖励模型即可实现细粒度的信用分配。该方法在七个数据集上取得了最先进的结果。

0 人收藏 0 人点赞
#multi-turn

基于前缀重放的多轮在线策略蒸馏

Hugging Face Daily Papers · 2026-07-16 缓存

本文提出 ReOPD,一种用于 LLM 智能体的在线策略蒸馏方法,该方法重用预先收集的教师轨迹作为重放前缀,无需新的环境交互即可提高效率和准确性。

0 人收藏 0 人点赞
#multi-turn

评估大语言模型在多轮医疗对话中的误解纠正能力

arXiv cs.CL · 2026-07-15 缓存

本文介绍了ThReadMed-QA多轮医疗对话数据集,并评估了五种大语言模型在纠正患者误解方面的表现,发现后续轮次中性能显著下降。

0 人收藏 0 人点赞
#multi-turn

MJ: 基于分解信用分配的多轮LLM越狱

arXiv cs.CL · 2026-07-14 缓存

本文提出了DC-GRPO,一种面向多轮LLM越狱学习的回合级信用分配框架,在多个基准测试中实现了超过98%的攻击成功率,优于现有方法。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈