multi-turn

标签

Cards List
#multi-turn

@thecekbote: 很高兴分享MURPHY已被#NeurIPS2026接受!随着我们向更多代理训练和迭代自改进...

X AI KOLs Timeline ↗ · 昨天 缓存

MURPHY引入了一种反馈感知的多轮GRPO扩展,用于自纠正代码生成,通过奖励为后续成功提供反馈的早期尝试来提高基准性能。

0 人收藏 0 人点赞
#multi-turn

PII-TRACE:面向多轮LLM对话中上下文感知PII检测的基准测试

arXiv cs.CL ↗ · 6天前 缓存

介绍PII-TRACE,首个用于多轮LLM对话中上下文感知PII检测的基准,以及PII-Tracer,一个实现高实体级覆盖率的紧凑检测器。

0 人收藏 0 人点赞
#multi-turn

当更优的轮次不造就更优的智能体:诊断次轮指标与工作流成功率之间的差距

arXiv cs.CL ↗ · 2026-09-21 缓存

本文诊断了AI智能体中次轮评估指标与自主工作流执行成功率之间的差距,表明监督微调虽然提升了轮次级别的性能,却未能增强端到端的工作流成功率。

0 人收藏 0 人点赞
#multi-turn

τ-Elicitation:评估语音代理中多轮实体提取的基准

arXiv cs.AI ↗ · 2026-09-15 缓存

本文介绍了τ-Elicitation,一个用于评估语音代理中多轮实体提取的基准,指出了策略选择和错误恢复是关键瓶颈。

0 人收藏 0 人点赞
#multi-turn

SCX Router: 流式零样本模型选择——基于解码器-KV分类器和现实世界任务本体

arXiv cs.AI ↗ · 2026-09-03 缓存

SCX Router 引入了一个基于GLiClass的轻量级模型选择工具,该工具使用解码器-KV分类器和任务本体来路由LLM任务,优化速度、成本和质量,无需自回归生成。

0 人收藏 0 人点赞
#multi-turn

PGPO:面向多轮智能体任务的势引导策略优化

arXiv cs.AI ↗ · 2026-09-03 缓存

PGPO 提出势引导策略优化用于多轮智能体任务,使得在 LLM 后训练中实现更细粒度的信用分配,并在 ALFWorld 和 WebShop 基准测试上展示出强劲结果。

0 人收藏 0 人点赞
#multi-turn

EvoGenUI-Bench: 评估LLMs作为多轮生成UI助手的基准测试

Hugging Face Daily Papers ↗ · 2026-08-29 缓存

EvoGenUI-Bench引入了一个用于评估LLMs作为多轮生成UI助手的基准测试,专注于接口维护,涵盖150个任务,在状态传播和外部基础方面存在挑战。

0 人收藏 0 人点赞
#multi-turn

HiDiffTIR:多轮工具集成推理的层次难度感知策略优化

arXiv cs.CL ↗ · 2026-08-25 缓存

提出HiDiffTIR,一种面向LLM代理中多轮工具集成推理的层次难度感知策略优化框架,通过细粒度信用分配提升性能和工具调用准确性。

0 人收藏 0 人点赞
#multi-turn

通过组合界限与安全持久性实现LLM安全的经认证多轮鲁棒性

arXiv cs.AI ↗ · 2026-08-24 缓存

本文介绍了多轮经认证鲁棒性(MTCR),一个通过组合方法和安全持久性提供更紧界限来认证大型语言模型针对多轮越狱攻击安全性的框架。

0 人收藏 0 人点赞
#multi-turn

OmniAssistBench: 针对全能大语言模型的助理式交互基准测试

Hugging Face Daily Papers ↗ · 2026-08-21 缓存

OmniAssistBench 是一个用于评估作为实时视频助理的全能大语言模型的基准测试,揭示当前模型在视觉提示、上下文保持和及时响应方面存在困难。

0 人收藏 0 人点赞
#multi-turn

DART-SD: 基于钻石拓扑感知的检索与调优框架,用于多轮工具调用代理的自蒸馏

arXiv cs.CL ↗ · 2026-08-20 缓存

DART-SD提出了一种拓扑感知的检索和调优框架,用于基于LLM的工具调用代理的自蒸馏,通过仅纠正关键拓扑断点并保留有效推理来提升策略多样性。

0 人收藏 0 人点赞
#multi-turn

编写、执行、优化:通过执行反馈的强化学习从技能跟随者到技能优化者

arXiv cs.CL ↗ · 2026-08-19 缓存

本文介绍了一种多阶段框架WER,它使用执行反馈的强化学习来训练技能优化器,以改进工具使用代理,在BFCL v4和τ2-bench等基准测试中实现了显著的性能提升。

0 人收藏 0 人点赞
#multi-turn

SMOPD: 用于脏历史多轮在策略自蒸馏的选择性令牌熵掩蔽

arXiv cs.LG ↗ · 2026-08-18 缓存

SMOPD是一种仅使用损失的稳定方法,用于多轮在策略自蒸馏,通过选择性令牌熵掩蔽来提高脏历史设置下的准确性,并展示了在Qwen3模型上的改进。

0 人收藏 0 人点赞
#multi-turn

缓解上下文干扰以实现可靠高效的搜索智能体

arXiv cs.CL ↗ · 2026-08-12 缓存

本文系统研究了基于多轮LLM的搜索智能体中的上下文干扰问题,发现干扰主要来自最新检索到的文档,并提出了一种基于蒸馏的上下文精炼器来缓解该问题。将上下文精炼纳入RL训练流程可显著提升可靠性和效率。

0 人收藏 0 人点赞
#multi-turn

基于可验证情感反馈的多轮共情对话双循环自我进化

arXiv cs.CL ↗ · 2026-08-12 缓存

本文提出了一种用于多轮共情对话的双循环自我进化框架,利用可验证的情感反馈来优化策略并调整训练分布。在SAGE上,它将Qwen3-8B的Overall得分从53.87提升至79.24,比均匀情感奖励强化学习高出7.23个百分点。

0 人收藏 0 人点赞
#multi-turn

LLM中的条件性认知偏差:有偏见的用户轮次如何调节上下文推理

arXiv cs.CL ↗ · 2026-08-07 缓存

本文引入了一个三条件实验框架和一个包含24,300个提示的基准,研究在多轮交互中,有偏见的用户轮次如何调节前沿LLM中的认知偏差表达。研究发现,在大多数模型中,有偏见的对话上下文会放大偏差,而明确的偏差线索可能触发与对齐相关的抑制行为。

0 人收藏 0 人点赞
#multi-turn

DASH-OPD:用于同策略蒸馏的具有滞回的差异感知切换

arXiv cs.LG ↗ · 2026-08-03 缓存

本文提出DASH-OPD,一种用于多轮LLM智能体训练中同策略蒸馏的差异感知切换方法,它根据漂移和恢复证据自适应地在教师和学生执行器之间切换,以提高效率和性能。

0 人收藏 0 人点赞
#multi-turn

M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models

arXiv cs.CL ↗ · 2026-08-03 缓存

M3-DuplexBench is a new multi-turn, multilingual, multidomain benchmark for evaluating full-duplex spoken dialogue systems, supporting English and Japanese across casual conversation and question answering domains.

0 人收藏 0 人点赞
#multi-turn

MMShopBench:面向多模态、多轮购物代理的真实日志基准

arXiv cs.AI ↗ · 2026-08-03 缓存

MMShopBench 引入了一个面向多模态、多轮购物代理的真实日志基准,要求从用户图像和对话中进行联合推断,并配备离线沙盒和训练集以提升开源模型性能。

0 人收藏 0 人点赞
#multi-turn

CMT-RAG: 多轮多跳RAG的互补记忆轨迹

arXiv cs.CL ↗ · 2026-07-30 缓存

介绍CMT-RAG,一种用于多轮多跳对话式RAG的互补记忆框架,通过子问题级推理轨迹将对话记忆与检索对齐。同时提出了MuMu-QA,一个具有跨轮子问题依赖关系的基准测试。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈