multi-turn

标签

Cards List
#multi-turn

CMT-RAG: 多轮多跳RAG的互补记忆轨迹

arXiv cs.CL ↗ · 2026-07-30 缓存

介绍CMT-RAG,一种用于多轮多跳对话式RAG的互补记忆框架,通过子问题级推理轨迹将对话记忆与检索对齐。同时提出了MuMu-QA,一个具有跨轮子问题依赖关系的基准测试。

0 人收藏 0 人点赞
#multi-turn

超越借用历史:面向交互式角色扮演评估的个性化用户模拟

Hugging Face Daily Papers ↗ · 2026-07-30 缓存

介绍了PALATE,一个可扩展的基准,用于评估角色扮演智能体,使用个性化对齐的LLM模拟用户和个性化评分标准,解决了固定历史评估的局限性。

0 人收藏 0 人点赞
#multi-turn

多轮多模态诊断推理在具有挑战性的真实临床案例上的评估

arXiv cs.CL ↗ · 2026-07-29 缓存

本文提出了一种利用具有挑战性的真实临床案例对多轮多模态诊断推理进行评估的方法,旨在衡量AI模型处理复杂医疗场景的能力。

0 人收藏 0 人点赞
#multi-turn

CallBench:电话助手双目标协调基准测试

arXiv cs.AI ↗ · 2026-07-28 缓存

CallBench是一个中文基准测试,用于评估电话助手中的双目标协调能力,包含50,000轮跨越六个场景的多轮对话,并采用预设感知的评估协议,覆盖语义理解、安全性和对话节奏。

0 人收藏 0 人点赞
#multi-turn

@_philschmid: https://x.com/_philschmid/status/2081744861829414977

X AI KOLs Timeline ↗ · 2026-07-27 缓存

EvoCode-Bench 是一个多轮编码基准,包含 5 个领域的 26 个任务,旨在评估 AI 代理在持续演变规格和累积测试下的表现,揭示单轮得分会严重高估可靠性。

0 人收藏 0 人点赞
#multi-turn

多轮长程规划的物理学:通过单教师与多教师在线策略智能体蒸馏从预训练到后训练

Hugging Face Daily Papers ↗ · 2026-07-27 缓存

本文引入了一个受控的多轮环境,以系统研究基础模型智能体在预训练、后训练(通过GRPO与在线策略蒸馏)以及集成(通过多教师在线策略蒸馏)阶段的长程规划能力。

0 人收藏 0 人点赞
#multi-turn

LLMs在追踪不断演变的用户意图时迷失方向

arXiv cs.LG ↗ · 2026-07-24 缓存

本文提出一个框架,将静态任务转化为动态的多轮对话,以评估LLMs追踪不断演变的用户意图的能力,结果发现强大的静态性能并不能迁移到动态场景中。

0 人收藏 0 人点赞
#multi-turn

StabilityBench:大语言模型不稳定性基准测试

arXiv cs.LG ↗ · 2026-07-24 缓存

StabilityBench 是一个基准测试操作符,它将单轮大语言模型评估转化为包含用户模拟和诱导模块的多轮交互,揭示了当前模型中显著的性能不稳定性,并推动了更真实的评估协议。

0 人收藏 0 人点赞
#multi-turn

AI代理中的操作幻觉与安全漂移

arXiv cs.AI ↗ · 2026-07-22 缓存

本文识别并描述了基于LLM的自主代理中的两种故障模式——安全漂移和操作幻觉——并提出了一种轻量级架构层,可在无假阳性情况下拦截违规行为。

0 人收藏 0 人点赞
#multi-turn

Gemma 4 仍然偷懒

Reddit r/LocalLLaMA ↗ · 2026-07-20

用户报告称,Gemma 4 在多轮代理任务中表现懒散且不佳,相比 Qwen、DeepSeek 和 GPT-OSS 等其他模型,尽管它是一款优秀的聊天机器人。

0 人收藏 0 人点赞
#multi-turn

LAPO:多轮搜索推理中自生成过程奖励的单轮剔除归因方法

arXiv cs.AI ↗ · 2026-07-16 缓存

LAPO提出了一种用于多轮搜索推理中自生成过程奖励的单轮剔除归因方法,无需外部奖励模型即可实现细粒度的信用分配。该方法在七个数据集上取得了最先进的结果。

0 人收藏 0 人点赞
#multi-turn

基于前缀重放的多轮在线策略蒸馏

Hugging Face Daily Papers ↗ · 2026-07-16 缓存

本文提出 ReOPD,一种用于 LLM 智能体的在线策略蒸馏方法,该方法重用预先收集的教师轨迹作为重放前缀,无需新的环境交互即可提高效率和准确性。

0 人收藏 0 人点赞
#multi-turn

评估大语言模型在多轮医疗对话中的误解纠正能力

arXiv cs.CL ↗ · 2026-07-15 缓存

本文介绍了ThReadMed-QA多轮医疗对话数据集,并评估了五种大语言模型在纠正患者误解方面的表现,发现后续轮次中性能显著下降。

0 人收藏 0 人点赞
#multi-turn

MJ: 基于分解信用分配的多轮LLM越狱

arXiv cs.CL ↗ · 2026-07-14 缓存

本文提出了DC-GRPO,一种面向多轮LLM越狱学习的回合级信用分配框架,在多个基准测试中实现了超过98%的攻击成功率,优于现有方法。

0 人收藏 0 人点赞
#multi-turn

IdeaTrail:科学构思的全过程智能体轨迹

arXiv cs.AI ↗ · 2026-07-14 缓存

IdeaTrail是一个多轮过程轨迹数据集,用于科学构思,通过Generator--Advisor循环从证据收集到提案构建合成研究过程,以确保依据充分。

0 人收藏 0 人点赞
#multi-turn

EvoCUA-1.5:面向多轮计算机使用代理的在线强化学习

arXiv cs.AI ↗ · 2026-07-14 缓存

EvoCUA-1.5 引入了一种面向多轮计算机使用代理的在线强化学习框架,在 OSWorld-Verified 上实现了 63.2% 的成功率,并通过步骤级策略优化和动态课程学习,性能超越了参数高达 35B 的可比开放权重模型。

0 人收藏 0 人点赞
#multi-turn

你的语音助手无法察觉自己的过度承诺。这是结构性问题,不是调优问题。

Reddit r/AI_Agents ↗ · 2026-07-10

文章指出了语音助手的一个结构性缺陷:它们无法检测到在多个对话回合中过度承诺的情况,并描述构建了一个确定性检查器,能在不依赖LLM评估的情况下标记矛盾。

0 人收藏 0 人点赞
#multi-turn

我们基于信息几何实现了一种多轮提示注入的二阶早期预警信号

Reddit r/artificial ↗ · 2026-07-09

介绍了一种基于信息几何和统计流形的多轮提示注入二阶早期预警信号。该方法利用从稳定性参数二阶导数导出的元速率,在阈值交叉前预测对抗轨迹,实现主动检测。

0 人收藏 0 人点赞
#multi-turn

BayesBench: 多轮证据累积下LLM信念轨迹的评估

arXiv cs.AI ↗ · 2026-07-01 缓存

BayesBench评估了在多轮证据累积任务中,大语言模型的信念更新与贝叶斯推理的接近程度,发现虽然扩展规模能改善潜在推理,但模型难以将这种理解用于下游预测。

0 人收藏 0 人点赞
#multi-turn

是什么驱动了反馈带来的交互式改进?

arXiv cs.AI ↗ · 2026-07-01 缓存

本文研究了在多轮语言智能体场景中,自然语言反馈带来的改进是否超越了仅靠反复尝试所取得的提升。通过跨多个基准测试的受控学生-教师协议,作者发现自我生成的反馈几乎没有额外增益,而强大的外部教师则能带来显著更大的提升,并且学生根据反馈采取行动的能力是关键瓶颈。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈