multi-turn

标签

Cards List
#multi-turn

IdeaTrail:科学构思的全过程智能体轨迹

arXiv cs.AI · 2026-07-14 缓存

IdeaTrail是一个多轮过程轨迹数据集,用于科学构思,通过Generator--Advisor循环从证据收集到提案构建合成研究过程,以确保依据充分。

0 人收藏 0 人点赞
#multi-turn

EvoCUA-1.5:面向多轮计算机使用代理的在线强化学习

arXiv cs.AI · 2026-07-14 缓存

EvoCUA-1.5 引入了一种面向多轮计算机使用代理的在线强化学习框架,在 OSWorld-Verified 上实现了 63.2% 的成功率,并通过步骤级策略优化和动态课程学习,性能超越了参数高达 35B 的可比开放权重模型。

0 人收藏 0 人点赞
#multi-turn

你的语音助手无法察觉自己的过度承诺。这是结构性问题,不是调优问题。

Reddit r/AI_Agents · 2026-07-10

文章指出了语音助手的一个结构性缺陷:它们无法检测到在多个对话回合中过度承诺的情况,并描述构建了一个确定性检查器,能在不依赖LLM评估的情况下标记矛盾。

0 人收藏 0 人点赞
#multi-turn

我们基于信息几何实现了一种多轮提示注入的二阶早期预警信号

Reddit r/artificial · 2026-07-09

介绍了一种基于信息几何和统计流形的多轮提示注入二阶早期预警信号。该方法利用从稳定性参数二阶导数导出的元速率,在阈值交叉前预测对抗轨迹,实现主动检测。

0 人收藏 0 人点赞
#multi-turn

BayesBench: 多轮证据累积下LLM信念轨迹的评估

arXiv cs.AI · 2026-07-01 缓存

BayesBench评估了在多轮证据累积任务中,大语言模型的信念更新与贝叶斯推理的接近程度,发现虽然扩展规模能改善潜在推理,但模型难以将这种理解用于下游预测。

0 人收藏 0 人点赞
#multi-turn

是什么驱动了反馈带来的交互式改进?

arXiv cs.AI · 2026-07-01 缓存

本文研究了在多轮语言智能体场景中,自然语言反馈带来的改进是否超越了仅靠反复尝试所取得的提升。通过跨多个基准测试的受控学生-教师协议,作者发现自我生成的反馈几乎没有额外增益,而强大的外部教师则能带来显著更大的提升,并且学生根据反馈采取行动的能力是关键瓶颈。

0 人收藏 0 人点赞
#multi-turn

ATOD:面向多轮自主智能体的退火轮次感知在线策略蒸馏

arXiv cs.AI · 2026-06-29 缓存

本文介绍了ATOD,一种结合在线策略蒸馏和强化学习的混合在线蒸馏算法,用于在多轮任务中训练小型语言模型智能体,其特点是采用退火OPD-RL调度和轮次级分歧-不确定性重新加权,以改善密集监督。

0 人收藏 0 人点赞
#multi-turn

SWE-INTERACT: 将SWE基准重新构想为用户驱动的长期编码会话

Hugging Face Daily Papers · 2026-06-29 缓存

SWE-Interact是一个新的测试平台,用于评估编码智能体在真实的多轮用户驱动软件工程任务中的表现,揭示了强大的单轮基准性能并不能可靠地迁移到交互式、迭代的工作流程中,在这些流程中,智能体必须发现用户意图并适应不断变化的需求。

0 人收藏 0 人点赞
#multi-turn

SWE-Together: 在交互式用户会话中评估代码代理

Hugging Face Daily Papers · 2026-06-29 缓存

SWE-Together 是一个基于真实用户-代理交互创建的多轮代码基准测试,采用反应式LLM模拟器,根据最终正确性和交互效率评估代理。

0 人收藏 0 人点赞
#multi-turn

AI智能体的自然语言测试(使用模拟隔离)

Reddit r/AI_Agents · 2026-06-28

本文介绍了一种针对AI智能体的新型自然语言测试系统,该系统利用模拟隔离自动生成多轮模拟并评估智能体行为,帮助开发者捕捉提示词变更引起的回归问题。

0 人收藏 0 人点赞
#multi-turn

我构建了一个针对多轮提示注入攻击的基准测试。大多数防御措施从未预料到它们的出现。

Reddit r/artificial · 2026-06-19

一项新的多轮提示注入攻击基准测试显示,目前大多数防御措施无法检测到复杂的多步攻击。

0 人收藏 0 人点赞
#multi-turn

EHRNote-ChatQA:基于证据的长篇出院小结多轮临床问答基准

arXiv cs.CL · 2026-06-16 缓存

介绍 EHRNote-ChatQA,这是一个基于证据、覆盖多份出院小结的多轮临床问答基准,经专家验证构建。对 22 个大语言模型的基准测试揭示了在证据溯源和多轮错误累积方面的挑战。

0 人收藏 0 人点赞
#multi-turn

CacheRL:基于缓存回滚和混合奖励的多轮工具调用智能体

arXiv cs.CL · 2026-06-15 缓存

CacheRL训练用于多步工具调用任务的小型智能体基础模型,通过缓存回滚和混合奖励塑造,以100倍更少的计算量实现了92%的过程准确率(接近GPT-5的94%),并在知识迁移、缓存感知奖励以及迭代SFT/GRPO训练方面进行了创新。

0 人收藏 0 人点赞
#multi-turn

DLawBench:通过多轮法律咨询评估大语言模型

arXiv cs.CL · 2026-06-15 缓存

DLawBench是一个新的基准测试,用于评估大语言模型在多轮法律咨询中的表现,涵盖中国和美国法律,包含四种客户类型。实验表明仍有很大改进空间,最佳模型在法律推理上仅达到0.562。

0 人收藏 0 人点赞
#multi-turn

Shopping Reasoning Bench:一个由专家编写的用于多轮对话购物助手的基准

arXiv cs.CL · 2026-06-12 缓存

购物推理基准(Shopping Reasoning Bench)是一个由专家编写的用于评估多轮对话购物助手的基准,包含525个任务和超过10,000个二元评判标准。对GPT、Claude和Gemini的评估显示,当前模型仅能达到57%至77%的通过率,揭示了在专家级购物推理方面存在显著差距。

0 人收藏 0 人点赞
#multi-turn

HERO: 从环境观察中进行事后增强反思的智能体自蒸馏

arXiv cs.AI · 2026-06-11 缓存

HERO 提出了一种事后增强的自蒸馏框架,利用环境观察作为局部对齐的反馈,以提升多轮智能体的能力,在 TauBench 和 WebShop 上优于现有方法,尤其在有限的轮次预算下表现突出。

0 人收藏 0 人点赞
#multi-turn

ISE:一种基于执行的面向多轮操作系统代理轨迹的合成方案

arXiv cs.CL · 2026-06-11 缓存

本文介绍了一种名为ISE的三阶段合成范式,用于生成带有基于执行的多轮操作系统代理轨迹,并证明在生成的ISE-Trace数据集上进行微调能显著提升代理在ClawEval上的性能。

0 人收藏 0 人点赞
#multi-turn

IntentKV: 面向Agent推理的跨轮次意图感知KV缓存剪枝

arXiv cs.LG · 2026-06-10 缓存

IntentKV提出了一种针对多轮LLM Agent的跨轮次意图感知KV缓存剪枝方法,通过维护会话级别的查询记忆来高效剪枝缓存,且不损失精度,显著减少了token使用量和KV读取次数。

0 人收藏 0 人点赞
#multi-turn

捉住五分之一:LLM作为判断器在生产环境多轮交易代理中的盲点

arXiv cs.CL · 2026-06-10 缓存

本文研究了一个部署的LLM作为判断器系统,用于评估多轮对话代理,发现其捕捉到的缺陷远少于人工审查,揭示了一个结构化的盲点分类和路由故障。

0 人收藏 0 人点赞
#multi-turn

用于LLM智能体离线策略评估的自回归扩散世界模型

arXiv cs.LG · 2026-06-05 缓存

提出了Adwm,一种用于LLM智能体离线策略评估的自回归扩散世界模型,能够从预先收集的轨迹中实现可靠的价值估计,无需在线交互。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈