标签
KC-Bench 是一个动态交互式基准,用于评估LLM智能体如何检测和解决用户指令、参数知识与环境观察之间的知识冲突,评估显示没有模型能可靠地处理所有冲突类型。
本文介绍了反馈感知信用分配(Faca),通过利用下一用户轮次的反应作为局部信用信号来改进多轮工具使用语言代理,在交互式基准测试上显示出显著的性能提升。
本文介绍了Alien Abduction,一个交互式游戏,用于探究大语言模型在溯因推理中如何获取证据、更新假设以及决定何时停止。研究发现,与自行选择查询相比,模型在预先提供证据和由oracle提供示例的情况下表现更好,揭示了其在主动信息获取方面的不足。
本文介绍了 CanvasCraft,一个用于复杂图像创建与编辑的大规模多模态工具使用数据集,以及 CanvasAgent,一个通过多轮交互和混合奖励优化来学习编排异构视觉工具的工具增强型多模态智能体。
本文提出了一种知识增强的中医视觉诊断系统,该系统使用Neo4j知识图谱、四阶段症状匹配流程以及信息增益驱动的主动提问策略,以提升透明度和可解释性。结果表明,该显著提高了诊断信任度并降低了认知负荷。
StepPO 引入了一种面向智能体强化学习的步骤中心范式,该范式将策略优化与智能体决策粒度对齐,在多轮交互任务中优于以令牌为中心的方法。
本文介绍了 BALAR,这是一种无需训练的贝叶斯智能体循环算法,使大型语言模型能够在多轮交互中进行主动推理并提出澄清性问题。该算法在侦探、谜题和临床诊断基准测试中显示出比基线方法显著的性能提升。