information-seeking

标签

Cards List
#information-seeking

AISE-Bench:面向学术知识图谱信息检索的全流程精选基准

arXiv cs.AI · 2026-07-24 缓存

本文介绍了AISE-Bench,一个包含1,133个问答对的精选基准,用于评估LLM智能体在学术知识图谱上的多步API规划和基于源的可信摘要。该基准显示,即使是最强的模型也仅达到中等性能,凸显了步骤正确性和可追踪推理方面的挑战。

0 人收藏 0 人点赞
#information-seeking

SearchOS-V1: 迈向稳健的开放域信息检索智能体协作

Hugging Face Daily Papers · 2026-07-16 缓存

介绍SearchOS,一个用于稳健开放域信息检索的多智能体框架,通过新颖的面向搜索的上下文管理(SOCM)系统将搜索进度外化为显式状态,在WideSearch和GISA基准上取得了最先进的结果。

0 人收藏 0 人点赞
#information-seeking

大语言模型在代理式临床推理中的信息寻求失败

arXiv cs.AI · 2026-07-14 缓存

本文为血液肿瘤学中的临床推理开发了一个代理式评估框架,发现大语言模型的主要失败原因在于系统性的信息寻求缺陷,而非知识不足,其错误模式类似于新手临床医生的认知偏差。

0 人收藏 0 人点赞
#information-seeking

一个用于单智能体和多智能体人类-人工智能好奇心生态系统的玩具框架

arXiv cs.AI · 2026-07-08 缓存

本文介绍了一个玩具框架,将好奇心建模为单智能体和多智能体设置下的生态系统,探讨智能体如何权衡即时不确定性减少、成本、延迟回报以及保持问题开放的价值。其目标是为未来的多智能体人工智能发现系统提供参考。

0 人收藏 0 人点赞
#information-seeking

知道何时提问: 分层语言代理的自我门控澄清

arXiv cs.AI · 2026-06-11 缓存

本文提出ActionRating,一种将澄清置于代理的动作空间内,与导航共享一个顺序标尺的公式,实现了两种信息寻求模式(强制性和机会性)。在分层分类法基准测试中,使用9个LLM的实验表明,机会性澄清提高了准确性和信息寻求效率。

0 人收藏 0 人点赞
#information-seeking

Struct-Searcher:基于主体结构思维推进多模态深度信息获取

Hugging Face Daily Papers · 2026-06-05 缓存

Struct-Searcher 引入了一种基于信念修正理论的结构化主体工作流,用于多模态深度信息获取,相较于现有的视觉语言模型和深度研究智能体,实现了显著的准确率提升。

0 人收藏 0 人点赞
#information-seeking

WebShaper:基于信息搜寻形式化的代理式数据合成

Papers with Code Trending · 2025-07-20 缓存

WebShaper 是一个形式化驱动的框架,利用集合论和知识投影(Knowledge Projections)合成信息搜寻数据集,在 GAIA 和 WebWalkerQA 基准测试中,其开源代理达到了最先进的性能。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈