OpenBioRQ:面向智能体的未解决生物医学研究问题

Hugging Face Daily Papers 论文

摘要

OpenBioRQ 是一个包含12,553个未解决生物医学研究问题的新基准,用于测试智能体模型验证来源和避免虚假引用的能力。该基准揭示,当前模型经常链接到错误的论文,并在难题上出现智能体崩溃。

一个有效的引用看起来像是证据——但链接可用并不意味着引用的论文支持该主张。我发现当前的智能体模型很少伪造引用(超过99%的链接可解析),但大约15.9%的链接指向了错误的论文。现有基准未能捕捉到这种失败模式:当问题有固定答案键时,模型可以从该键中复现预期的来源,而非独立验证该来源是否支持主张。我引入了\openbiorq{},这是一个基于检索的智能体基准,包含12,553个跨越12个领域的未解决生物医学研究问题,将开放问题视为忠实性与弃权探针。据我所知,这是第一个将智能体设置(模型必须发出多个工具调用)与无答案键的未解决问题相结合的生物医学基准。开放性通过真实的后续证据进行验证,而非模型的参数化知识。难度是经验性的:我将其锚定在三个开放权重参考模型无法回答的问题上,而非主观的难度标签。在这个最难的子集上,与难度锚点同系列的保留模型仅能解决约17%,而三个独立的前沿智能体(Gemini-3-Pro、Opus-4.7、GPT-5.5)则分布在一个宽广的29-60%范围内。因此,该基准是困难的、非饱和的(最佳智能体仍留下约33-40\%未解决),并且能够区分不同能力层级。除了难度之外,我观察到在最难的问题上出现了智能体崩溃,即智能体停止使用它们的工具。对于最容易崩溃的模型,完全阻止工具访问几乎不改变其得分——因此工具在最需要它们的地方恰恰失去了作用。一个冻结的每问题检查表将评判者间一致性从Spearman 0.35提高到0.82。
查看原文
查看缓存全文

缓存时间: 2026/06/26 06:05

论文页面 - OpenBioRQ: 面向智能体的未解生物医学研究问题

来源:https://huggingface.co/papers/2606.21959

摘要

一项新的生物医学基准测试评估了智能体模型验证信息来源和避免虚假引用的能力,它通过测试没有标准答案的未解研究问题,揭示了模型在基于检索的推理和工具使用方面存在的显著缺陷。

一个正常的引用看起来像是证据——但链接能打开并不意味着被引论文支持该论断。我发现,当前的智能体模型(https://huggingface.co/papers?q=agentic%20models)几乎从不捏造引用(超过99%能打开),但大约15.9%的链接指向了错误的论文。现有基准测试忽略了这种失败模式:当问题有固定答案键(https://huggingface.co/papers?q=answer%20key)时,模型可以重现该答案键中预期的来源,而非独立验证该来源是否支持论断。为此,我提出了\openbiorq{}——一个基于检索的智能体基准测试,包含12{,}553个跨越12个领域的未解生物医学研究问题(https://huggingface.co/papers?q=biomedical%20research%20questions),它将开放性问题作为忠实性和弃权探针。据我所知,这是第一个将智能体设定(模型必须进行多次工具调用)与没有答案键(https://huggingface.co/papers?q=answer%20key)的未解问题相结合的生物医学基准。开放性是根据真实的后续证据来验证的,而非模型自身的参数化知识。难度是经验性的:我将难度锚定在三个开源参考模型无法回答的问题上,而不是基于主观的难度标签。在这个最难的数据子集上,与难度锚定模型同系列的保留模型仅能解决约17%的问题,而三个独立的前沿智能体(https://huggingface.co/papers?q=frontier%20agents)(Gemini-3-Pro、Opus-4.7、GPT-5.5)表现差异很大,范围为29-60%。因此,该基准难度高、未饱和(最佳智能体仍有约33-40%的问题未解决),并且能够区分不同能力层级。除了难度之外,我还在最难问题上观察到了智能体坍缩(https://huggingface.co/papers?q=agentic%20collapse)现象,即智能体停止使用工具。对于最容易坍缩的模型,完全阻止工具访问后,其得分几乎没有变化——因此,恰恰在最需要工具的地方,工具却不再带来收益。冻结的每问题检查清单将评判者间的一致性从斯皮尔曼0.35提升至0.82。

查看arXiv页面(https://arxiv.org/abs/2606.21959)查看PDF(https://arxiv.org/pdf/2606.21959)项目页面(https://minstar.github.io/OpenBioRQ/)GitHub1(https://github.com/minstar/healthcare-research)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.21959)

在你的智能体中使用这篇论文:

hf papers read 2606\.21959

没有最新版CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型链接此论文

在模型README.md中引用arxiv.org/abs/2606.21959以从此页面建立链接。

引用此论文的数据集0

无数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2606.21959以从此页面建立链接。

引用此论文的Space0

无Space链接此论文

在Space README.md中引用arxiv.org/abs/2606.21959以从此页面建立链接。

包含此论文的收藏0

无收藏包含此论文

将此论文添加至收藏(https://huggingface.co/new-collection)以从此页面建立链接。

相似文章

ResearchQA:科学论文中基于引用的问答基准测试

arXiv cs.CL

ResearchQA是一个新基准,包含来自八个领域494篇开放获取论文的6,211个单论文问答对,旨在通过要求可验证引用并在证据不足时支持基于理由的拒绝,来评估基于引用的问答能力。

当检索无济于事:一项大规模生物医学 RAG 研究

arXiv cs.CL

这项大规模研究涵盖 5 个模型(7B–72B)、10 个生物医学问答数据集、4 种检索方法和 4 个语料库,发现在生物医学问答任务中,RAG 相比无检索基线仅带来微小且不稳定的提升(1–2 个百分点)。研究得出结论:主要瓶颈并非检索质量,而是模型有效利用检索证据的能力有限。