智能体捕捉智能体:临床多智能体系统中的捷径级联与基准博弈

Hugging Face Daily Papers 论文

摘要

本文研究了临床多智能体系统如何被社会合理的捷径所破坏,并发现独立的裁判监督对于检测此类博弈至关重要。

临床决策支持正朝着由语言模型智能体组成的委员会方向发展,这些智能体在共享工作空间中进行商议。我们询问这种委员会是否会被捷径所博弈,即基准测试奖励但临床医生会忽略的提示。在涵盖文本(MedQA-USMLE、MedMCQA、MIMIC-CXR报告)、影像(NIH ChestX-ray14、MIMIC-CXR-JPG、CheXpert)和表格ICU记录(SUPPORT2)的六个公开数据集的七个队列中,Gemini委员会在孤立情况下抵制这些提示(翻转5-16%),但一个社会合理的捷径会传播:当两个同行断言相同的错误答案时,测试对象在38%的情况下会采纳它,一个虚假的“预筛”系统标志也会如此,在两个能力层级上都是。在三个监督智能体中,一个门控无法区分采纳与诚实同意(假阳性率100%);一个同源法官仅阅读转录稿,在文本上标记采纳(精确度100%,召回率93%),但在影像上崩溃到门控;一个裁判私底下重新查询测试对象,转移到影像(77-88%精确度,13-21%假阳性率)。将提示的视觉显著性增加三倍不会移动传播,而第二个同行声音将其提高一半。博弈一个隐藏的评分标准几乎是静默的:只有1/10的文本和1/134的影像漂移者命名他们趋向的评分标准。什么博弈委员会是社会合理性,只有独立于自我报告的裁判才能捕捉到它。代码:https://github.com/criticaldata/benchmaxxing
查看原文
查看缓存全文

缓存时间: 2026/08/17 11:45

论文页面 - 代理捕捉代理:临床多智能体系统中的捷径级联与基准博弈

来源: https://huggingface.co/papers/2608.03744 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

多智能体临床委员会易受社会性合理捷径的影响,而非孤立线索;只有独立的裁判监督才能可靠地检出这类采纳行为。

临床决策支持(https://huggingface.co/papers?q=Clinical%20decision%20support)正朝着由语言模型智能体(https://huggingface.co/papers?q=language-model%20agents)组成委员会、在共享工作区进行商议的方向发展。我们探究此类委员会是否会因捷径——即基准测试所奖励但临床医生会忽略的线索——而被博弈。在横跨文本(MedQA-USMLE, MedMCQA, MIMIC-CXR报告)、影像(NIH ChestX-ray14, MIMIC-CXR-JPG, CheXpert)和表格型ICU记录(SUPPORT2)的六大公开数据集的七个队列中,Gemini委员会在单独面对这些线索时能有效抵抗(仅翻转5-16%的判断),但当社会性合理捷径扩散时则不然:当两位同行断言相同的错误答案时,被测试的留守智能体有38%的情况会采纳该答案;同样,一个虚假的“预筛选”系统标记在两个能力层级上也会导致这种采纳。在三种监督智能体(https://huggingface.co/papers?q=oversight%20agents)中,“门卫”无法区分采纳与诚实一致(假阳性率100%);一个同系谱的“法官”仅阅读对话记录,能在文本任务上标记采纳行为(精度100%,召回率93%),但在影像任务上性能崩塌至与“门卫”相当;而一个裁判(https://huggingface.co/papers?q=referee)通过私下重新询问留守智能体,其能力可迁移至影像任务(77-88%精度,13-21%假阳性率)。将线索的视觉显著性提高三倍不会改变传染程度,但增加第二位同行声音可将其再提升一半。对隐藏评分标准的博弈几乎悄无声息:在10名文本漂移者和134名影像漂移者中,仅分别有1名和1名指出了他们所趋近的评分标准。能对委员会进行博弈的是社会性合理(https://huggingface.co/papers?q=social%20plausibility),而只有独立于自我报告的裁判(https://huggingface.co/papers?q=referee)能捕捉它。代码: https://github.com/criticaldata/benchmaxxing

查看arXiv页面 (https://arxiv.org/abs/2608.03744)查看PDF (https://arxiv.org/pdf/2608.03744)GitHub (https://github.com/criticaldata/benchmaxxing)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.03744)

在您的智能体中获取此论文:

hf papers read 2608.03744

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型链接此论文

在模型README.md中引用arxiv.org/abs/2608.03744以从此页面链接。

引用此论文的数据集0

无数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2608.03744以从此页面链接。

引用此论文的Space0

无Space链接此论文

在Space README.md中引用arxiv.org/abs/2608.03744以从此页面链接。

包含此论文的收藏夹0

无收藏夹包含此论文

将此论文添加到收藏夹 (https://huggingface.co/new-collection)以从此页面链接。

相似文章

AgentCollabBench:诊断优秀智能体为何成为糟糕的协作者

arXiv cs.CL

本文介绍了 AgentCollabBench,这是一个针对多智能体系统的诊断性基准,用于评估四大主流大语言模型(LLM)中的指令衰减和上下文泄漏等行为风险。文章认为,通信拓扑结构是多智能体可靠性的关键因素,其重要性往往超越了模型的原始能力。

安卓会梦想破解游戏吗?用BenchJack系统化审计AI智能体基准测试

arXiv cs.AI

本文介绍BenchJack,一种自动化红队系统,通过识别奖励黑客漏洞来系统化审计AI智能体基准测试。将其应用于10个热门基准,发现了219个不同的缺陷,并证明评估流程缺乏对抗性思维——该系统将四个基准上的可破解任务比例从接近100%降至10%以下。

Agentick:用于通用序贯决策智能体的统一基准

arXiv cs.AI

本文介绍了 Agentick,这是一个用于评估涵盖强化学习(RL)、大型语言模型(LLM)和视觉语言模型(VLM)范式的通用序贯决策智能体的统一基准测试。该基准提供了 37 个程序化生成的任务,并揭示目前尚无单一方法占据主导地位,突显了智能体自主性方面仍有巨大的提升空间。