@HuggingPapers: 自主研究代理无法自我纠正 我们在100个真实前沿研究任务上测试了8种框架-模型组合…

X AI KOLs Following 论文

摘要

本文探讨了对自主研究代理的压力测试,发现失败源于元认知问题,而非能力问题,并介绍了ARFT——一种包含45种模式的故障分类体系。

自主研究代理无法自我纠正 我们在100个真实前沿研究任务(800个轨迹)上测试了8种框架-模型组合。每个失败都归因于元认知,而非能力。引入ARFT:一个包含45种模式的故障分类法。https://t.co/xO9yNK1RUi
查看原文
查看缓存全文

缓存时间: 2026/08/24 05:50

自主研究型智能体无法实现自我纠正

我们对8组智能体框架与模型的组合进行了压力测试,在100项真实前沿研究任务中追踪了800条执行轨迹。所有失败案例的根源在于元认知缺陷,而非能力不足。特此推出自主研究故障分类法(ARFT):包含45种典型故障模式。 https://t.co/xO9yNK1RUi

相似文章

超越自主性:了解自身局限的智能体之力量

Reddit r/AI_Agents

COWCORPUS项目通过对4200次人机交互的研究发现,能够预测自身失败和干预时机的智能体,比那些仅仅试图避免错误的智能体更有用。研究人员识别出人机协作中四种稳定的信任模式,并开发了完美时机评分(PTS)来衡量干预预测的准确性。

我们距离真正的自动研究还有多远?

arXiv cs.AI

本文介绍了ResearchArena,一个用于评估自动研究智能体的框架,并发现虽然智能体生成的论文在仅稿件评审下看似具有竞争力,但结合工件的评审揭示了实验严谨性方面的严重缺陷,没有一篇论文达到顶级会议的接收标准。