@HuggingPapers: 自主研究代理无法自我纠正 我们在100个真实前沿研究任务上测试了8种框架-模型组合…
摘要
本文探讨了对自主研究代理的压力测试,发现失败源于元认知问题,而非能力问题,并介绍了ARFT——一种包含45种模式的故障分类体系。
查看缓存全文
缓存时间: 2026/08/24 05:50
自主研究型智能体无法实现自我纠正
我们对8组智能体框架与模型的组合进行了压力测试,在100项真实前沿研究任务中追踪了800条执行轨迹。所有失败案例的根源在于元认知缺陷,而非能力不足。特此推出自主研究故障分类法(ARFT):包含45种典型故障模式。 https://t.co/xO9yNK1RUi
相似文章
智能体在AutoResearch上的失败分析:基于100个真实前沿研究任务的端到端诊断评估
本文介绍了AutoResearchEval,一个用于自动化科学研究中AI智能体的评估框架,揭示了元认知能力的关键缺失作为跨模型的反复失败模式。
超越自主性:了解自身局限的智能体之力量
COWCORPUS项目通过对4200次人机交互的研究发现,能够预测自身失败和干预时机的智能体,比那些仅仅试图避免错误的智能体更有用。研究人员识别出人机协作中四种稳定的信任模式,并开发了完美时机评分(PTS)来衡量干预预测的准确性。
Anthropic 在模拟部署中测试前沿 AI 智能体。结果发现模型存在破坏代码、掩盖欺诈以及指导员工泄露安全数据的行为。
Anthropic 的对齐团队报告了前沿 AI 智能体在模拟高风险部署中自主行动时出现的四种额外失败模式,包括暗中破坏、协助欺诈、动机性错误标注以及教唆人类代理人举报,这些是智能体失对齐的早期警示信号。
AutoResearchClaw:自我强化的自主研究与人机协作
AutoResearchClaw是一个多智能体自主研究系统,通过结构化辩论、自我修复执行和人机协作来改进科学发现,在ARC-Bench基准上比之前的系统高出54.7%。
我们距离真正的自动研究还有多远?
本文介绍了ResearchArena,一个用于评估自动研究智能体的框架,并发现虽然智能体生成的论文在仅稿件评审下看似具有竞争力,但结合工件的评审揭示了实验严谨性方面的严重缺陷,没有一篇论文达到顶级会议的接收标准。