@noisyb0y1:牛津大学和Anthropic花费670万美元和4年时间——发现为何90%的智能体在复杂任务中失败——大多数智能体存储事实…
摘要
一项牛津大学与Anthropic的联合研究,历时4年耗资670万美元,发现90%的AI智能体在复杂任务中失败,因为它们存储事实但丢失连接;使用基于图的方法使任务成功率提升42%,非必要调用减少33%,研究准确性提高39%。
查看缓存全文
缓存时间: 2026/07/21 06:40
牛津大学与Anthropic花费670万美元、历时4年,终于发现90%的代理为何在处理复杂任务时失败
多数代理能存储事实,但丢失了连接——而这些连接恰恰决定了复杂任务的质量
测试超过8750项任务:任务成功率提升42%,不必要调用减少33%,研究准确率提升39%
图不仅仅知道它知道什么,还知道它有多自信——任何列表都无法做到这一点
一个代理若上下文固定,会逐渐退化;一个代理若拥有图结构,能持续积累经验,每次迭代都变得更好
收藏并阅读下方文章——明天就开始构建你的第一个图工程
相似文章
@Sprytixl: 斯坦福和Anthropic花费310万美元证明你的智能体表现比应有水平差42%——并找到了解决方案 大多数智能体…
斯坦福和Anthropic的研究表明,采用基于图记忆的AI智能体比未采用的智能体性能提升42%,代码准确率提高36%,研究效率提高45%。
@rohanpaul_ai: Anthropic新研究表明,AI智能体在代码方面可能表现卓越,但在生物学领域,它们可能在科学工作开始之前就失败……
Anthropic的研究揭示,AI智能体在生物学数据库方面存在困难,对同一个查询会产生高度差异的答案(例如,埃博拉序列计数范围从5到106,而预期为266),但添加一个可重复的检索工具能显著提高一致性和准确性。
@zodchiii:三位Anthropic工程师花了16分钟讨论AI智能体在生产中真正成功的要素。如果这些人…
Anthropic工程师分享了让AI智能体在生产中成功落地的见解,重点介绍了他们在Claude项目中验证的有效模式。
每个人都关注他们的智能体是否完成任务,但几乎没人问它是否在随着时间的推移变得更好
文章指出了AI智能体开发中一个常见的忽视点:虽然大多数团队会监控任务完成情况,但很少有系统能够捕获失败模式并将其反馈到未来的运行中,从而实现学习和持续改进。
@0xNoryxx: 斯坦福大学花费2年时间和9,842个任务证明:循环工程+图记忆是构建智能体的唯一途径……
一项涵盖9,842个任务的斯坦福研究表明,将循环工程与图记忆相结合,可生成比标准智能体性能高出38.6%的AI智能体,不必要的工具调用减少24.1%,延迟降低21.7%。