标签
本文介绍了DocOps,这是一个确定可验证的基准,用于评估自主智能体在复杂文档操作上的表现,揭示了关键失败模式,如长期状态跟踪崩溃、浅层语义验证以及对结构元数据的破坏性编辑。
一项牛津大学与Anthropic的联合研究,历时4年耗资670万美元,发现90%的AI智能体在复杂任务中失败,因为它们存储事实但丢失连接;使用基于图的方法使任务成功率提升42%,非必要调用减少33%,研究准确性提高39%。
一位用户分享了对本地AI模型的挫败感,尽管在Vast.ai试用了花费超过400美元,却发现只有Claude Opus能有效处理复杂任务,如分析260页的PDF和Dropbox数据。
Claude Opus 4.7 reportedly handles complex programming tasks autonomously, allowing users to delegate without constant oversight based on early internal feedback.