DocOps: 面向复杂文档操作中自主智能体的可验证基准
摘要
本文介绍了DocOps,这是一个确定可验证的基准,用于评估自主智能体在复杂文档操作上的表现,揭示了关键失败模式,如长期状态跟踪崩溃、浅层语义验证以及对结构元数据的破坏性编辑。
查看缓存全文
缓存时间: 2026/07/24 05:07
论文页面 - DocOps:面向复杂文档操作中自主智能体的可验证基准
来源:https://huggingface.co/papers/2607.19865
摘要
随着自主智能体的快速发展,其可靠操控普遍数字文档的能力对于通用AI助手的实现以及复杂工作空间工作流的自动化变得至关重要。在本文中,我们提出了DocOps——一个确定性可验证的评估框架,该框架基于一个分层分类法,将真实世界实践中启发的文档操作分解为原子维度和逐步升级的工作流复杂性。基于DocOps,我们系统性地评估了多种代表性闭源与开源模型在各种智能体框架下的表现,揭示了即使是最先进的前沿配置在处理高度耦合的长程任务时仍存在显著局限。此外,对现有智能体操作行为的细粒度分析揭示了三个关键失败模式:长期状态追踪崩溃、浅层语义验证以及结构元数据的破坏性编辑。最终,我们的工作揭示了智能体在维护全局文档一致性方面的能力边界,为未来面向复杂数字生态系统的鲁棒、非破坏性智能体设计提供了启示。
查看 arXiv 页面 (https://arxiv.org/abs/2607.19865)查看 PDF (https://arxiv.org/pdf/2607.19865)项目页面 (https://docopsbench.github.io/)GitHub2 (https://github.com/icip-cas/DocOps)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.19865)
引用此论文的模型0
尚无模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2607.19865 以从该页面链接。
引用此论文的数据集0
尚无数据集链接此论文
请在数据集 README.md 中引用 arxiv.org/abs/2607.19865 以从该页面链接。
引用此论文的Space0
尚无Space链接此论文
请在 Space README.md 中引用 arxiv.org/abs/2607.19865 以从该页面链接。
包含此论文的收藏集0
尚无收藏集包含此论文
将本论文添加到一个收藏集 (https://huggingface.co/new-collection) 以从该页面链接。
相似文章
DocScope:用于值得信赖的长文档理解的可靠推理基准测试
DocScope 是一个新的基准测试,旨在评估多模态大语言模型在长文档上的可靠推理能力和可信度,引入了包含页面定位、区域定位、事实提取和答案验证四个阶段的评估协议。
@omarsar0: // 代理并非单独失败 // 一款非常棒的开源评估工具,用于检查代理的可靠性。里面有很多酷点子。…
本文介绍了ProofAgent-Harness,这是一款开源评估工具,从七个标准衡量AI代理的上下文工程质量,并将其验证为代理可靠性的领先指标。
Show HN: Dari-docs – 使用并行编码代理优化你的文档
dari-docs 是一个 CLI 工具,通过模拟 AI 代理执行任务来测试文档质量,识别代理卡住的地方,并可选择生成改进文档清晰度的编辑建议。
超越 Goodhart's Law:用于评估多智能体系统合规性的动态基准
本文介绍了 MAC-Bench,一个用于评估多智能体系统程序合规性的动态对抗基准。它提出了 SERV 流水线以生成无污染场景,以及新的指标如合规加权成功率 (CSR) 和马基雅维利差距 (MG)。
IDP AutoOpt:文档处理流水线配置的智能体驱动优化
本文介绍了IDP AutoOpt,一个自主的LLM智能体,用于优化智能文档处理流水线配置,以更低的成本达到或超过人类专家的准确率,并将配置时间从数周缩短至两小时以内。