DocOps: 面向复杂文档操作中自主智能体的可验证基准

Hugging Face Daily Papers 论文

摘要

本文介绍了DocOps,这是一个确定可验证的基准,用于评估自主智能体在复杂文档操作上的表现,揭示了关键失败模式,如长期状态跟踪崩溃、浅层语义验证以及对结构元数据的破坏性编辑。

随着自主智能体的快速发展,它们可靠地操作无处不在的数字文档的能力对于实现通用AI助手和自动化复杂的工作空间工作流程变得至关重要。在本文中,我们介绍了DocOps,这是一个确定可验证的评估框架,其基础是一个分层分类法,该方法将受真实世界实践启发的文档操作分解为原子维度和不断升级的工作流复杂性。基于DocOps,我们系统地评估了各种智能体框架中具有代表性的闭源和开源模型,揭示出即使是最先进的前沿配置在处理高度耦合、长程任务时仍然表现出深刻的局限性。此外,对现有智能体操作行为的细粒度分析揭示了三种关键失败模式:长期状态跟踪崩溃、浅层语义验证以及对结构元数据的破坏性编辑。最终,我们的工作暴露了智能体在维护全局文档一致性方面的能力边界,为未来复杂数字生态系统中稳健、非破坏性智能体的设计提供了启示。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:07

论文页面 - DocOps:面向复杂文档操作中自主智能体的可验证基准

来源:https://huggingface.co/papers/2607.19865

摘要

随着自主智能体的快速发展,其可靠操控普遍数字文档的能力对于通用AI助手的实现以及复杂工作空间工作流的自动化变得至关重要。在本文中,我们提出了DocOps——一个确定性可验证的评估框架,该框架基于一个分层分类法,将真实世界实践中启发的文档操作分解为原子维度和逐步升级的工作流复杂性。基于DocOps,我们系统性地评估了多种代表性闭源与开源模型在各种智能体框架下的表现,揭示了即使是最先进的前沿配置在处理高度耦合的长程任务时仍存在显著局限。此外,对现有智能体操作行为的细粒度分析揭示了三个关键失败模式:长期状态追踪崩溃、浅层语义验证以及结构元数据的破坏性编辑。最终,我们的工作揭示了智能体在维护全局文档一致性方面的能力边界,为未来面向复杂数字生态系统的鲁棒、非破坏性智能体设计提供了启示。

查看 arXiv 页面 (https://arxiv.org/abs/2607.19865)查看 PDF (https://arxiv.org/pdf/2607.19865)项目页面 (https://docopsbench.github.io/)GitHub2 (https://github.com/icip-cas/DocOps)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.19865)

引用此论文的模型0

尚无模型链接此论文

请在模型 README.md 中引用 arxiv.org/abs/2607.19865 以从该页面链接。

引用此论文的数据集0

尚无数据集链接此论文

请在数据集 README.md 中引用 arxiv.org/abs/2607.19865 以从该页面链接。

引用此论文的Space0

尚无Space链接此论文

请在 Space README.md 中引用 arxiv.org/abs/2607.19865 以从该页面链接。

包含此论文的收藏集0

尚无收藏集包含此论文

将本论文添加到一个收藏集 (https://huggingface.co/new-collection) 以从该页面链接。

相似文章