智能体制品创建:系统、评估、原则与机遇

Hugging Face Daily Papers 论文

摘要

本综述将智能体制品创建定义为AI系统进行的有状态、反馈驱动的交付成果构建,并分析了259篇作品以提出可问责控制的原则。

生成模型可以将自然语言提示转化为图像、文本、代码等内容,降低制作草稿和组件的成本。它们的实际影响越来越取决于这些片段能否成为完整、可靠的交付成果。本综述探讨智能体制品创建,我们将其定义为一种有状态的构建过程,其中AI系统实质构建或修订交付成果,中间观察重定向后续工作。从功能上讲,该过程链接了制品的运行表示、构建策略以及运行时验证,其反馈可以重定向后续操作。我们回顾了截至2026年8月20日的259篇作品:其中230个系统符合此定义,29个基准测试用于智能体制品构建。我们比较了六类制品,然后将应用场景和评估实践作为独立维度进行分析。在各类制品中,构建挑战不仅反映了模态,还反映了决策的耦合程度以及故障是否在可修复时变得可见。分解可以降低局部复杂度,同时增加协调和重组成本。当学习型评判者与生成器的偏好或盲点共享时,可能提供很少的独立证据。我们制定了原则,以保持承诺和责任明确,将反馈转化为针对性修复,并在更改后重新验证受影响状态。我们还识别了随着制品、创作者意图和构建系统演进,维持连贯、可问责控制的机会。精选论文列表可在 https://github.com/GeminiLight/awesome-agentic-artifact-creation 获取。
查看原文
查看缓存全文

缓存时间: 2026/09/01 12:05

论文页面 - 智能体工件创建:系统、评估、原则与机遇

来源:https://huggingface.co/papers/2608.28122 发布于 8月28日

#3 当日第三篇论文 (https://huggingface.co/papers/date/2026-08-31) 作者:

,

,

,

,

,

,

,

,

,

,

摘要

本综述将智能体工件创建定义为AI系统进行的、有状态的、反馈驱动的交付物构建过程,并分析了259篇涵盖不同工件类别、应用场景和评估实践的研究成果,提出了实现可问责控制的原则。

生成模型 (https://huggingface.co/papers?q=Generative%20models)可以将自然语言提示转化为图像、文本、代码及其他内容,降低了起草和制作组件的成本。其实际影响越来越取决于这些内容能否转化为完整、可靠的交付物。本综述考察了智能体工件创建,我们将其定义为一种有状态的构建过程,其中AI系统实质性地构建或修改交付物,并通过中间观察结果来调整后续工作。从功能上看,该过程将工件的运行时表示、构建策略以及运行时验证联系起来,验证反馈可以引导后续操作。我们梳理了截至2026年8月20日可获取的259篇文献:其中230个系统符合此定义,另有29个基准测试针对智能体工件构建。我们比较了六种工件类别,并分别分析了应用场景和评估实践。跨类别来看,构建挑战不仅反映在模态差异上,也体现在决策耦合程度以及故障是否在可修复阶段显现。分解能降低局部复杂度,但会增加协调与重组成本。当学习型评判器与生成器共享偏好或盲区时,它们可能难以提供独立的评估依据。我们提出了若干原则:保持承诺与责任的明确性,将反馈转化为针对性的修复,并在变更后重新验证受影响的状态。此外,我们还探讨了随着工件、创建者意图和构建系统的演进,如何维持连贯、可问责的控制。相关论文精选列表可在 https://github.com/GeminiLight/awesome-agentic-artifact-creation 获取。

查看 arXiv 页面 (https://arxiv.org/abs/2608.28122)查看 PDF (https://arxiv.org/pdf/2608.28122)项目页面 (https://agentic-creation.github.io/)GitHub14 (https://github.com/GeminiLight/awesome-agentic-artifact-creation)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.28122)

在你的智能体中获取此论文:

hf papers read 2608\.28122

没有最新的 CLI?运行 curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

暂无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.28122 即可从此页面链接至该模型。

引用此论文的数据集0

暂无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.28122 即可从此页面链接至该数据集。

引用此论文的 Spaces0

暂无 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2608.28122 即可从此页面链接至该 Space。

包含此论文的合集3

相似文章

代理操作系统将需要在AI之下设置审计层

Reddit r/artificial

这篇文章探讨了代理操作系统的潜在设计,用户描述所需结果而非直接与程序交互,并提出了对信任、隐私、不透明决策以及供应商锁定的担忧。