ICAE-Bench:评估作为交互式项目构建者的编码智能体

Hugging Face Daily Papers 论文

摘要

介绍ICAE-Bench,一个用于在交互式项目构建环境中评估编码智能体的基准测试,通过自动化用户智能体模拟模糊产品需求,并整合标准化黑盒测试和多维度诊断。

近期兴起的vibe-coding工作流程正在改变编码智能体的预期任务。智能体不再仅仅需要在完全明确的指令下完成代码编写,而是越来越多地需要将不完整的产品意图转化为可工作的软件,这就要求结合规划、需求澄清、工具使用、调试以及仓库级别构建等多种能力。然而,现有的基准测试尚未完全跟上这一转变,它们仍基于静态且完全明确的任务来评估智能体。 在本文中,我们介绍了ICAE-Bench,一个用于在交互式项目构建环境中评估编码智能体的基准测试。其基本理念是从一个模糊的产品需求开始,通过自动化的用户智能体模拟动态范式。为了使这一设置既真实又可评估,ICAE-Bench引入了三个关键设计。首先,为了避免无约束模糊需求的歧义,每个任务从一个具有可执行行为的精确真实开源仓库中派生歧义。其次,为了确保高质量且可复现的用户模拟,ICAE-Bench通过用户智能体数据来接地交互,使得用户智能体能够在不发明新需求或泄露实现细节的情况下揭示隐藏的约束。第三,为了公平评估开放式的仓库,ICAE-Bench使用标准化的黑盒测试以及多维度诊断,包括功能正确性、语义和API相似性、结构保真度、设计质量和交互质量。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:06

论文页面 - ICAE-Bench: 评估编码代理作为交互式项目构建者

来源: https://huggingface.co/papers/2607.21217

作者:

,

,

,

,

,

,

,

,

,

摘要

近期出现的“氛围编码”工作流正在改变人们对编码代理的期待。编码代理不再仅仅是在完全指定的指令下完成代码,而是越来越多地需要将不完整的产品意图转化为可工作的软件,这需要结合多种能力,包括规划、需求澄清、工具使用、调试以及仓库级别的构建。然而,现有的基准测试尚未完全跟上这一转变,它们仍然在静态、完全指定的任务上评估代理。本文中,我们提出了 ICAE-Bench,这是一个在交互式项目构建环境下评估编码代理的基准测试。基本思路是从一个模糊的产品需求出发,通过自动化用户代理模拟动态范式。为了使这一设置既真实又可评估,ICAE-Bench 引入了三个关键设计。第一,为了避免无约束模糊需求带来的歧义,每个任务都从一个具有可执行行为的精确真实开源仓库中衍生出歧义。第二,为了确保高质量且可复现的用户模拟,ICAE-Bench 通过 UserAgentData 为交互提供依据,使得用户代理能够在不发明新需求或泄露实现细节的情况下揭示隐藏的约束。第三,为了公平地评估开放式仓库,ICAE-Bench 使用标准化的黑盒测试以及多维度诊断,包括功能正确性、语义与 API 相似性、结构忠实度、设计质量以及交互质量。

查看 arXiv 页面 (https://arxiv.org/abs/2607.21217)查看 PDF (https://arxiv.org/pdf/2607.21217)GitHub 仓库 (https://github.com/ALEX-nlp/ICAE-EVAL)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.21217)

在你的代理中获取这篇论文:

hf papers read 2607\.21217

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接到此论文

在模型 README.md 中引用 arxiv.org/abs/2607.21217 即可从本页链接。

引用此论文的数据集0

没有数据集链接到此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.21217 即可从本页链接。

引用此论文的 Spaces0

没有 Space 链接到此论文

在 Space README.md 中引用 arxiv.org/abs/2607.21217 即可从本页链接。

包含此论文的收藏0

没有收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 即可从本页链接。

相似文章

SWE-INTERACT: 将SWE基准重新构想为用户驱动的长期编码会话

Hugging Face Daily Papers

SWE-Interact是一个新的测试平台,用于评估编码智能体在真实的多轮用户驱动软件工程任务中的表现,揭示了强大的单轮基准性能并不能可靠地迁移到交互式、迭代的工作流程中,在这些流程中,智能体必须发现用户意图并适应不断变化的需求。