从可运行到可交付:基于多智能体测试驱动开发从需求生成全栈Web应用

Hugging Face Daily Papers 论文

摘要

TDDev通过整合需求分析、基于浏览器的验证和结构化修复,自动化Web应用生成的测试驱动开发,将代码质量相比基线提升34-48个百分点,并将人工干预减少到零。

编码智能体可以从自然语言描述生成Web应用,然而最近的基准研究表明,生成的应用在超过70%的情况下未能满足功能需求。核心难点在于,Web正确性无法通过源文件或终端输出来评估:必须部署应用,通过模拟的浏览器交互进行测试,并将失败转化为可执行的修复信号——这些步骤当前智能体在没有人工介入的情况下无法执行。 我们提出了TDDev,一个通过三个阶段自动化这一闭环的框架:(1)在编写任何代码之前将高层次需求转化为结构化验收测试,(2)部署应用并通过基于浏览器的交互模拟进行验证,(3)将浏览器观察到的失败转化为供编码智能体使用的结构化修复报告。借助TDDev,我们首次对Web应用生成的测试驱动开发(TDD)策略进行了受控实证研究,比较了两种编码智能体、两种骨干模型和两个基准上的四种开发协议。TDD基础设施持续将生成质量相比无TDD基线提升34-48个百分点。核心发现是,最优协议取决于模型的生成风格:整体构建应用的模型从代理式强制执行中获益最多,而保守扩展代码的模型则从增量式强制执行中获益。协议与生成风格不匹配会完全消除TDD的收益,同时将token成本增加高达25倍。一项用户研究证实,TDDev将开发者的人工干预减少到零,将工作负载从持续的提示工程转变为自主的、反馈驱动的优化。
查看原文
查看缓存全文

缓存时间: 2026/05/19 06:30

论文页面 - 从可运行到可交付:面向多智能体的测试驱动开发,从需求生成全栈 Web 应用

来源: https://huggingface.co/papers/2605.17242

摘要

TDDev 自动实现 Web 应用生成的测试驱动开发,通过集成需求分析、基于浏览器的验证和结构化的修复报告,提升代码质量并减少人工干预。

编码代理 (https://huggingface.co/papers?q=Coding%20agents) 能够根据自然语言描述生成 Web 应用,然而近期一项基准研究表明,超过 70% 的生成应用未能满足功能需求。核心困难在于 Web 的正确性无法从源文件或终端输出中评估:必须部署应用、通过模拟浏览器交互进行测试,并将失败转化为可操作的修复信号 —— 当前代理在无人工介入的情况下无法执行这些步骤。我们提出 TDDev,一个通过三个阶段自动实现这一闭环的框架:(1) 在编写任何代码之前,将高层需求转化为结构化验收测试 (https://huggingface.co/papers?q=structured%20acceptance%20tests);(2) 部署应用并通过基于浏览器的交互模拟 (https://huggingface.co/papers?q=browser-based%20interaction%20simulation) 进行验证;(3) 将浏览器观察到的失败转化为结构化的修复报告 (https://huggingface.co/papers?q=structured%20repair%20reports),供编码代理使用。借助 TDDev,我们首次对 Web 应用生成 (https://huggingface.co/papers?q=web%20application%20generation) 中的测试驱动开发 (https://huggingface.co/papers?q=Test-driven%20development) (TDD) 策略进行了受控实证研究,在两个编码代理 (https://huggingface.co/papers?q=coding%20agents)、两个骨干模型和两个基准上比较了四种开发协议。TDD 基础设施在无 TDD 基线上持续提升 34-48 个百分点的生成质量。核心发现是:最优协议取决于模型的生成风格——整体构建应用的模型最受益于代理式强制执行,而保守扩展代码的模型最受益于增量式强制执行。协议与生成风格不匹配会完全消除 TDD 的收益,同时将令牌成本提升至 25 倍。用户研究证实,TDDev 将人工干预减少至零,将工作负载从持续提示工程转变为自主、反馈驱动 (https://huggingface.co/papers?q=feedback-driven%20refinement) 的精炼。

查看 arXiv 页面 (https://arxiv.org/abs/2605.17242) 查看 PDF (https://arxiv.org/pdf/2605.17242) 项目页面 (https://huggingface.co/papers/2605.17242) GitHub (https://github.com/yxwan123/TDDev) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.17242)

在你的代理中获取这篇论文:

hf papers read 2605\.17242

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用该论文的模型

无模型链接该论文

在模型的 README.md 中引用 arxiv.org/abs/2605.17242,即可从本页面链接。

引用该论文的数据集

无数据集链接该论文

在数据集的 README.md 中引用 arxiv.org/abs/2605.17242,即可从本页面链接。

引用该论文的 Space

无 Space 链接该论文

在 Space 的 README.md 中引用 arxiv.org/abs/2605.17242,即可从本页面链接。

包含该论文的收藏

无收藏包含该论文

将该论文添加到一个收藏 (https://huggingface.co/new-collection) 中,即可从本页面链接。

相似文章

重温 Joel's Test - exe.dev 博客

Lobsters Hottest

本文重新审视了 Joel's Test 用于软件团队,并介绍了 Shelley Test,该测试增加了与 AI 智能体、agentic 代码审查、由 LLM 智能体监督的持续部署以及其他现代实践相关的问题,以评估 AI 时代高性能的开发团队。

我的智能体技能:测试驱动开发

Hacker News Top

作者分享了一项适用于AI智能体的测试驱动开发技能,旨在改进测试编写,基于Kent Beck的Canon TDD,并提供了GitHub链接。