从可运行到可交付:基于多智能体测试驱动开发从需求生成全栈Web应用
摘要
TDDev通过整合需求分析、基于浏览器的验证和结构化修复,自动化Web应用生成的测试驱动开发,将代码质量相比基线提升34-48个百分点,并将人工干预减少到零。
查看缓存全文
缓存时间: 2026/05/19 06:30
论文页面 - 从可运行到可交付:面向多智能体的测试驱动开发,从需求生成全栈 Web 应用
来源: https://huggingface.co/papers/2605.17242
摘要
TDDev 自动实现 Web 应用生成的测试驱动开发,通过集成需求分析、基于浏览器的验证和结构化的修复报告,提升代码质量并减少人工干预。
编码代理 (https://huggingface.co/papers?q=Coding%20agents) 能够根据自然语言描述生成 Web 应用,然而近期一项基准研究表明,超过 70% 的生成应用未能满足功能需求。核心困难在于 Web 的正确性无法从源文件或终端输出中评估:必须部署应用、通过模拟浏览器交互进行测试,并将失败转化为可操作的修复信号 —— 当前代理在无人工介入的情况下无法执行这些步骤。我们提出 TDDev,一个通过三个阶段自动实现这一闭环的框架:(1) 在编写任何代码之前,将高层需求转化为结构化验收测试 (https://huggingface.co/papers?q=structured%20acceptance%20tests);(2) 部署应用并通过基于浏览器的交互模拟 (https://huggingface.co/papers?q=browser-based%20interaction%20simulation) 进行验证;(3) 将浏览器观察到的失败转化为结构化的修复报告 (https://huggingface.co/papers?q=structured%20repair%20reports),供编码代理使用。借助 TDDev,我们首次对 Web 应用生成 (https://huggingface.co/papers?q=web%20application%20generation) 中的测试驱动开发 (https://huggingface.co/papers?q=Test-driven%20development) (TDD) 策略进行了受控实证研究,在两个编码代理 (https://huggingface.co/papers?q=coding%20agents)、两个骨干模型和两个基准上比较了四种开发协议。TDD 基础设施在无 TDD 基线上持续提升 34-48 个百分点的生成质量。核心发现是:最优协议取决于模型的生成风格——整体构建应用的模型最受益于代理式强制执行,而保守扩展代码的模型最受益于增量式强制执行。协议与生成风格不匹配会完全消除 TDD 的收益,同时将令牌成本提升至 25 倍。用户研究证实,TDDev 将人工干预减少至零,将工作负载从持续提示工程转变为自主、反馈驱动 (https://huggingface.co/papers?q=feedback-driven%20refinement) 的精炼。
查看 arXiv 页面 (https://arxiv.org/abs/2605.17242) 查看 PDF (https://arxiv.org/pdf/2605.17242) 项目页面 (https://huggingface.co/papers/2605.17242) GitHub (https://github.com/yxwan123/TDDev) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.17242)
在你的代理中获取这篇论文:
hf papers read 2605\.17242
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型
无模型链接该论文
在模型的 README.md 中引用 arxiv.org/abs/2605.17242,即可从本页面链接。
引用该论文的数据集
无数据集链接该论文
在数据集的 README.md 中引用 arxiv.org/abs/2605.17242,即可从本页面链接。
引用该论文的 Space
无 Space 链接该论文
在 Space 的 README.md 中引用 arxiv.org/abs/2605.17242,即可从本页面链接。
包含该论文的收藏
无收藏包含该论文
将该论文添加到一个收藏 (https://huggingface.co/new-collection) 中,即可从本页面链接。
相似文章
在发布变更之前,你是如何测试智能体的?
作者介绍了一种智能体回归测试工具,帮助开发人员在代码变更后验证工具调用及工作流执行结果。
重温 Joel's Test - exe.dev 博客
本文重新审视了 Joel's Test 用于软件团队,并介绍了 Shelley Test,该测试增加了与 AI 智能体、agentic 代码审查、由 LLM 智能体监督的持续部署以及其他现代实践相关的问题,以评估 AI 时代高性能的开发团队。
@zachlloydtweets: https://x.com/zachlloydtweets/status/2071670840660533393
Zach Lloyd详细介绍了如何在云软件工厂中构建一个规范驱动的开发代理,通过使用分流代理和规范代理来处理模糊或复杂的问题,在实施前生成产品和技术规范。
我的智能体技能:测试驱动开发
作者分享了一项适用于AI智能体的测试驱动开发技能,旨在改进测试编写,基于Kent Beck的Canon TDD,并提供了GitHub链接。
我构建了一个从规格到交付软件的AI代理 - 完整流程演示
作者演示了JackHamr平台,该平台上的自主AI代理从规格到部署构建深色模式切换功能,包含审批关卡和子代理任务。