SWE-Review:通过智能体代码审查实现问题解决的闭环

Hugging Face Daily Papers 论文

摘要

本文介绍了SWE-Review,这是一个通过迭代的智能体审查和修订循环来闭环AI生成的拉取请求的框架,从而提高了代码质量和问题解决能力。实验结果表明,它优于单轮审查,并实现了有效的测试时扩展。

代码智能体越来越多地为实际软件问题生成拉取请求(PR),但一次性PR生成仍然是开环的:PR在提出时没有经过系统的审查、诊断或修订。我们引入了SWE-Review,这是一个通过智能体代码审查来闭环这一流程的框架。给定一个问题和一个AI生成的PR,审查智能体会探索代码仓库,决定PR是否应该被接受,并提供结构化的反馈以便修订。我们使用提出的SWE-Review-Bench来评估这一设置,以衡量审查的正确性和下游修订的有用性。我们进一步整理了SWE-Review-Traj数据集,以研究智能体审查的更广泛应用,并填补开放审查员训练的数据稀缺空白。实验表明,智能体审查通过生成-审查-修订循环持续改进PR,在决策准确性和修订后解决率方面均优于单轮固定上下文的审查,其能力超越审查本身,可改进问题解决模型,并实现了有效且高效的测试时扩展。这些结果将智能体代码审查定位为一种实用机制,可将AI编码智能体从一次性PR生成推向闭环问题解决。
查看原文
查看缓存全文

缓存时间: 2026/07/09 07:53

论文页面 - SWE-Review: 借助代理式代码审查闭环解决问题

来源:https://huggingface.co/papers/2607.06065

摘要

代理式代码审查框架通过迭代的审查与修订循环,增强人工智能生成的拉取请求,同时提升代码质量与问题解决能力。

编程智能体越来越多地为现实世界的软件问题生成拉取请求(PR),然而一次性 PR 生成仍然是开环的:PR 在提出时缺乏系统的审查、诊断或修订。我们提出 SWE-Review,一个通过代理式代码审查(https://huggingface.co/papers?q=agentic%20code%20review)来闭环这一过程的框架。给定一个问题和一个 AI 生成的 PR,审查智能体会探索仓库,决定该 PR 是否应被接受,并提供结构化的反馈用于修订。我们使用提出的 SWE-Review-Bench 评估这一设置,以衡量审查正确性(https://huggingface.co/papers?q=review%20correctness)以及下游的修订有用性(https://huggingface.co/papers?q=revision%20usefulness)。我们还进一步整理了 SWE-Review-Traj 数据集,以研究代理式审查的更广泛应用,并填补开放审查训练中的数据稀缺缺口。实验表明,代理式审查通过“生成-审查-修订“循环(https://huggingface.co/papers?q=generate-review-revise%20loop)持续改进 PR,在决策准确率和修订后的解决率上均优于单轮固定上下文的审查,其能力可迁移至改进问题解决模型,并实现高效且有效的测试时扩展(https://huggingface.co/papers?q=test-time%20scaling)。这些结果确立了代理式代码审查(https://huggingface.co/papers?q=agentic%20code%20review)作为一种实用机制,推动 AI 编程智能体从一次性 PR 生成迈向闭环的问题解决(https://huggingface.co/papers?q=issue%20resolution)。

查看 arXiv 页面(https://arxiv.org/abs/2607.06065)查看 PDF(https://arxiv.org/pdf/2607.06065)项目页面(https://swe-lego.github.io/SWE-Review/)GitHub8(https://github.com/SWE-Lego/SWE-Review)加入收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.06065)

在你的智能体中获取此论文:

hf papers read 2607\.06065

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型2

SWE-Lego/SWE-Review-8B 文本生成• 308k• 约1小时前更新 • 21 • 1 (https://huggingface.co/SWE-Lego/SWE-Review-8B)

SWE-Lego/SWE-Review-30B-A3B 文本生成• 211k• 约1小时前更新 • 14 (https://huggingface.co/SWE-Lego/SWE-Review-30B-A3B)

引用此论文的数据集2

SWE-Lego/SWE-Review-Traj 查看器• 约1小时前更新 • 8.91k • 208 • 1 (https://huggingface.co/datasets/SWE-Lego/SWE-Review-Traj)

SWE-Lego/SWE-Review-Bench 查看器• 约1小时前更新 • 1.38k • 63 (https://huggingface.co/datasets/SWE-Lego/SWE-Review-Bench)

引用此论文的 Space0

没有引用此论文的 Space

在 Space 的 README.md 中引用 arxiv.org/abs/2607.06065 即可从此页面链接。

包含此论文的收藏集0

没有包含此论文的收藏集

将此论文添加到一个收藏集(https://huggingface.co/new-collection)以从本页面链接。

相似文章

Agentic Code Review(15分钟阅读)

TLDR AI

分析AI编码代理如何将瓶颈从编写代码转移到审查代码,数据显示代码变更量增加861%,缺陷率上升,使得代码审查成为软件工程中最具杠杆效应的技能。

代理审核系统基准测试

arXiv cs.AI

本文对用于同行评审的代理审核系统进行基准测试,评估了开源和专有系统在研究论文上的表现。最佳配置实现了83.0%的成对准确率,并捕获了71.6%的注入错误,但用户反馈强调了误报和吹毛求疵的问题。

Open Code Review – 一款由 AI 驱动的代码审查 CLI 工具

Hacker News Top

阿里巴巴已将 Open Code Review 开源,这是一款由 AI 驱动的代码审查 CLI 工具,将确定性工程方法与 LLM 智能体能力相结合。该工具最初作为内部工具使用,服务于数万名开发者,已识别出数百万处缺陷。它通过读取 Git diff 输出,利用可配置的模型端点生成结构化的行级审查意见。