从以人为中心到智能体代码审查:不同代际生成式人工智能技术对审查质量的影响

Hugging Face Daily Papers 论文

摘要

本文研究了102万个拉取请求,分析了从以人为中心到AI智能体代码审查的转变,发现智能体参与的模式提高了效率但未提升质量。

代码审查有助于在代码集成前维护软件质量,但也给人类审查员带来了巨大的工作负担。随着生成式人工智能成为软件开发的一部分,代码审查正从主要由人类审查的过程转向AI支持的审查过程,其中大型语言模型(LLM)审查员和AI智能体审查员与人类审查员共同参与。然而,我们仍然缺乏关于这种转变如何影响审查效率和审查质量的实证证据。在本文中,我们研究了来自207个GitHub项目的102万个已审查拉取请求,这些项目经历了三个代码审查时代:以人为中心的审查、LLM辅助审查和智能体代码审查。我们识别出三种AI审查员采用实践:渐进式AI采用、快速LLM采用和快速AI智能体采用。我们进一步将拉取请求审查讨论建模为审查员交互序列,以描述人类、LLM和AI智能体审查员在审查过程中的协作方式。我们的结果表明,涉及智能体的协作模式,特别是由AI智能体发起或涉及多个AI智能体的审查,在渐进式AI采用和快速AI智能体采用下与更快的审查决策相关。然而,这些效率提升并未转化为更好的审查质量。我们还发现,审查活动和拉取请求类型在各个时代仍然重要,而一旦LLM和AI智能体审查员参与,人机协作模式就成为审查效率的最强解释因素。这些发现为设计AI支持的代码审查流程提供了实证指导,以便在提高效率的同时不削弱审查质量。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:40

论文页面 - 从以人为中心到智能体代码审查:不同代际生成式AI技术对审查质量的影响

来源:https://huggingface.co/papers/2607.13196

摘要

代码审查在代码集成前有助于维护软件质量,但也给人类审查者带来了巨大的工作量。随着生成式人工智能成为软件开发的一部分,代码审查正从主要依赖人工审查的过程,转向AI支持的审查过程,其中大语言模型(LLM)审查者和AI智能体审查者与人类审查者共同参与。然而,我们仍然缺乏关于这种转变如何影响审查效率和审查质量的实证证据。在本文中,我们研究了来自207个GitHub项目的102万个已审查的拉取请求,这些项目跨越了三种代码审查时代:以人为中心的审查、LLM辅助审查和智能体代码审查。我们识别出三种AI审查者采用实践:渐进式AI采用、快速LLM采用和快速AI智能体采用。我们进一步将拉取请求审查讨论建模为审查者交互序列,以描述人类、LLM和AI智能体审查者在审查过程中的协作方式。我们的结果表明,涉及智能体的协作模式,特别是由AI智能体发起或涉及多个AI智能体的审查,在渐进式AI采用和快速AI智能体采用下与更快的审查决策相关。然而,这些效率提升并未转化为更好的审查质量。我们还发现,审查活动和拉取请求类型在各个时代仍然重要,而一旦LLM和AI智能体审查者参与,人机协作模式就成为解释审查效率的最强因素。这些发现为设计AI支持的代码审查流程提供了实证指导,以在不削弱审查质量的前提下提高效率。

查看arXiv页面 (https://arxiv.org/abs/2607.13196)查看PDF (https://arxiv.org/pdf/2607.13196)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.13196)

在你的智能体中获取这篇论文:

hf papers read 2607.13196

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

无模型链接此论文

在模型README.md中引用arxiv.org/abs/2607.13196即可从本页链接。

引用此论文的数据集0

无数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2607.13196即可从本页链接。

引用此论文的Space0

无Space链接此论文

在Space README.md中引用arxiv.org/abs/2607.13196即可从本页链接。

包含此论文的集合0

无集合包含此论文

将此论文添加到集合 (https://huggingface.co/new-collection) 中即可从本页链接。

相似文章

Agentic Code Review(15分钟阅读)

TLDR AI

分析AI编码代理如何将瓶颈从编写代码转移到审查代码,数据显示代码变更量增加861%,缺陷率上升,使得代码审查成为软件工程中最具杠杆效应的技能。

AI生成代码的质量

Reddit r/AI_Agents

这篇文章讨论了一个担忧:随着AI工具生成越来越多的代码,未来基于这些合成代码训练的模型可能会质量下降、原创性降低,并询问像OpenAI、Anthropic和GitHub这样的主要AI实验室计划如何应对这个问题。

编码代理是否带来了新的审查问题?

Reddit r/AI_Agents

本文讨论了虽然编码代理能够有效生成代码,但它们却在审查和信任变更方面引入了新的瓶颈,质疑代理是减少了审查工作量还是转移了审查工作量。