我们用模型共识取代了单一模型的代码审查——让这真正奏效的一条规则
摘要
本文描述了用多个AI模型的共识取代单一模型的代码审查,只有明确批准才算数,这带来了更可靠的代码审查,但代价是更长的讨论。
背景:小团队,在自己的仓库上自用,没有外部用户,所以请持保留态度。说实话,智能体循环的核心问题在于,单个模型审查自己的工作只是走过场。它写了个 bug,然后“审查”它,说“看起来不错”,就合并了。所以我们不再信任单个审查者,而是改为共识审查。实际上,这意味着每次变更都要经过几次独立的检查,使用不同的模型和不同的角度,它们必须真正达成一致,而不仅仅是没人反对。如果其中某个模型不确定,那就是信号,变更会等待。分歧是有用的部分,而不是噪音。让这变得有效的关键规则虽然笨拙但至关重要:评论永远不算批准,只有明确的“批准”才算。你可能不会想到,在此之前,有多少“看起来没问题,但有一个担忧”被悄悄当作了同意。最终让我信服的是一个问题,审查者争论了大约31轮才达成一致,合并了一个干净的两行修复。看着很烦人。但它没有合并垃圾,这才是关键。还有人在审查/合并步骤使用多模型共识吗?还是你们只信任一个审查者?好奇大家怎么划这条线。
相似文章
我越是用多个模型,就越觉得“AI共识”是个陷阱——分歧才是唯一值得关注的部分
一篇反思文章,认为在多模型设置中,共识输出的价值低于分歧,分歧揭示了问题中真正存在争议的部分。文章质疑共识是否应该是目标,以及如何区分有建设性的分歧与无意义的噪音。
独立研究:单个LLM会遗漏多模型面板捕获的约一半代码审查缺陷。欢迎反馈并寻求arXiv认可。
一位独立研究人员的研究发现,单个LLM会遗漏约一半的代码审查缺陷,而使用来自不同提供商的多个模型可显著提高覆盖率,其中添加第二个模型的收益最大。该论文寻求反馈和arXiv认可。
当多个模型参与时,AI代理感觉更加可靠
探索如何使用多个AI模型进行代理工作流,揭示隐藏的不确定性和推理差距,表明未来的系统可能依赖跨模型共识而非单模型链。
我一直在思考,AI代理在做重要决策时是否应该只依赖单个模型。
作者在某个研究任务上对多个AI模型进行了对比测试,发现模型有时会自信地给出不同答案。他们建议,对于规划、代码审查或研究等重要决策,AI代理应考虑多个模型的观点,并询问他人如何处理这一问题。
用这一个简单技巧让代码审查重新可行
文章提出使用堆叠分支(小型、顺序的拉取请求)来使审查AI生成的代码更易管理和高效,解决常见的大型、难以审查的差异问题。