代码智能体需要多少静态结构?确定性锚定研究

Hugging Face Daily Papers 论文

摘要

本文研究了轻量级静态分析注释如何作为确定性锚定,提高基于LLM的代码智能体在导航软件仓库时的可预测性和可重复性,发现这种锚定改进了定位并减少了方差。

基于LLM的代码智能体通过关键词搜索导航仓库,但缺少定义软件实际工作方式的结构关系,如调用图、继承层次和配置依赖。这使得智能体导航具有随机性,且难以在不同运行中复现。我们研究了轻量级静态分析能否为这些智能体提供确定性锚定:以纯文本注释形式注入稳定的结构事实,从而约束概率探索并使导航更可预测。我们从OpenAI的Codex这一强基线出发,系统性地注入不同粒度的结构注释,并测量它们对定位、轨迹行为和运行间稳定性的影响。我们的研究识别出了我们称之为确定性锚定效应的现象:静态结构的作用更多是使智能体的导航变得有纪律且可复现,而非使其“更聪明”。三个观察支持这一发现:(1)锚定有效:轻量级调用/继承拓扑改进了函数级定位(Func@5提升+2.2个百分点),并缩短了轨迹(减少1.6交互轮数);(2)锚定对规模敏感:最佳粒度和方向性取决于仓库特征,其中密集语义呈现出收益递减,而枢纽密集型项目从仅反向链接(暴露“who-calls-me”而无前向边)中受益;(3)锚定稳定化:标签将链接跟随率从0.15-0.18提升至0.21-0.24,运行间方差大致减半,并在中等规模仓库上提高了单次运行可靠性(Pass@1提升+3.4个百分点),代价是约10%的额外输入token。这些观察提出了实用指南:默认在中等项目上使用轻量级拓扑,在大型仓库中修剪前向边,并为隐式依赖情况保留密集标签。
查看原文
查看缓存全文

缓存时间: 2026/06/29 18:04

Paper page - 代码智能体需要多少静态结构?一项关于确定性锚点的研究

来源:https://huggingface.co/papers/2606.26979

摘要

静态分析注解通过提供确定性的结构锚点来改善代码智能体的导航,这些锚点增强了软件探索过程中的可预测性并降低了可变性。

基于 LLM 的代码智能体(https://huggingface.co/papers?q=LLM-based%20code%20agents)通过关键词搜索(https://huggingface.co/papers?q=keyword%20search)浏览代码仓库,但忽略了定义软件实际工作方式的结构关系,如调用图(https://huggingface.co/papers?q=call%20graphs)、继承层次(https://huggingface.co/papers?q=inheritance%20hierarchies)和配置依赖(https://huggingface.co/papers?q=configuration%20dependencies)。这使得智能体的导航具有随机性,且难以在不同运行间复现。我们研究了轻量级静态分析(https://huggingface.co/papers?q=static%20analysis)能否为这些智能体提供确定性锚点(https://huggingface.co/papers?q=deterministic%20anchors):以纯文本注释形式注入的稳定结构事实,用于约束概率性探索并使导航更加可预测。从强基线 OpenAI 的 Codex 出发,我们系统地注入了不同粒度的结构注解(https://huggingface.co/papers?q=structural%20annotations),并测量它们对定位、轨迹行为以及运行间稳定性(https://huggingface.co/papers?q=run-to-run%20stability)的影响。我们的研究识别出所谓的确定性锚点效应:静态结构的作用并非使智能体“更聪明”,而是让其导航更有纪律性和可复现性。三个观察支持这一发现:(1) 锚点有效:轻量级调用/继承拓扑提升了函数级定位(https://huggingface.co/papers?q=function-level%20localization)(Func@5 +2.2pp),并缩短了轨迹(交互轮次 -1.6);(2) 锚点对规模敏感:最优粒度和方向性取决于代码仓库特征,语义越密集收益递减,而枢纽密集型项目受益于仅展示“谁调用我”的逆向链接,无需前向边;(3) 锚点提升稳定性:标签将链接跟随率从 0.15-0.18 提升至 0.21-0.24,使运行间方差大致减半,并在中型代码仓库上将单次运行可靠性(Pass@1)提升 3.4 个百分点,代价是约 10% 的额外输入 token。这些观察提出了实用指南:中型项目默认使用轻量级拓扑,大型代码仓库中修剪前向边,对隐式依赖场景保留密集标签。

查看 arXiv 页面(https://arxiv.org/abs/2606.26979)查看 PDF(https://arxiv.org/pdf/2606.26979)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.26979)

在您的智能体中获取此论文:

hf papers read 2606\.26979

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

暂无模型关联此论文

在模型 README.md 中引用 arxiv.org/abs/2606.26979 即可从此页面建立链接。

引用此论文的数据集0

暂无数据集关联此论文

在数据集 README.md 中引用 arxiv.org/abs/2606.26979 即可从此页面建立链接。

引用此论文的 Spaces0

暂无 Space 关联此论文

在 Space README.md 中引用 arxiv.org/abs/2606.26979 即可从此页面建立链接。

包含此论文的收藏集0

暂无收藏集包含此论文

将此论文添加到收藏集(https://huggingface.co/new-collection)即可从此页面建立链接。

相似文章

多智能体LLM商议中的隐藏锚点

arXiv cs.AI

本文把多智能体LLM商议建模成一个闭环动力系统,其中每个智能体都拥有隐藏的内部信念(锚点),该锚点持续牵引其观点。文章展示了如何仅从商议数据中恢复这个锚点,并解释了诸如观点逃逸初始信念凸包等现象。

Anchor:缓解智能体基准生成中的工件漂移

arXiv cs.AI

Anchor是一个任务生成流水线,通过从单一的约束优化规范中联合生成指令、环境、解决方案和验证器,解决了AI智能体基准中的工件漂移问题,为企业工作流提供一致且可审计的评估任务。论文介绍了ERP-Bench——一个包含生产级ERP系统中300个长时任务的基准,结果显示前沿模型在26.1%的试验中满足显式约束,但仅17.4%的试验达到最优解。