标签
TRUSS 是一个证据引导的框架,用于生成功能有效且安全可靠的代理技能,将任务有效性从 17.11% 提高到 52.94%,并将安全率提高到 100%。
提出锚定自博弈(ASP)方法,通过生成器-修复器自博弈,结合嵌入相似度奖励和参考错误混合,来扩展代码修复监督,在全新基准测试BugSourceBench上,相较于标准自博弈,修复率相对提升24%。
本文实证分析了基于LLM的程序修复智能体中代码执行的成本效益,发现执行被大量使用但往往不加区分,限制执行可以在对修复成功影响最小的情况下节省大量成本。