标签
关于AI代理在代码编辑任务中的实验表明,当错误已经修复时,代理经常过度编辑代码,性能根据任务指令而变化。使用真实仓库的基准测试突出了代理在软件开发中的行为问题。
本文通过实证研究对比了用于训练Flutter/Dart代码模型的迭代编辑(差异对比)和直接生成方法,发现直接生成方法总体上更优,但差异对比法在短小、局部化的修改中表现突出。
介绍了VisEditBench,这是一个包含1,395个人工标注的可视化代码编辑任务的基准,面向视觉语言模型,涵盖反馈引导的修复和参考引导的重新样式化。评估了20个VLM,并提出了VisEditAgent,一个基于渲染的编辑框架,将通过率从55.75%提升到67.99%。
Diffs.com 推出新的编辑模式,这是一个基于其文件/差异渲染原语构建的轻量级代码编辑器,支持内联编辑、选择操作、标记、查找/替换、撤销历史以及键盘快捷键。
本文介绍了CanItDelete,一个包含200个真实世界纯删除代码编辑任务的基准,并衡量了LLM如何避免删除代码。研究发现,前沿模型经常保留过时的代码,生成可通过测试但无法直接合并的补丁,并且加入以删除为重点的训练数据可以提高性能。
一个实用的技巧:在同一个代码库上运行多个AI代理时,使用共享的 notes.md 文件进行协调,以避免冲突。
本文研究了编程代理编辑代码所需的最小上下文,发现代码的自然语言摘要无效,且周围上下文影响不大,而压缩上下文仅用三分之一的令牌即可达到相同效果。同时,还揭示了因温度0 API推断而产生的噪声基底。
介绍了终端AI编程助手oh-my-pi,它从Pi分支出来,凭借Hashline编辑系统实现高精度代码修改,减少61% token消耗,内置32个工具,支持40多种语言和40多个LLM提供商,可直接从主流工具导入配置,迁移成本低。
一种为 AI 编码代理提出的工作流程,强调在代码编辑之前进行头脑风暴和执行边界约束,寻求社区对其实用性的反馈。
一篇博客文章探讨“过度编辑”问题:编码大语言模型在修复简单错误时改写了过多代码,提出衡量指标与训练方法以鼓励最小化、忠实于原意的编辑。