新智能体框架:少读代码,多写好码

Reddit r/ArtificialInteligence 工具

摘要

Benzi是一个新型智能体框架,通过使用确定性智能最小化源代码读取,在SWE-bench等基准测试中以更低的令牌使用量和成本实现更好性能。

Benzi on GitHub: https://github.com/oooscoos/Benzi 大致来说,当前AI编码代理/框架的工作方式是:a) 从多个文件中提取适当的代码片段并交给代理,或者 b) 解析代码以生成高维嵌入来近似症状图,并交给代理。这两种方法都会导致令牌数量激增、增加运行时间、引起上下文漂移、增加模型的思考令牌以发现程序结构,然后在Claude Code压缩时忘记大部分内容,或者在多文件重构时因为所有行号变化需要重新搜索而忘记全部。Benzi从设计之初就旨在避免读取源代码。它通过工具调用为人工智能模型提供确定性智能。例如,当模型即将进行代码更改时,它可以查询"哪些函数影响这个函数?"——很多时候甚至不需要,因为Benzi编译器已经在编辑前后告知了影响范围,并附带完整的静态分析检查。Benzi Sonnet读取的源代码(9,125行)远少于Claude Code Sonnet(20,704行)、DeepSeek的框架(43,598行)和OpenCode(65K+行——因反复失败被取消资格),以更快、更便宜地完成相同任务。(基准测试详情请见此处)**但如果编译器没有正确工作怎么办!你不会误导AI模型吗?** - 绝对会。Benzi通过三个真相层级精心处理了这个问题。RESOLVED有确凿证据,CANDIDATE是静态分析无法解决的内容,OBSERVED是执行过程中实际发生的内容。人工智能和确定性智能层协调工作,尽可能减少源代码访问,而不为了效率产生错误结果。它还具有多个附加功能,如运行时追踪器、任务中自我感知的模型升级(如果认为工作超出其能力)、上下文感知的模型编写复现,以及更多功能。目前支持Python · JavaScript · TypeScript · Java · C# · C++ · C · Go · Rust · Ruby,并能确定性地处理HTML、CSS和JS。Claude Code拍照,Benzi解决CSS规则胜者。CodeIndex和MarkupIndex经过充分测试,如果出现问题,模型会首先被告知。在基准测试方面,SWE-bench Verified上达到78.2%的成功率,每次修复成本低于10美分(使用V4flash)。这一成绩值得注意,因为当行业其他部分倾向于插件密集型并投入数百万美元增加上下文窗口大小时,Benzi的方法可能在经济上更具价值,同时提高模型的代码编写/理解能力。如果您好奇想了解更多,请点击此处并了解一下StallionSwipe。这可能是我制作过的最好的东西。它是一个受Fireship启发的马匹约会应用,完全使用Benzi Opus 4-8和一点V4flash全新开发。
查看原文

相似文章

最喜欢的代理式编码工具

Reddit r/LocalLLaMA

作者比较了几种代理式编码工具(Codex CLI、Claude Code、Gemini CLI、OpenCode、Pi),认为Pi最精简且最适合本地模型,赞赏其简洁性以及与Qwen 27B-MXFP8的兼容性。

最好的智能代理工具会这样做……

Reddit r/AI_Agents

作者分享了构建高效智能代理工具的见解:最好的工具最大限度地减少对大语言模型(LLM)在琐碎任务上的依赖,将其保留用于复杂推理,从而将真正的代理工具与简单的包装器区分开来。

新代理将代码转换为自然语言

Reddit r/ArtificialInteligence

Benzi是一个AI编码智能体,使用基于tree-sitter的编译器将代码解析为精确、可查询的映射,在SWE-bench Verified上以低成本达到78.2%的准确率。