Benzi:编程工具/AI代理在基准测试中超越巨头,且源代码读取更少

Reddit r/ArtificialInteligence 工具

摘要

Benzi是一个AI编程代理,通过读取更少源代码并使用确定性工具调用,在基准测试中超越竞争对手,在代码智能任务中实现高效率。

GitHub: https://github.com/oooscoos/Benzi 演示: https://benzi.fly.dev/ 基准测试: https://benzi.fly.dev/benchmark 大致来说,当前AI编程工具/代理的工作方式是通过:a) 从多个文件中提取适当的代码片段并交给代理,或 b) 解析代码以创建高维嵌入以近似症状图,然后交给代理。这两种方法都会大幅增加令牌数量,增加运行时间,导致上下文漂移,增加模型的思考令牌以发现程序结构,然后在Claude Code压缩时忘记大部分,或者如果是多文件重构,由于所有行号改变并需要重新搜索,可能会忘记全部。Benzi从一开始就是设计来避免首先读取源代码的。它通过工具调用为AI模型提供确定性智能。例如,当模型即将进行代码更改时,它可以查询“哪些函数调用了这个?”——一半的时间甚至不需要,因为Benzi编译器已经在编辑前后告知影响范围,并附有完整的静态分析检查。Benzi Sonnet读取的源代码远少于Claude Code Sonnet(9,125行),DeepSeek的工具(43,598行),和OpenCode(65K+行——因重复失败而取消资格),以更快、更便宜的方式完成相同的任务。(基准测试链接在评论中)Benzi有清晰的真值层,区分哪些可以通过静态分析分析,哪些不能——然后在其上添加运行时跟踪器以弥合两者之间的差距(详情见GitHub上的FAQ)。它还具有多个附加功能,如运行时跟踪器、任务中自我感知的模型升级(如果认为工作超出其能力范围)、上下文感知的模型编写的复现,以及更多。它目前支持Python · JavaScript · TypeScript · Java · C# · C++ · C · Go · Rust · Ruby,并且可以确定性地处理HTML、CSS和JS。Claude Code点击照片,Benzi解析CSS规则的获胜者。CodeIndex和MarkupIndex经过充分测试,如果有什么不工作,模型会首先意识到。在基准测试方面,对于修复成本<10美分(使用V4flash),SWE-bench Verified达到78.2%。这个分数值得注意,因为当整个行业倾向于依赖插件并投入数百万美元增加上下文窗口大小时,Benzi的方法可能在经济上更有价值,同时提高模型的代码编写/理解能力。感谢阅读!请告诉我您的想法。我意识到AI疲劳是真实的,但希望您能看到为什么索引代码库比读取原始源代码更好。请在做出快速判断之前查看GitHub的README。尝试向实时演示中输入任何您想要的随机仓库。并向它提问只有真正的代码智能才能回答的问题。
查看原文

相似文章

新智能体框架:少读代码,多写好码

Reddit r/ArtificialInteligence

Benzi是一个新型智能体框架,通过使用确定性智能最小化源代码读取,在SWE-bench等基准测试中以更低的令牌使用量和成本实现更好性能。

新代理将代码转换为自然语言

Reddit r/ArtificialInteligence

Benzi是一个AI编码智能体,使用基于tree-sitter的编译器将代码解析为精确、可查询的映射,在SWE-bench Verified上以低成本达到78.2%的准确率。