标签
作者意外开发了一个用于代理AI软件调试的本地检索工具,该工具能高效缩小代码函数范围以定位错误,并寻求更多测试想法来验证其有效性。
本文通过实证研究了使用合成语义监督对小型Transformer中的代码嵌入进行对比预训练,结果显示相比基线有显著提升,并且与大型模型具有竞争力。
ZvecAI 开源了 zg(zvec-grep),这是一款本地优先的搜索工具,集成了语义搜索、BM25 和 ripgrep,可在设备上进行高效索引和检索,专为人类和 AI 代理设计。
介绍 Repofetch,一款开发者工具,利用 mixedbreadai 的 toast-1 模型提供 agentic search,实现与 GitHub 仓库的高效交互,助力快速代码查询。
GitHub engineering describes how they optimized case-folding for their code search engine by removing early-exit branches, achieving memory-speed ASCII folding, and open-sourcing the result as a Rust crate called casefold.
本文介绍了完全开放的DenseOn和LateOn检索模型,这些模型在精心整理的英语数据上训练,并通过translate-train扩展到多语言设置,在其参数规模下实现了最先进的BEIR结果。
ast-grep 用 Rust 重写了 Tree-sitter 的 C 核心,实现了高达 30% 的解析速度提升和 22% 的端到端性能提升,但内存使用略有增加。
Harness Handbook是一种以行为为中心的表示,通过静态程序分析和LLM辅助从智能体harness代码库中合成,帮助开发者和编码智能体定位实现特定行为的代码。它引入了行为引导的渐进式披露(BGPD),引导智能体从高层描述到相关实现细节,提高了定位准确性和编辑计划质量。
Capn-hook 是一个 CLI 工具,它为编码代理提供持久记忆,保存回答代码库问题的文件,使得代理不再跨会话重复探索同一谜题,将重复问题的 Token 使用量减少 77%。
一个用 Go 编写的极速、无状态的 CLI 工具,集成 Web 搜索、代码搜索和库文档查询功能,支持网页抓取和站点爬取,专为 AI Agent 和终端使用设计。
cocoindex-code 是一个基于 AST 的语义代码搜索工具,可以快速集成到编码代理中,节省高达 70% 的 token 并提高搜索效率。
本文对17种深度学习模型在大规模代码到代码检索的第一阶段召回中进行了基准测试,评估了它们在多种编程语言和数据集上的精确度、效率和可扩展性。文中介绍了基于LLM的代码标准化和查询重写方案,这些方案提高了性能较低模型的精确度。
Headroom 是一个开源工具,可将代码搜索结果和AI对话中的token数量压缩高达92%(如从1.7万压缩到1400),且保持答案质量不变,支持多平台本地免费运行。
作者构建了 Nice Coding Agent,这是一个开源编码工作台,具有可见且可编辑的上下文堆栈,允许用户精确策划大语言模型所看到的内容。它具备本地优先检索、沙盒执行和混合代码搜索功能,旨在让开发者对上下文组装拥有控制和可见性。
Semble 是一个面向 AI 代理的高效代码搜索库,使用模型如 Model2Vec 或 BM25 实现快速索引和检索,比 grep+read 节省约 98% 的 token,支持 MCP 服务器和 CLI 集成。
Semble是一个面向Agent的代码搜索工具,支持自然语言查询,能精准返回语义完整的代码片段,比传统grep+read方式节省98% token消耗,具有智能分块、双路检索和代码感知重排序等特性。
Argyph 是一个开源 MCP 服务器,通过符号图和语义搜索为 AI 编码代理提供结构化的代码库理解,完全本地运行,无云端依赖。
Semble 是一款面向 AI 代理的快速代码搜索库,令牌使用量比 grep+read 减少约 98%,在 CPU 上运行,无外部依赖,并通过 MCP 或 CLI 集成。
本文介绍了 CoREB,这是一个针对代码搜索的、受数据污染限制的多任务基准测试,具备微调重排序能力,可评估文本到代码、代码到文本以及代码到代码的检索效果。