code-retrieval

标签

Cards List
#code-retrieval

ExecRetrieval:衡量代码嵌入检索中的功能正确性差距

Hugging Face Daily Papers · 2天前 缓存

ExecRetrieval引入了一个基准测试来衡量代码嵌入检索中的功能正确性差距,表明顶级检索器经常将有缺陷的近克隆实现排在正确实现之上。

0 人收藏 0 人点赞
#code-retrieval

1C:Enterprise 的自然语言代码检索:一个开放基准测试与高效双编码器

arXiv cs.CL · 2026-08-21 缓存

本文介绍了一个开放基准测试和一个专门的双编码器模型,用于1C:Enterprise生态系统中的自然语言代码检索,解决了俄语代码搜索领域特定资源的缺乏问题。

0 人收藏 0 人点赞
#code-retrieval

召回前重排序:大规模代码到代码检索的深度学习模型基准测试

arXiv cs.CL · 2026-06-29 缓存

本文对17种深度学习模型在大规模代码到代码检索的第一阶段召回中进行了基准测试,评估了它们在多种编程语言和数据集上的精确度、效率和可扩展性。文中介绍了基于LLM的代码标准化和查询重写方案,这些方案提高了性能较低模型的精确度。

0 人收藏 0 人点赞
#code-retrieval

@NielsRogge: http://paperswithco.de上的热门论文是"FastContext: Training Efficient Repository Explorer for Coding Agents"…

X AI KOLs Following · 2026-06-16 缓存

微软的FastContext是一篇热门论文,介绍了一个搭配编码代理用于高效代码检索的4B小模型,在SWE-Bench Multilingual上能与闭源系统匹敌。

0 人收藏 0 人点赞
#code-retrieval

@aigclink: 面向Agent的一个代码搜索工具:Semble,用自然语言查代码库返回精准代码片段,比grep+read节省98% token消耗 方法是让Agent用自然语言直接定位到最相关的几行代码,不用瞎猜关键词,不用读整文件 速度上,索引一个普通…

X AI KOLs Timeline · 2026-05-19 缓存

Semble是一个面向Agent的代码搜索工具,支持自然语言查询,能精准返回语义完整的代码片段,比传统grep+read方式节省98% token消耗,具有智能分块、双路检索和代码感知重排序等特性。

0 人收藏 0 人点赞
#code-retrieval

我们尝试了向量、抽象语法树(AST)以及粗暴地堆砌上下文以进行代码检索。带有大语言模型(LLM)生成语义的图结构效果最佳。以下是我们的经验总结。

Reddit r/LocalLLaMA · 2026-05-10

作者们详细描述了他们在构建代码索引系统的经验,最终得出结论:使用大语言模型(LLM)生成语义的图检索方式在性能上优于向量嵌入和纯抽象语法树(AST)解析。他们将该系统开源,命名为 Bytebell,它利用 Neo4j 存储语义上下文,以实现高效且精确的代码检索。

0 人收藏 0 人点赞
#code-retrieval

切勿复制粘贴!代码检索的改写策略

Hugging Face Daily Papers · 2026-05-08 缓存

本研究论文探讨了代码检索中的文本改写策略,发现完全的自然语言改写能带来最大的性能提升。本文引入了基于熵的诊断方法,以帮助判断何时使用成本较高的 LLM 改写是有益的。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈