标签
介绍开源项目 RAG from Scratch,通过分步骤的本地代码实验完整拆解 RAG 链路,涵盖文本分块、向量化、检索、重排序与查询重写等进阶策略,帮助开发者从底层理解 RAG 实现。
This paper presents a cost-aware comparison of LLMs versus dedicated embedding models across 37 tasks, finding that the best LLM and embedding model are nearly tied on aggregate performance but LLMs are up to 1,431x more expensive and slower, leading to a recommended division of labor.
OlmoEarth Studio 现支持从 OlmoEarth 基础模型计算并导出自定义嵌入向量,支持相似性搜索、分割和变化检测等下游任务。这些嵌入向量可通过 Studio 界面或 API 以云优化 GeoTIFF 格式获取。
本文介绍了LLMCompiler(一个在IR代码上大规模预训练的LLM)产生的程序嵌入在程序分析和优化任务中的首次应用,在算法分类中实现了1.54%的错误率,并在异构设备映射上取得了有竞争力的准确率。
本文介绍了一种使用LLM对电子商务查询进行分类的技术,其做法是让模型“幻觉”出假设性分类,再利用嵌入将其映射到真实分类体系,这比受限的结构化输出更便宜、也更简单。
A technical post explaining why RAG fails for multi-hop queries and presenting a 9-step roadmap for building context graphs, where entities are nodes and relationships are edges, with a minimal 150-line engine.
本文提出了一个统一的几何框架,用以理解 t-SNE 和 UMAP 等可微嵌入,表明现有的诊断方法源自同一个几何对象,并提出了新的基于曲率和积分路径的信任度量。
Google DeepMind 的一篇论文认为,RAG 系统中的单向量嵌入存在严格的数学极限,证明向量数据库无法完全捕捉复杂的文档关系。他们引入了 LIMIT 压力测试数据集,以展示最先进的模型在结构化查询上也会失败。
来自MachineLearningMastery的一篇教育性文章,涵盖了RAG流水线的七种分块策略,从固定大小令牌分块到高级语义和层次化方法,并提供了每种策略的适用场景指导。
InsightEmb 是一种用于智能体洞察检索的对比嵌入框架,仅通过数学推理数据即可学习面向进展的检索几何结构,从而在无需环境特定训练的情况下改进 LLM 智能体的检索效果。
作者构建了一个流水线,将6.6万集播客转录,提取并聚类超过70万个观点到二维语义地图中,用于追踪投资叙事,并过滤掉AI生成的内容。
Dylan Castillo 比较了 Matryoshka 表示学习(MRL)与主成分分析(PCA)在降低嵌入维度方面的效果,并在八个 BEIR 数据集上进行了实验,以评估检索质量与向量大小缩减之间的权衡。
UEmbed 是一个仅解码器的多模态嵌入模型,能够在一次前向传播中同时生成稀疏和稠密表示,已发布 2B、4B 和 9B 三种规模。它在 MMEB-v2 上优于现有基于公开数据训练的多模态嵌入模型,并在 BEIR 上保持竞争力。
Notion分享了其向量搜索基础设施在过去两年中实现规模扩大10倍、成本降低90%的经验,详细介绍了从上线到处理数百万工作区的架构演变。
一个包含欧盟AI法案的933个法律结构化文本块以及BGE-M3嵌入向量的资源,打包在一个SQLite文件中,便于在检索增强生成系统中使用。
Memvid是一个开源工具,将智能体记忆打包到mp4文件中,相比传统的RAG管道和向量数据库,性能显著提升。
本文分析了用于点击率预测的深度神经网络模型中的早期训练崩溃现象,并提出了缓解策略,如稀疏特征移除和值过滤,在大规模工业数据集上展示了改进效果。
一个将Obsidian仓库笔记转换为嵌入并实时渲染3D网络可视化的工具,揭示思维拓扑和隐藏的缺口。
作者认为,对于已经订阅ChatGPT Pro等LLM服务的用户来说,为记忆系统运行本地嵌入模型和重排序模型比运行本地LLM更实用,并详细介绍了他们基于GBrain的配置。
本文介绍了黎曼均值池化(RMP),该方法通过拉回度量利用黎曼几何聚合预训练语言模型的词元嵌入,在句子分类任务上表现出优于欧氏池化的性能。