retrieval

标签

Cards List
#retrieval

使用合成查询探测比较嵌入模型 [R]

Reddit r/MachineLearning · 4小时前

作者提出了合成查询探测(Synthetic Query Probing),这是一种简单而有效的方法,通过比较不同嵌入模型之间的相似度匹配分数,而非原始嵌入空间,来比较不同的嵌入模型。论文展示了如Ada和Titan等模型之间的非线性关系,为更换嵌入模型和设定检索阈值提供了实用指导。

0 人收藏 0 人点赞
#retrieval

SkillAligner: Treating Retrieved Skills as Adaptable Drafts at Execution Time

arXiv cs.LG · 10小时前 缓存

This paper introduces SkillAligner, a training-free framework that treats retrieved skills as adaptable drafts, jointly adapting them to task requirements, execution environments, and other skills to mitigate skill-execution misfit and improve agent performance.

0 人收藏 0 人点赞
#retrieval

KReF:面向长期时间序列预测与预测不确定性的免训练检索

arXiv cs.LG · 10小时前 缓存

KReF 提出了一种用于长期时间序列预测的免训练检索框架,该框架从相似的历史回看-未来对中构建经验预测分布,在多个基准上取得了优异的 CRPS 表现。

0 人收藏 0 人点赞
#retrieval

CertBind:从多模态连接到可认证检索决策

arXiv cs.LG · 10小时前 缓存

CertBind 提出了一种多尺度理论,用于冻结多模态编码器连接器的可认证组合,通过回退(fallback)和弃权(abstain)机制实现可认证的检索决策。在共享路径上的评估表明,它能够恢复原生 CLIP 检索性能,同时在旁路分支上保持无损(no-harm)。

0 人收藏 0 人点赞
#retrieval

MolBioKG:通过多分辨率结构锚定将图外分子关联至生物医学知识图谱

arXiv cs.AI · 10小时前 缓存

MolBioKG 是一个双层系统,通过多分辨率结构锚定将未见过的分子关联到生物医学知识图谱中,从而能够从 SMILES 字符串进行图外链接恢复和多跳推理。与基线相比,它显著提高了 Hits@10 和图外目标召回率,同时保持可追溯的证据。

0 人收藏 0 人点赞
#retrieval

@beamnxw: 这篇论文简直太厉害了 一篇计算机科学论文将基于文件系统的记忆形式化为长期存储架构……

X AI KOLs Timeline · 2天前 缓存

一篇计算机科学论文将基于文件系统的记忆形式化为自主AI代理的长期存储,表明将记忆组织为层级Markdown文件相比向量存储可将检索成本大约减半。

0 人收藏 0 人点赞
#retrieval

Task-Conditional Flow Matching for Balanced Multilingual Text Embedding Adaptation

arXiv cs.CL · 3天前 缓存

This paper introduces Task-Conditional Flow Matching (TCFM), a framework for adapting multilingual text embedding models that selectively uses flow matching for translation tasks and other objectives for retrieval/classification. It achieves state-of-the-art results on the Indic Massive Text Embedding Benchmark.

0 人收藏 0 人点赞
#retrieval

Caching for the Future: Scrub Jay Episodic Memory Principles for Agent Memory Systems

arXiv cs.CL · 4天前 缓存

This paper introduces ScrubJay-MEM, an LLM agent memory system inspired by scrub jay episodic memory, which uses type-conditioned temporal decay to manage memory perishability. It also proposes the Temporal Generalization Test (TGT) benchmark and shows improved performance over existing memory systems on temporal reasoning tasks.

0 人收藏 0 人点赞
#retrieval

EdgeLM:语言模型表格理解的边缘演示

arXiv cs.CL · 4天前 缓存

EdgeLM是一篇研究论文,提出了一种检索框架,选择边缘演示——即决策边界附近的相关示例——以提高LLM在表格理解与数据整理任务上的表现。

0 人收藏 0 人点赞
#retrieval

以100倍更便宜的开源模型在检索任务上击败GPT-5.6 Sol

Hacker News Top · 4天前 缓存

Neon与Castform合作展示了如何将RL后训练的开源权重模型与Lakebase Search相结合,以100倍更低的成本和延迟,在检索任务上击败GPT-5.6 Sol等前沿模型。

0 人收藏 0 人点赞
#retrieval

Agent记忆层无需LLM来决定记住什么

Reddit r/LocalLLaMA · 4天前

作者认为,Agent记忆层应跳过基于LLM的提取来决定记住什么,转而使用简单的存储、嵌入和检索,其开源工具memU即是例证。

0 人收藏 0 人点赞
#retrieval

面向多讲座教育推理的基于证据的多模态知识图谱构建

arXiv cs.AI · 5天前 缓存

提出了一种基于证据的多模态流水线,从讲座视频中构建富含溯源信息的知识图谱,结合ASR、OCR和视觉-语言模型,在神经网络讲座上实现了高检索准确率。

0 人收藏 0 人点赞
#retrieval

为技术现场服务构建AI智能体学到的13件事

Reddit r/AI_Agents · 6天前

一位从业者分享了为技术现场服务构建生产级AI语音机器人/聊天机器人的13条来之不易的经验,涵盖文档ETL、成本降低和智能体编排。

0 人收藏 0 人点赞
#retrieval

@Aurimas_Gr:通过 𝗠𝗖𝗣 集成 𝗔𝗴𝗲𝗻𝘁𝗶𝗰 𝗥𝗔𝗚 系统 如果你正在构建 RAG 系统并打包许多数据源用于…

X AI KOLs Timeline · 6天前 缓存

本文解释了如何将 MCP(模型上下文协议)集成到 Agentic RAG 系统中,让每个数据域可以管理自己的 MCP 服务器,从而实现标准化的数据访问、安全性以及检索系统的解耦演进。

0 人收藏 0 人点赞
#retrieval

SLMs 作为多智能体路由器:一种渐进式 SFT 与强化学习方法

arXiv cs.CL · 6天前 缓存

本文提出通过渐进式监督微调和强化学习训练小语言模型作为多智能体路由器,相比仅基于意图路由的LLM基线方法,实现了更好的检索相关性和更低的延迟。

0 人收藏 0 人点赞
#retrieval

AgentMemBench:评估对话式AI智能体长期记忆管理策略的系统性基准

arXiv cs.CL · 6天前 缓存

AgentMemBench 是一个系统性基准,在三个数据集上评估对话式 AI 智能体的五种长期记忆管理策略,发现外部键值存储检索在质量上占优,但会带来更大的内存占用。

0 人收藏 0 人点赞
#retrieval

@siddontang: 最近一直在做 TiDB Filesystem,也在思考怎么基于 filesystem 构建 Agent Memory。 实践下来发现: 把 memory 存下来不难。 难的是,让 Agent 在正确的时候,想起正确的事。 Corner c…

X AI KOLs Timeline · 6天前 缓存

这篇推文讨论了基于文件系统构建 LLM Agent 记忆的难点,引用了相关论文并介绍 TiDB Filesystem 的设计理念。

0 人收藏 0 人点赞
#retrieval

@DanKornas:传统的以文本为中心的RAG系统无法有效处理现代文档中的图像、表格、公式、图表以及多媒体…

X AI KOLs Timeline · 6天前 缓存

RAG-Anything 是一个基于 LightRAG 构建的多模态文档处理 RAG 系统,它解析文档、构建多模态知识图谱,并使用混合向量-图检索来回答问题。

0 人收藏 0 人点赞
#retrieval

亲爱的,我把嵌入缩小了:Matryoshka 与 PCA

Hacker News Top · 6天前 缓存

Dylan Castillo 比较了 Matryoshka 表示学习(MRL)与主成分分析(PCA)在降低嵌入维度方面的效果,并在八个 BEIR 数据集上进行了实验,以评估检索质量与向量大小缩减之间的权衡。

0 人收藏 0 人点赞
#retrieval

我对比评测了经典向量 RAG、谷歌新 OKF 格式以及两者组合——同一语料、同样 7 个问题,全部本地运行(Ollama + ChromaDB)

Reddit r/LocalLLaMA · 2026-08-03

作者使用本地技术栈(Ollama、ChromaDB)对经典向量 RAG、谷歌新推出的开放知识格式(OKF)以及混合方法进行了基准测试,发现混合检索答对的问题更多,但 token 成本更高,同时指出了具体的失败模式。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈