information-retrieval

标签

Cards List
#information-retrieval

FinFIRST: 金融信息检索、来源与可追溯性搜索代理基准测试

arXiv cs.CL ↗ · 5天前 缓存

FinFIRST 引入了一个基准,通过原子化标准共同评估答案和支持证据,用于评价金融搜索代理,包含 123 个由专家撰写的任务,涵盖不同难度级别。

0 人收藏 0 人点赞
#information-retrieval

QontoFAQ: 一个更优的信息检索基准 [R]

Reddit r/MachineLearning ↗ · 5天前

QontoFAQ 介绍了一个用于信息检索的新基准和指标,专注于提升回答产品问题的相关性度量,并发布了相关的代码和数据集。

0 人收藏 0 人点赞
#information-retrieval

校准内容如何塑造基于注意力的重排序

arXiv cs.CL ↗ · 2026-09-17 缓存

本文展示,基于注意力的重排序中的校准内容在详细指令下可能降低性能,并提出插值空校准作为一种无需训练的方法,以在指令密集的任务上恢复排名。

0 人收藏 0 人点赞
#information-retrieval

自我进化搜索索引

Hugging Face Daily Papers ↗ · 2026-09-17 缓存

本文介绍了SELF-INDEX,这是一个使搜索索引能够自主自我进化的框架,从而提升检索性能,并惠及搜索代理和代理记忆系统等下游应用。

0 人收藏 0 人点赞
#information-retrieval

用于检索增强生成的查询感知源风险分流

arXiv cs.AI ↗ · 2026-09-16 缓存

本文提出了一种用于检索增强生成(RAG)管道的查询感知分流层,以处理源与查询之间的实质性关系,通过在合成数据上评估的评分和路由方法来定义风险覆盖目标。

0 人收藏 0 人点赞
#information-retrieval

@yaohui12138: 90%的企业,本质上都是“我比你搜得更好”,全都依赖于信息不对称...

X AI KOLs Following ↗ · 2026-09-15 缓存

Lev8的Open Search是一款AI工具,集成了Claude,可以通过自然语言同时搜索多个国内外平台,提供商业应用如竞争对手分析和客户发现。

0 人收藏 0 人点赞
#information-retrieval

你的智能体并非产生幻觉。它读取的是一份已被淘汰18个月的政策。

Reddit r/AI_Agents ↗ · 2026-09-13

作者描述了AI智能体如何因缺乏生命周期感知而读取过时文档,并提出了一种名为OCOM的开放规范,该规范为对象添加元数据,包括身份、归属、生命周期和证据,以确保智能体访问最新信息。

0 人收藏 0 人点赞
#information-retrieval

知识图谱为何如此出色是有原因的

Reddit r/AI_Agents ↗ · 2026-09-11

文章解释了为什么知识图谱在AI系统的记忆存储中优于平面列表,因为它们能有效处理对同一实体的多个引用,并防止搜索结果的碎片化或矛盾。

0 人收藏 0 人点赞
#information-retrieval

针对非结构化数据的高效准确查询系统

Lobsters Hottest ↗ · 2026-09-09 缓存

本论文提出了一套高效且准确的非结构化数据查询系统,着重于改进数据检索与分析的方法。

0 人收藏 0 人点赞
#information-retrieval

语义搜索中的高效GPU检索

arXiv cs.AI ↗ · 2026-09-01 缓存

本文介绍了针对LinkedIn语义搜索的对齐策略检索框架,利用嵌入向量划分为类别监督分段,并采用两阶段GPU架构以提升召回率和精确率,显著效果在A/B测试中得到验证。

0 人收藏 0 人点赞
#information-retrieval

协同匹配:基于强化学习的协同进化生成检索器

Hugging Face Daily Papers ↗ · 2026-09-01 缓存

CoGR是一个检索框架,采用协同进化强化学习来训练LLMs在查询和项目两侧生成关键词,在检索任务中实现了显著的性能提升。

0 人收藏 0 人点赞
#information-retrieval

MULTI3IR: 一个多视角多领域多模态信息检索基准

Hugging Face Daily Papers ↗ · 2026-08-31 缓存

本文介绍了Multi3IR,一个多视角、多领域、多模态信息检索基准,并提出了SPIN,一种改进检索系统视角覆盖的方法。

0 人收藏 0 人点赞
#information-retrieval

MoganColBERT-TR:一个用于土耳其语的后交互多向量检索模型

arXiv cs.CL ↗ · 2026-08-28 缓存

本文介绍了MoganColBERT-TR,一个用于土耳其语的后交互多向量检索模型,通过从先前编码器进行蒸馏训练,在土耳其语BEIR数据集上实现了具有竞争力的零样本性能。

0 人收藏 0 人点赞
#information-retrieval

GreenLeaf Law Embed Tiny:法律领域检索的紧凑嵌入模型

arXiv cs.LG ↗ · 2026-08-27 缓存

GreenLeaf Law Embed Tiny 是一个紧凑的0.6B参数嵌入模型,用于法律领域检索,在MLEB和MTEB(Law, v1)等基准测试中实现竞争性表现,并针对资源受限环境提供高效推理。

0 人收藏 0 人点赞
#information-retrieval

天啊,我几乎忘了在做ColBERT相关工作时得到令人垂涎的结果是多么即时 - @antoine_chaffi…

X AI KOLs Following ↗ · 2026-08-26 缓存

作者表达了对ColBERT模型在机器学习中提供即时高质量结果的兴奋,并暗示即将发布开源模型,展示了晚期交互技术在没有存储开销下的效率。

0 人收藏 0 人点赞
#information-retrieval

从关联到因果:通过因果关系与注意力机制提升检索增强生成(RAG)的检索精度

arXiv cs.AI ↗ · 2026-08-25 缓存

本文介绍了一种基于因果图的注意力机制,以提升检索增强生成(RAG)系统中的检索精度,并在专有知识库的关键词填充机制中显示改进。

0 人收藏 0 人点赞
#information-retrieval

KSE-Web:针对低资源柬埔寨语语义搜索的混合检索与LLM辅助查询扩展分析

arXiv cs.CL ↗ · 2026-08-25 缓存

本文介绍了KSE-Web,一项针对低资源柬埔寨语语义搜索的混合检索与LLM辅助查询扩展分析研究。研究通过构建一个数据集,评估了BM25、稠密检索以及混合检索方法,发现BM25表现最佳,同时LLM查询扩展在柬埔寨语应用中存在局限性。

0 人收藏 0 人点赞
#information-retrieval

PageIndex

Product Hunt ↗ · 2026-08-21 缓存

PageIndex 是一款产品,可在专业文档中提供准确可信的答案,允许用户通过跳转到源行立即验证引用。

0 人收藏 0 人点赞
#information-retrieval

@tomaarsen: 成本低1400倍,我知道我将坚持使用嵌入(密集、稀疏、多向量),加上混合方法(包括bm25)和重排……

X AI KOLs Following ↗ · 2026-08-21 缓存

一项关于嵌入与大语言模型成本效益的讨论,引用了名为'embedder's dilemma'的研究,该研究发现大语言模型以显著更高的成本超越了嵌入模型。

0 人收藏 0 人点赞
#information-retrieval

基于规则与LLMs的代理框架:用于描述性文档布局的嵌入与注释——植物科学应用案例

arXiv cs.AI ↗ · 2026-08-18 缓存

本文提出一种结合规则与LLMs的代理框架,用于植物科学中文档布局的嵌入和注释,实现了可扩展的性状提取并提升了注释覆盖度。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈