retrieval

标签

Cards List
#retrieval

Peerify:同行评审声明验证基准测试

arXiv cs.CL · 23小时前 缓存

Peerify 是一个用于自动验证同行评审声明与稿件证据的流程,使用来自 NeurIPS 2024 和 ICLR 2024 的 800 个声明的基准,证明以检索为中心的验证优于蕴含基线。

0 人收藏 0 人点赞
#retrieval

@omarsar0:推荐给从事智能体记忆工作的人员。检索是大多数框架中最难的记忆问题,因为智能体持续……

X AI KOLs Timeline · 昨天 缓存

来自@omarsar0的推文建议关注智能体记忆检索,并宣布了Agent Memory Challenge 2026 Cycle 2的开启,该挑战通过编码和文本轨道评估AI智能体的记忆能力。

0 人收藏 0 人点赞
#retrieval

前瞻记忆:面向个人记忆检索的零推断前瞻性检索项

arXiv cs.CL · 昨天 缓存

本文提出一种用于个人记忆检索的零推断前瞻性检索项,该技术能在无需查询时计算的情况下,提升与未来承诺相关记忆项的检索优先级。在合成任务集上的实验表明,该方法能改善记忆召回效果,并可作为主动型AI助手分层架构的组成部分。

0 人收藏 0 人点赞
#retrieval

AutoViewMem: 自配置正交视图用于对话长期记忆

arXiv cs.AI · 2天前 缓存

AutoViewMem是一个数据驱动的框架,它将长期对话记忆组织为自配置语义视图,以提升LLM代理的检索和个性化能力,并在基准测试中表现出色。

0 人收藏 0 人点赞
#retrieval

V7 如何为 AI 代理提供机构记忆

OpenAI Blog · 3天前 缓存

V7 Go 是一个代理平台,它利用 AI 模型将业务上下文组织成代理可查询的记忆,使金融和保险等企业能够实现高精度工作流程。

0 人收藏 0 人点赞
#retrieval

EconSkills:面向实时经济数据的Web智能体技能迁移与检索研究

arXiv cs.AI · 5天前 缓存

EconSkills提出了一种技能库与评估框架,使Web智能体能够迁移和检索处理实时经济数据的流程知识,在受控迁移中提升效率,并在库规模评估中展现竞争力。

0 人收藏 0 人点赞
#retrieval

M-SQE:增强智能体技能使用中语言平等的多语言技能质量估算

arXiv cs.CL · 6天前 缓存

M-SQE 提出了一个多语言技能质量估算框架,旨在通过评估候选者的内在质量和任务实际效用,增强智能体技能使用中的语言平等。

0 人收藏 0 人点赞
#retrieval

若代理记忆使用后置过滤租户作用域则会泄露数据

Reddit r/AI_Agents · 2026-09-16

文章阐述了向量搜索中的后置过滤租户作用域如何导致代理记忆系统泄露数据,并建议在写入时设置作用域以防止跨租户数据暴露。

0 人收藏 0 人点赞
#retrieval

我们尝试让AI验证器减少阅读。如何在不悄无声息地遗漏证据的情况下降低成本?

Reddit r/AI_Agents · 2026-09-15

本文描述了在AI验证管道中测试降低阅读成本的方法,同时保持高召回率和少数证据,指出了当前方法的挑战,并邀请社区参与。

0 人收藏 0 人点赞
#retrieval

Markdown 是你所需的一切

Reddit r/openclaw · 2026-09-11

本文提出了一种基于Markdown的AI代理记忆系统,该系统使用简单的文件存储和编辑规则,性能超越复杂的内存运行时,确保准确且有来源的事实检索。

0 人收藏 0 人点赞
#retrieval

OntologyAligner: 本体对齐检索与层次引导的大型语言模型重排序用于生物医学本体归一化

arXiv cs.AI · 2026-09-11 缓存

OntologyAligner 提出一个三阶段框架,结合本体对齐检索和LLM重排序用于生物医学本体归一化,在HPO任务上实现了最先进的性能,并引入了PhenoNormBench基准。

0 人收藏 0 人点赞
#retrieval

ReGround:基于多模态证据的审稿意见定位

arXiv cs.CL · 2026-09-11 缓存

ReGround 是一个大规模数据集,用于将审稿意见定位到科学论文的多模态证据上,揭示了在检索任务中整合文本、表格和图表的重要性和挑战性。

0 人收藏 0 人点赞
#retrieval

思考再链接:多语言实体链接中的稀有性、推理与检索

arXiv cs.CL · 2026-09-11 缓存

本文介绍了一种多语言多模态实体链接框架,通过结合推理和检索,提高了对稀有实体的准确性,并在MERLIN基准测试中取得了显著提升。

0 人收藏 0 人点赞
#retrieval

@rohanpaul_ai: 来自 Nebius 的一个非常强大的优惠,适用于 AI 开发者。用于学习推理流程、编排、检索……

X AI KOLs Following · 2026-09-10 缓存

Nebius 推出了 AI Builder Program,为 AI 开发者提供可运行示例、蓝图、课程以及超过 400 美元的信用额度等资源,以促进 AI 系统的构建。

0 人收藏 0 人点赞
#retrieval

EdgeMem: 通过保留证据的多锚点超图实现无LLM智能体记忆构建与检索

arXiv cs.AI · 2026-09-10 缓存

EdgeMem提出一种无LLM的方法,用于智能体记忆的构建与检索,采用多锚点超图,保留证据以提高基于记忆的问答性能。

0 人收藏 0 人点赞
#retrieval

冻结代理中受限人格在分类任务匹配检索但在回归任务不匹配

arXiv cs.CL · 2026-09-04 缓存

论文介绍了PersonaLink,一种无需训练的方法,它将用户历史蒸馏为有界人格,在分类任务上匹配检索,但在回归任务上不匹配,突显了任务类型的不对称性。

0 人收藏 0 人点赞
#retrieval

Skill Following: 评估检索增强LLM代理中的实际技能使用

arXiv cs.CL · 2026-09-02 缓存

本文介绍了Skill Following和检索调用实际使用效应(RAE),用于评估LLM代理中的技能检索是否真正提升任务性能,揭示了聚合指标可能具有误导性。

0 人收藏 0 人点赞
#retrieval

@garrytan: 我刚制作了一些新的GBrain评估,这些评估有助于证明我为AI代理设计的检索开源层在读取记忆方面达到了SOTA水平……

X AI KOLs Timeline · 2026-08-31 缓存

Garry Tan 发布了针对gbrain的新评估。gbrain是一个面向AI代理的开源检索层,展示了在记忆读写方面的最新性能,且无需LLM-in-loop检索。

0 人收藏 0 人点赞
#retrieval

Hi-Q: 用于多跳问答的层次证据引导查询精炼

Hugging Face Daily Papers · 2026-08-31 缓存

Hi-Q 是一个证据条件框架,基于语料库支持信号动态将多跳查询精炼为层次树,从而提高多跳问答的检索和答案准确性。

0 人收藏 0 人点赞
#retrieval

@lateinteraction: "延迟交互确实更好,但需要大量存储" 兄弟们崩溃了

X AI KOLs Timeline · 2026-08-27 缓存

一条推文讨论了延迟交互模型的存储问题,并分享了关于分层池化和非对称量化技术的有趣结果。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈