标签
Peerify 是一个用于自动验证同行评审声明与稿件证据的流程,使用来自 NeurIPS 2024 和 ICLR 2024 的 800 个声明的基准,证明以检索为中心的验证优于蕴含基线。
来自@omarsar0的推文建议关注智能体记忆检索,并宣布了Agent Memory Challenge 2026 Cycle 2的开启,该挑战通过编码和文本轨道评估AI智能体的记忆能力。
本文提出一种用于个人记忆检索的零推断前瞻性检索项,该技术能在无需查询时计算的情况下,提升与未来承诺相关记忆项的检索优先级。在合成任务集上的实验表明,该方法能改善记忆召回效果,并可作为主动型AI助手分层架构的组成部分。
AutoViewMem是一个数据驱动的框架,它将长期对话记忆组织为自配置语义视图,以提升LLM代理的检索和个性化能力,并在基准测试中表现出色。
V7 Go 是一个代理平台,它利用 AI 模型将业务上下文组织成代理可查询的记忆,使金融和保险等企业能够实现高精度工作流程。
EconSkills提出了一种技能库与评估框架,使Web智能体能够迁移和检索处理实时经济数据的流程知识,在受控迁移中提升效率,并在库规模评估中展现竞争力。
M-SQE 提出了一个多语言技能质量估算框架,旨在通过评估候选者的内在质量和任务实际效用,增强智能体技能使用中的语言平等。
文章阐述了向量搜索中的后置过滤租户作用域如何导致代理记忆系统泄露数据,并建议在写入时设置作用域以防止跨租户数据暴露。
本文描述了在AI验证管道中测试降低阅读成本的方法,同时保持高召回率和少数证据,指出了当前方法的挑战,并邀请社区参与。
本文提出了一种基于Markdown的AI代理记忆系统,该系统使用简单的文件存储和编辑规则,性能超越复杂的内存运行时,确保准确且有来源的事实检索。
OntologyAligner 提出一个三阶段框架,结合本体对齐检索和LLM重排序用于生物医学本体归一化,在HPO任务上实现了最先进的性能,并引入了PhenoNormBench基准。
ReGround 是一个大规模数据集,用于将审稿意见定位到科学论文的多模态证据上,揭示了在检索任务中整合文本、表格和图表的重要性和挑战性。
本文介绍了一种多语言多模态实体链接框架,通过结合推理和检索,提高了对稀有实体的准确性,并在MERLIN基准测试中取得了显著提升。
Nebius 推出了 AI Builder Program,为 AI 开发者提供可运行示例、蓝图、课程以及超过 400 美元的信用额度等资源,以促进 AI 系统的构建。
EdgeMem提出一种无LLM的方法,用于智能体记忆的构建与检索,采用多锚点超图,保留证据以提高基于记忆的问答性能。
论文介绍了PersonaLink,一种无需训练的方法,它将用户历史蒸馏为有界人格,在分类任务上匹配检索,但在回归任务上不匹配,突显了任务类型的不对称性。
本文介绍了Skill Following和检索调用实际使用效应(RAE),用于评估LLM代理中的技能检索是否真正提升任务性能,揭示了聚合指标可能具有误导性。
Garry Tan 发布了针对gbrain的新评估。gbrain是一个面向AI代理的开源检索层,展示了在记忆读写方面的最新性能,且无需LLM-in-loop检索。
Hi-Q 是一个证据条件框架,基于语料库支持信号动态将多跳查询精炼为层次树,从而提高多跳问答的检索和答案准确性。
一条推文讨论了延迟交互模型的存储问题,并分享了关于分层池化和非对称量化技术的有趣结果。