evidence-retrieval

标签

Cards List
#evidence-retrieval

长期视野代理中记忆控制信号在行动前出现

arXiv cs.AI ↗ · 3天前 缓存

本文研究长期视野语言模型代理中的隐藏状态,揭示记忆压缩和召回需求在行动前被编码。提出PaMER框架,通过状态引导压缩和证据检索减少上下文消耗,同时保持任务性能。

0 人收藏 0 人点赞
#evidence-retrieval

当事实核查得分提高时发生了什么?训练后验证器与LLM中的证据和答案归因分析

arXiv cs.CL ↗ · 3天前 缓存

本文量化了事实核查得分的提升如何在答案准确性和证据质量之间进行分配,使用了训练后的DeBERTa检查点和LLM在多个基准测试中。

0 人收藏 0 人点赞
#evidence-retrieval

PACE:揭示用户请求中的隐藏冲突

arXiv cs.CL ↗ · 2026-09-04 缓存

本文介绍了PACE,一个用于评估AI模型是否能通过检索隐式知识库事实来识别用户请求中隐藏冲突的数据集,并提出了PaceMaker,一个增强冲突感知决策的多智能体框架。

0 人收藏 0 人点赞
#evidence-retrieval

ECHO:一个认知启发的、可审计的长时程代理记忆平面

arXiv cs.AI ↗ · 2026-08-25 缓存

ECHO 是一个认知启发的、可审计的记忆架构,适用于长时程代理,在 LoCoMo 和 LongMemEval-S 等基准测试中表现出高检索性能。

0 人收藏 0 人点赞
#evidence-retrieval

FinRCA-Bench: 金融AI系统的证据检索与推理基准测试

arXiv cs.AI ↗ · 2026-08-20 缓存

FinRCA-Bench是一个基准测试,旨在评估金融AI系统的证据检索和推理能力,为评估和改进提供标准化方法。

0 人收藏 0 人点赞
#evidence-retrieval

不要往回翻:面向流式对话摘要的缺失证据记忆

Hugging Face Daily Papers ↗ · 2026-08-10 缓存

本文介绍了 ReMEMBER,一种面向流式对话摘要的缺失证据记忆框架,它从长历史中检索并精炼证据,以在固定记忆预算下解决当前窗口中的空白,并附带一个用于评估的基准。

0 人收藏 0 人点赞
#evidence-retrieval

ColGraphRAG:多模态GraphRAG的延迟交互证据检索

arXiv cs.AI ↗ · 2026-07-21 缓存

ColGraphRAG 在多模态 GraphRAG 中使用延迟交互 MaxSim 评分替代单向量双编码器相似度,用于对图链接图像候选进行排序,从而提高了 MultimodalQA 上的检索和问答准确率。

0 人收藏 0 人点赞
#evidence-retrieval

ToE:一种分层可解释的声明验证框架,具有动态多源证据检索与聚合

arXiv cs.AI ↗ · 2026-06-29 缓存

本文介绍了Tree of Evidence (ToE),一种利用强化学习动态检索和聚合多源证据的分层可解释声明验证框架。实验表明,与基线相比,性能提升4至24个百分点,尤其是在面对生成引擎优化(GEO)的对抗性投毒输入时。

0 人收藏 0 人点赞
#evidence-retrieval

从场景到元素:可验证多模态RAG的多粒度证据检索

arXiv cs.CL ↗ · 2026-05-15 缓存

本文介绍了GranuVistaVQA,一个带有元素级注释的多模态基准,以及GranuRAG,一个将视觉元素视为可验证多模态RAG的一等检索单元的框架,相较于基线实现了高达29.2%的提升。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈