标签
本文研究长期视野语言模型代理中的隐藏状态,揭示记忆压缩和召回需求在行动前被编码。提出PaMER框架,通过状态引导压缩和证据检索减少上下文消耗,同时保持任务性能。
本文量化了事实核查得分的提升如何在答案准确性和证据质量之间进行分配,使用了训练后的DeBERTa检查点和LLM在多个基准测试中。
本文介绍了PACE,一个用于评估AI模型是否能通过检索隐式知识库事实来识别用户请求中隐藏冲突的数据集,并提出了PaceMaker,一个增强冲突感知决策的多智能体框架。
ECHO 是一个认知启发的、可审计的记忆架构,适用于长时程代理,在 LoCoMo 和 LongMemEval-S 等基准测试中表现出高检索性能。
FinRCA-Bench是一个基准测试,旨在评估金融AI系统的证据检索和推理能力,为评估和改进提供标准化方法。
本文介绍了 ReMEMBER,一种面向流式对话摘要的缺失证据记忆框架,它从长历史中检索并精炼证据,以在固定记忆预算下解决当前窗口中的空白,并附带一个用于评估的基准。
ColGraphRAG 在多模态 GraphRAG 中使用延迟交互 MaxSim 评分替代单向量双编码器相似度,用于对图链接图像候选进行排序,从而提高了 MultimodalQA 上的检索和问答准确率。
本文介绍了Tree of Evidence (ToE),一种利用强化学习动态检索和聚合多源证据的分层可解释声明验证框架。实验表明,与基线相比,性能提升4至24个百分点,尤其是在面对生成引擎优化(GEO)的对抗性投毒输入时。
本文介绍了GranuVistaVQA,一个带有元素级注释的多模态基准,以及GranuRAG,一个将视觉元素视为可验证多模态RAG的一等检索单元的框架,相较于基线实现了高达29.2%的提升。