标签
This paper studies false-presupposition QA (FPQA) methods and shows that methods performing well on false-presupposition questions often degrade accuracy on normal true-presupposition questions, due to weak fact-checking modules that reject valid presuppositions. The authors argue that FPQA benchmarks over-represent false presuppositions and that evaluation should consider real-world QA performance.
本文提出了Archive,一个用于开放域问答中歧义检测的框架,利用逻辑冲突区分歧义与答案多样性,并引入了包含4,703个查询的基准QuireQA。实验表明,Archive将F1最高提升21.6%,同时比竞争对手快16倍。
RAGOCR 是一种新颖框架,根据输入查询将检索到的文档压缩为紧凑的视觉表示,并利用查询感知的动态分辨率来平衡压缩率与信息保真度。实验表明,其在仅使用八分之一输入 token 的情况下,准确率比朴素 RAG 高出 15% 以上。
The paper proposes QQ, a framework that leverages the intrinsic duality between multi-hop question generation and question answering via bidirectional alignment constraints and contrastive learning, improving question quality on HotpotQA and MuSiQue.
Zero-Mem为LLM智能体引入了一种零Token记忆操作系统,通过保留原始交互轨迹并使用确定性实体-上下文和时间结构,在记忆检索过程中消除了LLM调用和Token消耗。它在长记忆和长上下文问答基准上取得了具有竞争力的性能,同时将记忆操作时间成本降低了57.6%。
本文介绍了 SESA——一种自进化的技能增强搜索代理,它通过工具增强的搜索自我对弈,使任务生成和技能记忆共同进化。它在七个问答基准上相比基线提升了准确率,同时支持无需记忆的部署。
CURV 提出了一种课程学习框架,通过在多模态大语言模型中培养内在的视觉基础推理能力来增强图表问答,在真实世界基准上取得了显著改进。
GROVE是一个无需训练的框架,它从连续视频流中生长出时间分层记忆,同时支持反应式问答和主动式辅助。它在MM-lifelong和EgoServe等基准上取得了最先进的结果。
本文介绍了Wnuan,一种用于企业问答的三阶段后训练流水线,结合了任务导向监督、带通用数据回放的监督微调,以及对残余错误的强化学习,在WnuanBench基准上取得了显著提升,同时衡量了通用能力的成本。
3DZip是一个面向3D视觉语言模型的三阶段令牌压缩框架,利用体素化、多样性引导的锚点选择和空间约束合并来减少令牌数量,同时保持空间推理能力。在3DQA基准上,仅使用128个令牌即可保留94.7%的原始性能,并实现1.92倍的推理加速。
提出Co-E,一种免训练系统,同步图记忆与文本记忆用于多跳问答,在六个基准上优于可比的免训练基线。
Opti-Q 是一个受数据库启发的优化器,用于多LLM问答,通过规划执行DAG,在成本、延迟和能量约束下优化答案质量,在基准测试中取得了显著改进。
HyCE-RAG 是一种新颖的基于超图的检索增强生成框架,专为多跳问答设计,通过置信度感知的启发式搜索构建显式证据链,在准确性、相关性和忠实度方面优于标准 RAG 和基于图的 RAG 方法。
本文介绍了相关性感知的RipGrep搜索智能体(RARG),该智能体将相关性作为智能体搜索中语料库交互的执行先验,相比现有方法提高了准确性和效率。
本文介绍了AILQA,一个面向印度法律语境的AI驱动法律问答系统,该系统使用嵌入和生成模型并结合检索增强生成(RAG)。论文评估了其在印度法律文本和全印度律师资格考试上的性能,发现AI生成的回答有时能优于参考答案。
提出FiT,一个诊断框架,用于在微调前评估小型LLM在网络安全问答方面的能力,表明根据不同的微调模式,微调可能会降低词汇和参数化知识。提供避免不必要微调的指导。
Debate-on-Graph (DoG) 是一个框架,通过利用带有置信度的不确定知识图谱 (UKG) 增强 LLM 推理,采用启发式搜索和多智能体辩论机制生成可靠答案。在四个 QA 基准测试中达到最先进性能。
本文介绍了FinanceComplexQA,这是一个全面的基准测试,用于评估工业级金融文档上的智能体推理能力,具有双语支持、专家级问题以及跨六个场景和七个任务的复杂布局。
介绍LakeQuest,一个经过人工验证的基准测试,包含九个领域共9,846个问答对,用于评估在异构数据湖上的端到端检索与合成管道,揭示了现代问答系统中的关键故障模式。
介绍CANDI-QA,这是一个用于评估大语言模型在小众领域上下文对齐能力的数据集,包含信息辅助型和应用推理型问题。对十多个大语言模型的系统评估揭示了挑战,并提出了一个轻量级神经符号框架MTSS-Net作为基线。