标签
本文介绍了AILQA,一个面向印度法律语境的AI驱动法律问答系统,该系统使用嵌入和生成模型并结合检索增强生成(RAG)。论文评估了其在印度法律文本和全印度律师资格考试上的性能,发现AI生成的回答有时能优于参考答案。
提出FiT,一个诊断框架,用于在微调前评估小型LLM在网络安全问答方面的能力,表明根据不同的微调模式,微调可能会降低词汇和参数化知识。提供避免不必要微调的指导。
Debate-on-Graph (DoG) 是一个框架,通过利用带有置信度的不确定知识图谱 (UKG) 增强 LLM 推理,采用启发式搜索和多智能体辩论机制生成可靠答案。在四个 QA 基准测试中达到最先进性能。
本文介绍了FinanceComplexQA,这是一个全面的基准测试,用于评估工业级金融文档上的智能体推理能力,具有双语支持、专家级问题以及跨六个场景和七个任务的复杂布局。
介绍LakeQuest,一个经过人工验证的基准测试,包含九个领域共9,846个问答对,用于评估在异构数据湖上的端到端检索与合成管道,揭示了现代问答系统中的关键故障模式。
介绍CANDI-QA,这是一个用于评估大语言模型在小众领域上下文对齐能力的数据集,包含信息辅助型和应用推理型问题。对十多个大语言模型的系统评估揭示了挑战,并提出了一个轻量级神经符号框架MTSS-Net作为基线。
ResearchQA是一个新基准,包含来自八个领域494篇开放获取论文的6,211个单论文问答对,旨在通过要求可验证引用并在证据不足时支持基于理由的拒绝,来评估基于引用的问答能力。
CLIR-Bench是一个针对不规则采样临床时间序列的多模态问答基准,基于ICU记录构建,包含跨越11个临床变量的6,600个问答实例。它揭示了现有通用模型在处理稀疏时间证据方面的困难,突显了开发更强的不规则时间序列推理方法的必要性。
PolyUQuest 是一个可验证、结构感知的 Web RAG 框架,利用异构图统一超链接拓扑、DOM 层次结构和实体关系知识,在答案正确性、覆盖率和忠实度方面优于现有系统。
本文介绍了NLPCC 2026 共享任务1:难度感知的多语言多模态医学教学视频理解评估(DA-MIVQA)。该任务在以往基准测试的基础上,增加了难度感知标注,并包含三个赛道:时间答案定位、视频语料库检索以及语料库内定位。数据集来自公共频道的医学教学视频,旨在评估系统在不同推理需求下的表现。
本文通过一项实证研究,比较了来自四个库(Ragas、DeepEval、RAGChecker、Opik)的RAG评估指标与人工判断及标准召回指标,并基于商业数据创建了问答数据集。
本文将PubHealthBench扩展至检索增强场景,系统评估了公共卫生问答中的检索与生成选择,结果表明混合检索能提升准确率,且使用检索的较小模型可媲美较大模型。
本文介绍了RSF-GLLM,一个将可微图推理与LLM生成解耦的框架,以解决多跳知识图谱问答中的语义鸿沟问题,在实现竞争性性能的同时,具有卓越的推理效率。
介绍 MultAttnAttrib,一种用于长文档问答中多模态归因的免训练方法,以及 MultAttrEval 基准测试。它优于基于提示的方法,并与 GPT-5.4 等前沿模型相当。
介绍MetaFlow,一种通过结合监督微调和带执行反馈的强化学习来训练大语言模型为零样本任务生成工作流的方法,实现对未训练任务和算子集的强大泛化能力。
本文介绍了MamaBench和MamaRetrieval两个基准测试,用于评估母婴、新生儿及生殖健康领域的医学检索增强生成,填补了现有问答和检索数据集的空白。
本文提出TriageRA-CCF,一种用于医学问答中LoRA自适应秩预算的方法。它利用源端信号(基座模型置信度、临床覆盖、反事实代理)动态选择秩预算,在Qwen3-8B和Llama3.1-8B上取得了适度的准确率提升。
AB-RAG是一种无需训练、骨干无关的框架,通过估计答案置信度自适应地检索段落以进行问答,在多个骨干和数据集上提高了效率和准确性。
PASTA是一种新颖的LLM知识更新框架,结合数据增强、问答生成和自学习DPO技术,整合新闻文章中的事实信息,在保持通用能力的同时,将准确率从0.02提升至0.82。
提出 OPI,一种面向多跳知识图谱问答的本体引导框架,利用以关系为中心的本体图进行双向检索和迭代精炼,在多个基准上取得了最先进的结果。