multi-hop-qa

标签

Cards List
#multi-hop-qa

用于免训练多跳问答的图与文本记忆协同进化

arXiv cs.CL · 2026-07-28 缓存

提出Co-E,一种免训练系统,同步图记忆与文本记忆用于多跳问答,在六个基准上优于可比的免训练基线。

0 人收藏 0 人点赞
#multi-hop-qa

HyCE-RAG: 基于超图证据链的检索增强生成用于可解释的多跳问答

arXiv cs.AI · 2026-07-28 缓存

HyCE-RAG 是一种新颖的基于超图的检索增强生成框架,专为多跳问答设计,通过置信度感知的启发式搜索构建显式证据链,在准确性、相关性和忠实度方面优于标准 RAG 和基于图的 RAG 方法。

0 人收藏 0 人点赞
#multi-hop-qa

THOR: 一种基于Theta-Gamma层级振荡的多跳问答推理框架

arXiv cs.CL · 2026-07-24 缓存

THOR提出了一种受大脑启发的推理框架,利用theta-gamma层级振荡来减轻多跳问答中的注意力衰退和错误累积,在基准测试中实现了更高的准确性和鲁棒性。

0 人收藏 0 人点赞
#multi-hop-qa

语言模型推理的选择性状态空间适配与检索

arXiv cs.CL · 2026-07-22 缓存

提出了MaLoRA和MaRA两种适配器系列,在冻结的语言模型中引入选择性状态空间递归,实现token级和上下文级适配,在MuSiQue和2WikiMultihopQA等多跳推理基准上取得了显著提升。

0 人收藏 0 人点赞
#multi-hop-qa

面向非常规求解器的检索增强问答中的QUBO优化证据选择

arXiv cs.CL · 2026-07-15 缓存

本文提出了一种基于QUBO的方法,用于在检索增强问答中选择证据段落,该方法实现了与基于LLM的选择器相竞争的性能,同时支持使用量子退火器等非常规求解器。

0 人收藏 0 人点赞
#multi-hop-qa

DeepSearch-World:可验证环境中深度搜索代理的自我蒸馏

arXiv cs.CL · 2026-07-10 缓存

DeepSearch-Evolve 引入了一个用于 Web 代理的自我蒸馏框架,该框架使用可验证环境(DeepSearch-World)和 420K 多跳问答任务,无需从更强模型蒸馏即可实现有竞争力的性能。

0 人收藏 0 人点赞
#multi-hop-qa

探针而非提示:Multi-Meta-RAG 中基于隐藏状态的元数据过滤探针

arXiv cs.CL · 2026-07-07 缓存

本文提出用一个小型开源模型的隐藏状态训练的轻量级确定性探针替代 Multi-Meta-RAG 中专有的 GPT-3.5 元数据提取器。该探针达到 90.9% 的准确率,优于 GPT-3.5(80.9%)和子串基线(88.0%),同时避免了允许列表漂移和 API 成本。

0 人收藏 0 人点赞
#multi-hop-qa

面向Agentic RAG管道的贝叶斯不确定性传播:关于多跳问答的概念验证研究

arXiv cs.AI · 2026-07-02 缓存

本文提出了一种面向Agentic RAG系统的贝叶斯不确定性传播框架,并在使用GPT模型的多跳问答基准上进行了评估,显示出在工业决策支持中监控可靠性的潜力。

0 人收藏 0 人点赞
#multi-hop-qa

HistoriQA-ThirdRepublic:面向历史研究的多跳问答语料库——基于法兰西第三共和国(1870-1940)议会辩论

arXiv cs.AI · 2026-07-01 缓存

本文介绍了HistoriQA-ThirdRepublic,一个基于法兰西第三共和国历史文献的法语多跳问答数据集,旨在评估检索增强和大型语言模型系统在历史研究场景中的表现。

0 人收藏 0 人点赞
#multi-hop-qa

ProvenAI:生成答案中的溯源原生证据追踪

arXiv cs.CL · 2026-06-26 缓存

ProvenAI 提出了一种框架,将多跳问答中的透明度分解为三个可独立衡量的层次:答案正确性、引用忠实度和每文档影响力,揭示了一个引用-影响力差距,即被引用的来源可能影响力较弱,而未引用的来源却显著影响输出。

0 人收藏 0 人点赞
#multi-hop-qa

AGORA: 基于档案的智能体工作场所文档推理基准

arXiv cs.CL · 2026-06-24 缓存

AGORA 是一个新的基准,用于评估大型语言模型在工作场所文档上进行基于档案的推理任务,包含 362 个问题,涉及 9,664 份真实文档。最强模型仅达到 59.4% 的准确率,凸显出巨大的改进空间。

0 人收藏 0 人点赞
#multi-hop-qa

@teach_fireworks: https://x.com/teach_fireworks/status/2067243590447952212

X AI KOLs Timeline · 2026-06-17 缓存

SAG(SQL-Augmented Generation)是一种基于SQL的检索增强生成新方法,通过将数据块转换为事件和实体,利用SQL连接查询实现多跳推理,在MuSiQue数据集上Recall从65.13%提升至80.04%,支持约5亿条数据的秒级线上检索,已开源。

0 人收藏 0 人点赞
#multi-hop-qa

超越并行采样:面向智能体搜索的多样化查询初始化

arXiv cs.AI · 2026-06-17 缓存

本文识别了智能体搜索中的锚点坍塌现象,即并行轨迹因相似的初始查询而收敛,并提出了 DivInit,一种无需训练的方法,通过采样多样的初始查询来提升多跳问答的性能。

0 人收藏 0 人点赞
#multi-hop-qa

上下文压缩并非单一方法:匹配预算下可读符号重表达与连贯摘要的对比

arXiv cs.CL · 2026-06-16 缓存

本文提出Telegraph English,一种可读的符号格式用于上下文压缩,在多跳问答数据集上优于匹配预算的基线方法,更密集地保留了实体内容。

0 人收藏 0 人点赞
#multi-hop-qa

大型语言模型中用于结构推理的视觉图支架

arXiv cs.AI · 2026-06-03 缓存

本文探讨了将视觉图思维导图用作LLMs的推理支架,发现即使没有直接答案提示,视觉引导仍然有效,而将图扁平化为文本则会失去优势。

0 人收藏 0 人点赞
#multi-hop-qa

ARBOR:通过可复用评分缓存为搜索代理提供在线过程奖励

arXiv cs.CL · 2026-06-03 缓存

ARBOR 引入了一种可复用的评分缓存,为基于LLM的搜索代理提供在线过程奖励,在仅依赖结果奖励不足时提升训练效率。它在多跳问答基准测试中优于 GRPO 和 DAPO,将多达42%的零梯度训练组转化为信息丰富的训练组。

0 人收藏 0 人点赞
#multi-hop-qa

StepGap: 一种混合NLI-LLM检测器用于多跳问答中的步骤级证据缺口检测

arXiv cs.CL · 2026-05-26 缓存

StepGap是一个混合NLI-LLM决策树,用于检测多跳问答中的步骤级证据缺口,并将其标记为矛盾声明、无关证据或缺失桥梁。它在实现有竞争力的F1分数的同时,提供了一种可分解的结构,当用作强化学习的过程奖励时,可以提高下游问答的性能。

0 人收藏 0 人点赞
#multi-hop-qa

通过逐步置信归因诊断黑盒大语言模型中的多步推理失败

arXiv cs.CL · 2026-05-20 缓存

提出逐步置信归因(SCA),一个无需内部访问即可为黑盒大语言模型的推理轨迹分配逐步置信度的框架,利用信息瓶颈原理区分合法变异性与错误。实验表明,SCA能可靠地识别低置信度步骤,并将自纠正成功率相比答案级别反馈提升高达13.5%。

0 人收藏 0 人点赞
#multi-hop-qa

利用知识图谱路径作为自进化搜索代理的中间监督

arXiv cs.AI · 2026-05-08 缓存

本文介绍了一种利用知识图谱路径作为中间监督来提升自进化搜索代理性能的方法。该方法通过将问题构建建立在关系上下文之上,并引入航点覆盖奖励(Waypoint Coverage Reward)以实现分级部分奖励,从而解决了搜索自博弈(Search Self-Play)中的瓶颈问题。

0 人收藏 0 人点赞
#multi-hop-qa

大语言模型搜索代理的推理时预算控制

arXiv cs.AI · 2026-05-08 缓存

本文提出了一种用于大语言模型(LLM)搜索代理的两阶段推理时预算控制方法,利用信息价值(VOI)分数在多跳问答过程中优化工具调用和 Token 分配。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈