更好的检索,更差的鲁棒性:多跳RAG如何放大上游ASR错误

Hugging Face Daily Papers 论文

摘要

该论文发现,多跳RAG方法会放大查询中的ASR错误,与朴素方法相比,降低了基于语音的检索系统的鲁棒性。

基于语音的应用在检索模块之前,通过自动语音识别(ASR)处理口语查询,因此ASR错误作为固定的上游约束进入管道。我们通过实证测试了对标准检索增强生成(RAG)的两个扩展——实体图链接和迭代重构——是否吸收或放大这些错误。使用通过神经网络TTS合成的四种英语口音,我们在三个多跳问答基准(HotpotQA、2WikiMultiHopQA和MuSiQue)上评估了四种RAG配置,并与干净文本的基准进行对比。尽管结构更丰富的配置在ASR输入下通常保持更高的绝对F1分数,但这两个扩展都放大了错误:在三个基准上,它们组合下的F1分数从干净文本到最高WER口音的差距比朴素密集检索大36-67%。主要的失败模式是一个或多个查询实体的损坏,在所有四种方法中,占2WikiMultiHopQA上87-96%的退化情况。两种轻量级的表层形式缓解措施保留了大部分差距,表明下游检索结构放大了剩余的实体错误。我们发布了代码和数据,地址为 https://github.com/ZhenghuaBao/spoken-multihop-rag 。
查看原文
查看缓存全文

缓存时间: 2026/08/25 08:36

论文页面 - 检索能力增强,鲁棒性下降:多跳RAG如何放大上游ASR错误

来源:https://huggingface.co/papers/2608.22872 语音界面将ASR置于检索之前,因此RAG系统接收的查询本身已存在失真。我们测试了标准的多跳方法——实体图链接与迭代重构——是能够抑制这种失真,还是将其放大。

研究发现表明,这些方法会放大失真。结构更丰富的配置在ASR输入下通常能达到更高的绝对F1值,但它们牺牲了更多纯文本优势:在三个基准测试中,使用IRCoT+HippoRAG2时,从纯文本到最高词错率口音的性能差距,比简单稠密检索时要大36%-67%。一个或多个查询实体的失真成为主要失效模式,在2WikiMultiHopQA数据集的所有四种方法中,这种失真占退化案例的87%-96%。

两种轻量级表面形式缓解方法——N-best解码与音素实体修正——未能显著缩小这一差距,这表明问题根源在于检索结构而非转录表面形式。

我们已发布代码及涵盖3个多跳问答基准×4种英语口音(3000个问题,12000条数据)的转录数据集。

相似文章

当检索无济于事:一项大规模生物医学 RAG 研究

arXiv cs.CL

这项大规模研究涵盖 5 个模型(7B–72B)、10 个生物医学问答数据集、4 种检索方法和 4 个语料库,发现在生物医学问答任务中,RAG 相比无检索基线仅带来微小且不稳定的提升(1–2 个百分点)。研究得出结论:主要瓶颈并非检索质量,而是模型有效利用检索证据的能力有限。

PRA-RAG:检索增强生成中针对检索损坏的可证明鲁棒聚合

arXiv cs.AI

PRA-RAG是一种用于检索增强生成的可证明鲁棒的聚合算法,旨在抵御对检索文本的投毒攻击。它利用嵌入空间中的几何结构来识别鲁棒子集,并提供攻击影响的理论界限,将攻击成功率降低至1%,同时保持准确率。

@vintcessun: RAG喂太多文档,检索质量反而从75%掉到40%?向量搜索被大量无关内容稀释,真实部署中命中率暴跌。 问题根源:异构文档混在一起检索,噪声淹没了信号。多智能体编排看似智能,实际引入精度-忠实度悖论——配置稍差就两头不讨好。 论文提出的MA…

X AI KOLs Timeline

This paper identifies 'vector search dilution' in RAG systems when scaling to large heterogeneous document collections, where accuracy dropped from 75% to 40% in a real-world deployment. The proposed MASDR-RAG method uses domain scoping via organizational metadata before retrieval, improving P@10 from 0.77 to 0.86 with low cost and easy deployment.