同一代理,不同答案:基于重复感知的检索增强问答中语料库引发的答案波动审计
摘要
本文引入了检索增强问答系统中忽略准确率的答案波动现象,并提出了快照兼容性审计,用于在语料库更新时检测隐藏的答案变化,即使整体准确率看似稳定。
查看缓存全文
缓存时间: 2026/08/25 04:34
论文页面 - 同一代理,不同答案:基于检索增强问答中语料库诱发答案波动的重复感知审计
来源:https://huggingface.co/papers/2608.22856
摘要
检索增强型问答系统在索引更新过程中可能表现出隐蔽的答案波动,而准确率并未出现明显变化。这表明在评估效用的同时,还需要进行兼容性审计。
检索增强型问答(https://huggingface.co/papers?q=retrieval-augmented%20QA)系统在索引扩展(https://huggingface.co/papers?q=index%20expansion)后可能返回不同的答案,即使所请求的模型标识符、提示词、检索策略、证据深度、呈现方式以及暴露的生成控制参数均保持不变。当增益与损失相互抵消时,聚合准确率可能掩盖这些变化,而普通的生成变异性会使得单次比较夸大更新效应。我们将这一隐藏现象称为准确率盲答案波动(https://huggingface.co/papers?q=accuracy-blind%20answer%20churn),并引入快照兼容性审计(https://huggingface.co/papers?q=Snapshot%20Compatibility%20Audit)方法。该方法通过从跨快照差异中减去同一快照内的重复异议,来估计多余的答案波动。我们通过将一个冻结的FineWeb(https://huggingface.co/papers?q=FineWeb)前缀从一个分片扩展到七个分片来实例化该方法。在一项预先注册的400题Natural Questions(https://huggingface.co/papers?q=Natural%20Questions)研究中,归一化精确匹配和盲语义多余波动分别为6.44和10.25个百分点,而精确匹配准确率仅变化-1.50个百分点。事后分析发现,在40/400道题目中存在重复稳定的语义翻转。另一项单独预先注册的200题TriviaQA(https://huggingface.co/papers?q=TriviaQA)研究产生了较小但方向一致的多余波动,而精确匹配准确率则朝相反方向移动。一项使用第二个DeepSeek(https://huggingface.co/papers?q=DeepSeek)生成器和服务配置的事后盲测100题子集复现研究发现,即使精确匹配提高了3.00个百分点,仍存在8.75个百分点的语义多余波动。因此,答案级兼容性可能在效用没有显著或一致方向转变的情况下失效。检索增强型发布应在评估效用的同时进行兼容性审计。
查看arXiv页面 (https://arxiv.org/abs/2608.22856) 查看PDF (https://arxiv.org/pdf/2608.22856) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2608.22856)
通过您的代理获取此论文:
hf papers read 2608\.22856
没有最新的CLI? curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
没有模型关联本文
在模型README.md中引用arxiv.org/abs/2608.22856以从本页面关联。
引用本文的数据集0
没有数据集关联本文
在数据集README.md中引用arxiv.org/abs/2608.22856以从本页面关联。
引用本文的Spaces0
没有Space关联本文
在Space README.md中引用arxiv.org/abs/2608.22856以从本页面关联。
包含本文的收藏集0
没有收藏集包含本文
将本文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面关联。
相似文章
答案存在性驱动RAG重写增益
本文研究在RAG问答流程中,重写检索段落所带来的性能提升是否因果性地由重写上下文中出现黄金答案字符串所驱动,并通过跨多个模型和数据集的受控干预审计进行验证。
选择性问答中的渐近风险校准
本文提出了 A-CRC-QA,一种用于选择性问答的事后校准框架,通过渐近风险校准控制已接受答案中的错误率,并在 CoQA 和 MedMCQA 上展示了更好的可靠性与保留率之间的权衡。
识别与解决知识型VQA基准测试的陷阱:审计、修复与增强
本文对知识型VQA基准进行了审计,揭示了系统性的假设违反,使得准确率成为误导性指标。它提出了一种修复协议和多实体增强方法,以恢复答案可推导性和问题清晰度,表明修正后的设置产生了显著不同的模型排名。
AB-RAG:自适应预算检索增强生成用于可靠问答
AB-RAG是一种无需训练、骨干无关的框架,通过估计答案置信度自适应地检索段落以进行问答,在多个骨干和数据集上提高了效率和准确性。
无评估可捕捉的智能体失败模式:使用缓存的过时事实
讨论AI智能体可靠性中的一个盲点:缓存在获取时是真实的事实,但在使用时已经过时,导致一致但不正确的行为。提出将一致性(与源匹配)与时效性(源目前仍然真实)分开,并询问社区如何处理这个问题。