HybridRAG-BN:一种用于孟加拉语KBQA的检索增强框架与微调验证

arXiv cs.CL 论文

摘要

本文提出了HybridRAG-BN,一种用于孟加拉语知识库问答的检索增强框架,该框架结合了混合检索、基于Gemma的生成以及LoRA微调的验证,以F1分数0.71654和0.72912获得第一名。

arXiv:2608.13004v1 公告类型:新 摘要:知识库问答(KBQA)系统依赖有效的检索和推理机制,从外部知识源生成准确答案。然而,对于孟加拉语等低资源语言,由于检索相关研究有限、语言资源稀缺,以及将生成响应锚定到外部知识的困难,开发可靠的KBQA系统仍然具有挑战性。在这项工作中,我们提出了HybridRAG-BN,一种用于孟加拉语KBQA的检索增强框架,该框架集成了使用BM25和BGE-M3的混合检索、使用GGUF版本的Gemma-4-31B-Instruct进行答案生成,以及一个LoRA微调的Gemma-4-31B-Instruct模型用于答案验证和细化。为了进一步提高鲁棒性,该框架还包含一个后处理阶段,通过回退答案替换和DuckDuckGo辅助检索来解决未处理的情况。实验结果表明了所提框架的有效性,在公共和私有排行榜上分别取得了0.71654和0.72912的token级F1分数,在比赛中获得第一名。
查看原文
查看缓存全文

缓存时间: 2026/08/14 09:28

# HybridRAG-BN:具备微调验证能力的孟加拉语KBQA检索增强框架
来源:https://arxiv.org/abs/2608.13004
查看 PDF (https://arxiv.org/pdf/2608.13004)

> 摘要:知识库问答(KBQA)系统依赖有效的检索和推理机制,从外部知识源生成准确答案。然而,对于孟加拉语等低资源语言,开发可靠的KBQA系统仍然充满挑战,原因在于面向检索的研究有限、语言资源稀缺,以及难以将生成的回答与外部知识进行有效关联(grounding)。在这项工作中,我们提出了HybridRAG-BN,一个面向孟加拉语KBQA的检索增强框架,该框架整合了基于BM25和BGE-M3的混合检索、使用GGUF版Gemma-4-31B-Instruct进行答案生成,以及经过LoRA微调的Gemma-4-31B-Instruct模型用于答案验证与精炼。为进一步提升鲁棒性,该框架包含一个后处理阶段,通过回退答案替换和DuckDuckGo辅助检索来处理未解决的案例。实验结果表明,所提出框架是有效的,在公共排行榜和私有排行榜上分别取得了0.71654和0.72912的token级F1分数,最终在比赛中获得第一名。

## 提交历史

来自:Nirjhar Das [查看电子邮件 (https://arxiv.org/show-email/c2c0315a/2608.13004)] **[v1]** 2026年8月13日星期四 09:24:48 UTC(534 KB)

相似文章

当检索无济于事:一项大规模生物医学 RAG 研究

arXiv cs.CL

这项大规模研究涵盖 5 个模型(7B–72B)、10 个生物医学问答数据集、4 种检索方法和 4 个语料库,发现在生物医学问答任务中,RAG 相比无检索基线仅带来微小且不稳定的提升(1–2 个百分点)。研究得出结论:主要瓶颈并非检索质量,而是模型有效利用检索证据的能力有限。

MM-BizRAG:重新思考面向通用企业问答的多模态检索增强生成

arXiv cs.CL

MM-BizRAG 是一个面向企业问答的多模态检索增强生成系统,通过文档结构感知分割和版式感知解析,在异构企业文档上的表现比以视觉为中心的基线方法最高提升 32%。该论文还提出了 FastRAGEval——一种基于 LLM 的高效评估指标,其与人类判断的对齐程度优于 RAGChecker,且成本更低。