HybridRAG-BN:一种用于孟加拉语KBQA的检索增强框架与微调验证
摘要
本文提出了HybridRAG-BN,一种用于孟加拉语知识库问答的检索增强框架,该框架结合了混合检索、基于Gemma的生成以及LoRA微调的验证,以F1分数0.71654和0.72912获得第一名。
arXiv:2608.13004v1 公告类型:新
摘要:知识库问答(KBQA)系统依赖有效的检索和推理机制,从外部知识源生成准确答案。然而,对于孟加拉语等低资源语言,由于检索相关研究有限、语言资源稀缺,以及将生成响应锚定到外部知识的困难,开发可靠的KBQA系统仍然具有挑战性。在这项工作中,我们提出了HybridRAG-BN,一种用于孟加拉语KBQA的检索增强框架,该框架集成了使用BM25和BGE-M3的混合检索、使用GGUF版本的Gemma-4-31B-Instruct进行答案生成,以及一个LoRA微调的Gemma-4-31B-Instruct模型用于答案验证和细化。为了进一步提高鲁棒性,该框架还包含一个后处理阶段,通过回退答案替换和DuckDuckGo辅助检索来解决未处理的情况。实验结果表明了所提框架的有效性,在公共和私有排行榜上分别取得了0.71654和0.72912的token级F1分数,在比赛中获得第一名。
查看缓存全文
缓存时间: 2026/08/14 09:28
# HybridRAG-BN:具备微调验证能力的孟加拉语KBQA检索增强框架 来源:https://arxiv.org/abs/2608.13004 查看 PDF (https://arxiv.org/pdf/2608.13004) > 摘要:知识库问答(KBQA)系统依赖有效的检索和推理机制,从外部知识源生成准确答案。然而,对于孟加拉语等低资源语言,开发可靠的KBQA系统仍然充满挑战,原因在于面向检索的研究有限、语言资源稀缺,以及难以将生成的回答与外部知识进行有效关联(grounding)。在这项工作中,我们提出了HybridRAG-BN,一个面向孟加拉语KBQA的检索增强框架,该框架整合了基于BM25和BGE-M3的混合检索、使用GGUF版Gemma-4-31B-Instruct进行答案生成,以及经过LoRA微调的Gemma-4-31B-Instruct模型用于答案验证与精炼。为进一步提升鲁棒性,该框架包含一个后处理阶段,通过回退答案替换和DuckDuckGo辅助检索来处理未解决的案例。实验结果表明,所提出框架是有效的,在公共排行榜和私有排行榜上分别取得了0.71654和0.72912的token级F1分数,最终在比赛中获得第一名。 ## 提交历史 来自:Nirjhar Das [查看电子邮件 (https://arxiv.org/show-email/c2c0315a/2608.13004)] **[v1]** 2026年8月13日星期四 09:24:48 UTC(534 KB)
相似文章
BengaliMCQ:低资源语言中学术多项选择题的自动化生成与答案预测
BengaliMCQ是一个结构感知的RAG框架,利用图神经网络建模孟加拉语文本教材的层次化文档结构,实现学术多项选择题的自动化生成与答案预测,并在性能上优于基线方法。
AB-RAG:自适应预算检索增强生成用于可靠问答
AB-RAG是一种无需训练、骨干无关的框架,通过估计答案置信度自适应地检索段落以进行问答,在多个骨干和数据集上提高了效率和准确性。
RAGA:用于自主知识图谱构建和检索增强生成的阅读与图谱构建智能体
RAGA 是一个由大语言模型驱动的自主智能体,通过“阅读-搜索-验证-构建”的认知循环构建知识图谱,并集成混合符号-向量检索以实现检索增强生成,在科学问答数据集上取得了实验性改进。
当检索无济于事:一项大规模生物医学 RAG 研究
这项大规模研究涵盖 5 个模型(7B–72B)、10 个生物医学问答数据集、4 种检索方法和 4 个语料库,发现在生物医学问答任务中,RAG 相比无检索基线仅带来微小且不稳定的提升(1–2 个百分点)。研究得出结论:主要瓶颈并非检索质量,而是模型有效利用检索证据的能力有限。
MM-BizRAG:重新思考面向通用企业问答的多模态检索增强生成
MM-BizRAG 是一个面向企业问答的多模态检索增强生成系统,通过文档结构感知分割和版式感知解析,在异构企业文档上的表现比以视觉为中心的基线方法最高提升 32%。该论文还提出了 FastRAGEval——一种基于 LLM 的高效评估指标,其与人类判断的对齐程度优于 RAGChecker,且成本更低。