BengaliMCQ:低资源语言中学术多项选择题的自动化生成与答案预测

arXiv cs.CL 论文

摘要

BengaliMCQ是一个结构感知的RAG框架,利用图神经网络建模孟加拉语文本教材的层次化文档结构,实现学术多项选择题的自动化生成与答案预测,并在性能上优于基线方法。

arXiv:2608.15547v1 公告类型:新 摘要:传统的检索增强生成(RAG)框架在处理文档时未考虑其层次化结构,导致性能不佳,尤其在低资源语言如孟加拉语中。为了解决这个问题,我们提出一个结构感知的RAG框架,将孟加拉语文本教材建模为层次化图,并使用对比训练的图神经网络检索少量相关段落。这些段落为大型语言模型提供聚焦的上下文,实现主题特定的多项选择题(MCQ)生成与领域内答案预测。实验结果表明,我们的框架在各项检索指标上优于强密度检索基线方法,生成更相关的MCQ,并达到更优的答案预测准确率。
查看原文
查看缓存全文

缓存时间: 2026/08/18 10:11

# BengaliMCQ:低资源语言中学术多项选择题的自动生成与答案预测
来源:https://arxiv.org/html/2608.15547
\[orcid=https://orcid.org/0009-0002-1099-7337\]
\[orcid=https://orcid.org/0009-0002-9939-6553\]
\[orcid=https://orcid.org/0009-0003-1966-7729\]
\[orcid=https://orcid.org/0000-0001-6797-7826\]

A.K.M. Nihalul Kabir [email protected], Sm Azmain Faysal [email protected], Ariana Haque Ami [email protected], Lawrence Amlan Gomes [email protected], Farig Sadeque [email protected]

组织=计算机科学与工程系,BRAC大学,地址行=Kha 224 Pragati Sarani, Merul Badda, 城市=达卡, 邮编=1212, 国家=孟加拉国

###### 摘要

传统的检索增强生成(RAG)框架在处理文档时未关注其层次结构,导致性能不佳,尤其是在孟加拉语等低资源语言中。为解决此问题,我们提出了一种结构感知的RAG框架,将孟加拉语教科书建模为层次图,并使用对比训练的图神经网络检索少量相关段落。这些段落为大型语言模型提供了聚焦的上下文,从而能够生成特定主题的多项选择题(MCQ)并进行领域内答案预测。实验结果表明,我们的框架在检索指标上优于强大的密集检索基线,生成的MCQ更具相关性,并达到了更高的答案预测准确率。

###### 关键词

MCQ生成,图引导RAG,答案预测,层次图

††credit:概念化、方法论、原始草稿撰写††credit:方法论、原始草稿撰写、审阅与编辑††credit:方法论、形式分析、可视化††credit:数据整理、形式分析††credit:数据整理、调查††credit:概念化、监督††corresponding:通讯作者

## 1 引言

自动MCQ生成已成为大型语言模型(LLM)的一种流行下游应用,尤其是随着其能力的最新发展。然而,其有效性很大程度上取决于提供给它们的输入上下文的相关性。对于特定主题的问题生成,由于其上下文窗口限制,将整个教科书章节作为LLM的输入是不切实际的。即使提供了整个章节,语言模型也可能无法始终关注最相关的段落。检索增强生成(RAG)通过为LLM提供相对较小且有针对性的上下文集来解决此问题。标准密集检索通常忽略文档的层次结构,导致性能下降,尤其是在文本为孟加拉语等低资源语言时。

图表示可以通过捕获文档内的各种关系来解决此限制。然而,大多数现有工作集中在高资源语言上。在本文中,我们介绍了BengaliMCQ,这是一个文档图引导的自动化系统,它在孟加拉语中生成高度主题相关的学术MCQ,并以高准确率预测领域内MCQ的答案。总结来说,我们的贡献包括:

- •我们实现了一个基于GNN的检索框架,通过对教科书的层次结构建模来学习对查询相关段落进行排序,从而在不牺牲覆盖范围的情况下减少上下文长度。
- •我们通过自动指标和专家验证评估了我们的方法,表明我们的框架在检索质量、问题质量和答案准确性方面优于基线。
- •我们提供了一项消融研究,以分析我们设计选择的贡献并证明其价值。

## 2 相关工作

尽管早期的自动MCQ生成工作依赖于概率和基于规则的方法,如TF-IDF、n-gram和词性标注[1 (https://arxiv.org/html/2608.15547#bib.bib1)],但该领域很快发展到基于神经网络和Transformer的框架。例如,微调基于T5和BERT的模型[2 (https://arxiv.org/html/2608.15547#bib.bib2)、3 (https://arxiv.org/html/2608.15547#bib.bib3)]已成为问题生成、命名实体识别和问答等下游NLP任务的既定标准。Mehta等人在2021年[4 (https://arxiv.org/html/2608.15547#bib.bib4)]提出了一种值得注意的将Transformer与基于规则的方法相结合的混合方法,该方法使用BERTSUM模型对文本进行摘要,并使用快速自动关键词提取算法提取关键词,以创建填空式MCQ。干扰项(错误选项)是基于WordNet的上位词和下位词关系生成的。然而,如Maity等人在2024年[5 (https://arxiv.org/html/2608.15547#bib.bib5)]所示,LLM可以通过结构化多阶段提示生成更高质量的干扰项。目前,该领域由LLM主导。近期工作尝试利用LLM,通过结合不同提示工程技术与人类引导的审查[6 (https://arxiv.org/html/2608.15547#bib.bib6)],进行自动MCQ生成和评估。然而,这些系统通常在长上下文文档上会出现性能下降[7 (https://arxiv.org/html/2608.15547#bib.bib7)]。据我们所知,尚无先前的工作利用教科书的文档结构来生成主题相关的MCQ。

最近的研究开始将图与RAG融合,以映射和建模这些结构关系。Iyer等人在2023年[8 (https://arxiv.org/html/2608.15547#bib.bib8)]在离线学习期间创建的临时图上训练了一个GNN,该图通过建模问答句子对之间的关系用于答案句子选择(AS2)任务。另一个与我们密切相关的近期基于GNN的框架是AutoRev[9 (https://arxiv.org/html/2608.15547#bib.bib9)],它将研究论文的结构建模为层次文档。作者使用GNN检索最显著的段落,以自动生成学术同行评审。受这些方法的启发,我们的工作采用基于GNN的上下文学习来检索用于MCQ生成和答案预测的最主题相关的段落。

## 3 方法论

### 3.1 文档处理

作为目标书籍,我们选择了四本中学水平的孟加拉语教科书:文学领域的"Bangla Shahitto"和"Shohopath",STEM领域的"Biology",以及社会科学领域的"Bangladesh and Global Studies"(BGS)。我们使用Tesseract-4光学字符识别[10 (https://arxiv.org/html/2608.15547#bib.bib10)]和Google Lens提取并解析文本,以检测章节、标题、子标题、段落和句子,用于第3.3节[11 (https://arxiv.org/html/2608.15547#S3.SS3)]中的节点创建。书籍的原始段落结构通过按换行符拆分得以保留,以维持学术内容的内在连贯性。

### 3.2 查询-段落数据集创建

由于我们的目标是训练一个GNN对相关段落进行排序,我们需要一个带标签的数据集,其中查询(包含主题句和简短问题)将映射到其相关的段落。然而,由于缺乏针对我们书籍的此类数据集,我们利用最新的LLM如Gemini 3.1 Pro和GPT-4创建了一个合成数据集。我们提示一个模型生成,另一个模型从各个段落或小组段落中精选多样化的查询。我们最终的数据集包含约22,000个查询-段落对,每本书大约有5,000-6,000个。对于训练-验证划分,我们使用80:20的比例。

参考标题图1:我们教科书层次图的简单示意图。Seq = 顺序边,Hier = 层次边

### 3.3 图构建

我们借鉴并丰富了Chitale等人在2025年[9 (https://arxiv.org/html/2608.15547#bib.bib9)]提出的图表示方法,通过添加加权语义边来改善上下文化。设每本书表示为一个层次有向多重图 \(\mathcal{G}=(\mathcal{V},\mathcal{E})\),其中节点 \(\mathcal{V}\) 对应解析后的章节、标题、子标题、段落和句子。随后,我们在节点之间添加双向层次边(\(\mathcal{E}_{\text{hier}}\))和顺序边(\(\mathcal{E}_{\text{seq}}\)),以允许消息在整个文档层次结构和书籍的顺序流中传递。

该表示通过添加句子节点之间的加权语义边来进一步增强,以捕获相关内容之间的长距离关系。对于每个句子 \(s\),我们为其最相似的 \(K_s\)(\(K_s \in \{3,5\}\))个邻居添加双向语义边(\(\mathcal{E}_{\text{sem}}\)),其中余弦相似度超过阈值 \(T\)(\(T \in \{0.5, 0.6, 0.7\}\))。相似度分数作为边权重。为了获得嵌入,我们使用多语言双编码器BGE-M3[11 (https://arxiv.org/html/2608.15547#bib.bib11)],该编码器在我们的查询-段落数据集上进行了微调。图1[12 (https://arxiv.org/html/2608.15547#S3.F1)]展示了一本书的文档图的简单说明。

### 3.4 GNN架构与训练

为了连贯地关注我们图中的多种类型边,我们使用在第3.2节[13 (https://arxiv.org/html/2608.15547#S3.SS2)]中创建的数据集对图注意力网络(GAT)进行监督训练。节点特征使用我们微调后的双编码器生成的嵌入(\(dim=1024\))初始化。对于段落节点,我们还评估了使用零向量和子节点平均池化嵌入进行初始化的情况。

#### 3.4.1 加权图注意力层

我们的图是异构的,包含加权和非加权边的组合;因此我们设计了一个自定义的多头注意力层。我们通过一个可学习的标量 \(\lambda\) 将语义边权重 \(w_{ij}\) 与注意力分数集成,并添加一个边类型特定的可学习偏置参数 \(b^{type}\)。因此,对于从节点 \(i\) 到节点 \(j\) 的边,基础非归一化注意力分数变为:

\[e_{ij} = \bigl[x'_{i} \parallel x'_{j}\bigr] \cdot a + \lambda \cdot w_{ij} + b^{type}, \tag{1}\]

其中 \(a \in \mathbb{R}^{\mathcal{H \times D}}\)(\(H = \mathcal{H} =\) 注意力头数,\(D = D =\) 每个头的输出维度)是一个可学习的注意力向量;\(x'_{i}\) 和 \(x'_{j}\)(\(x'_{i}, x'_{j} \in \mathbb{R}^{\mathcal{H \times D}}\))表示初始节点嵌入 \(x_i\) 和 \(x_j\)(\(x_i, x_j \in \mathbb{R}^{dim}\))的线性投影。公式1[14 (https://arxiv.org/html/2608.15547#S3.E1)]中的分数随后通过标准的LeakyReLU和softmax归一化来计算最终的注意力系数 \(\alpha_{ij}\)。

聚合通过加权和进行,权重为注意力系数。我们的流水线包含三个顺序堆叠的此类注意力层。它们的输出与原始节点嵌入连接,然后通过一个轻量级融合多层感知器(MLP)投影回初始的1024维度,以获得学习到的节点嵌入 \(h_i\)。这种残差设计缓解了GNN典型的过平滑问题[15 (https://arxiv.org/html/2608.15547#bib.bib12)]并保留了初始信号。

#### 3.4.2 训练目标

我们使用对比学习目标,具体是多正样本InfoNCE损失来训练GAT作为段落排序模型。我们使用的损失函数是:

\[ \mathcal{L} = -\log \left( \frac{\displaystyle \sum_{i \in P^{+}} \exp \left( \tau \cdot \operatorname{cossim} \left( q, h^{passage}_{i} \right) \right)}{\displaystyle \sum_{x=1}^{N_{b}} \exp \left( \tau \cdot \operatorname{cossim} \left( q, h^{passage}_{x} \right) \right)} \right) \tag{2} \]

其中 \(q\) 表示查询嵌入,\(P^{+}\) 表示其真实正样本段落,\(\tau > 0\) 是可学习的温度参数,\(h^{passage}_{i}\) 是GAT学习到的段落节点 \(i\) 的嵌入,\(N_{b}\) 是书籍中的段落总数。公式2[16 (https://arxiv.org/html/2608.15547#S3.E2)]中的损失训练模型为所有正(相关)段落分配高分,同时抑制该书所有其他段落的分数。GAT使用基于 \(K_s\) 和 \(T\) 值的各种配置进行训练,如第3.3节[17 (https://arxiv.org/html/2608.15547#S3.SS3)]中的语义边构建过程所述。这些训练好的GAT表示为 \(GAT(K_s, T)\)。

参考标题图2:端到端BengaliMCQ框架
参考标题图3:两个测试样本摘录,其中黄色高亮段落表示由GNN识别但被DPR遗漏的查询相关段落

### 3.5 段落检索与上下文化

在推理时,用户输入用于MCQ生成的主题或用于答案预测的问题。然后,系统使用训练好的GAT的排序结果检索与输入主题或问题相关的前 \(K_c\)(\(K_c = 10\))个候选段落。我们使用交叉编码器BGE-Reranker-V2-M3[11 (https://arxiv.org/html/2608.15547#bib.bib11)]对这些段落进行进一步重排序,以提高性能并减少上下文。最后,经过两阶段排序后,取最相关的前 \(K_f\)(\(K_f = 5\))个段落作为上下文化的上下文。这些段落与结构化提示一起增强后,作为输入发送给LLM,用于特定主题的问题生成或MCQ的答案预测。为给定主题或MCQ选择少量相关段落有助于减少上下文窗口和计算成本。整个框架每个步骤的说明如图2[18 (https://arxiv.org/html/2608.15547#S3.F2)]所示。

## 4 结果与分析

本节从三个方面对我们的框架进行全面评估:检索性能、下游任务性能以及我们设计选择的消融研究。

表1:不同方法在检索性能上的比较。加粗突出最佳分数,下划线表示第二佳。
| 基线 | HR@5 | Recall@5 | nDCG@5 | MRR@5 | HR@10 | Recall@10 | nDCG@10 | MRR@10 |
| :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- |
| BM25 | 0.539 | 0.506 | 0.506 | 0.506 | 0.600 | 0.600 | 0.453 | 0.434 |
| 翻译基线(DPR) | 0.753 | 0.710 | 0.618 | 0.608 | 0.821 | 0.782 | 0.642 | 0.617 |
| 稀疏检索(BGE-M3) | 0.795 | 0.760 | 0.676 | 0.666 | 0.852 | 0.820 | 0.696 | 0.674 |
| DPR(Harrier-OSS-v1) | 0.519 | 0.487 | 0.418 | 0.411 | 0.575 | 0.545 | 0.438 | 0.419 |
| DPR(Harrier-OSS微调) | 0.836 | 0.802 | 0.703 | 0.689 | 0.901 | 0.873 | 0.728 | 0.698 |
| DPR(BGE-M3微调) | 0.842 | 0.803 | 0.707 | 0.696 | 0.899 | 0.866 | 0.729 | 0.703 |
| GAT(\(K_s=5, T=0.5\)) | 0.882 | 0.851 | 0.740 | 0.720 | 0.934 | 0.911 | 0.761 | 0.726 |
| BGE-M3 + 重排序器 | 0.903 | 0.871 | 0.815 | 0.814 | 0.929 | 0.901 | 0.826 | 0.818 |
| GAT + 重排序器 | **0.922** | **0.886** | **0.828** | **0.817** | **0.954** | **0.922** | **0.842** | **0.831** |

### 4.1 检索性能

我们在查询-段落数据集的验证集(约4400个样本)上,通过与相关基线比较来评估所提出框架的检索质量。基线包括:BM25(基于词权重的稀疏检索)、多个密集段落检索(DPR)流水线、DPR + 交叉编码器(即重排序器)以及我们提出的GAT + 重排序器。如表1所示,我们的方法在所有检索指标上均优于所有基线。具体而言,仅使用GAT就已经超越了所有密集检索基线,而加上重排序器后,性能进一步提升,在所有指标上均达到最佳。

相似文章

MM-BizRAG:重新思考面向通用企业问答的多模态检索增强生成

arXiv cs.CL

MM-BizRAG 是一个面向企业问答的多模态检索增强生成系统,通过文档结构感知分割和版式感知解析,在异构企业文档上的表现比以视觉为中心的基线方法最高提升 32%。该论文还提出了 FastRAGEval——一种基于 LLM 的高效评估指标,其与人类判断的对齐程度优于 RAGChecker,且成本更低。

检索失败在哪里?评估农业咨询中的RAG架构

arXiv cs.CL

本文评估了RAG系统在孟加拉语农业咨询中的检索质量,发现性能因查询类型和语言条件而异,并引入了一个基准数据集,以强调在低资源环境中进行分层评估的必要性。

孟加拉地区方言的多方言神经机器翻译系统

arXiv cs.CL

本文提出了一个统一的用于12种孟加拉地区方言的多方言神经机器翻译系统,引入了迄今最大的多方言平行语料库,并通过使用DoRA微调的BanglaT5模型取得了最先进的BLEU分数。