bengali

标签

Cards List
#bengali

BengaliMCQ:低资源语言中学术多项选择题的自动化生成与答案预测

arXiv cs.CL · 6天前 缓存

BengaliMCQ是一个结构感知的RAG框架,利用图神经网络建模孟加拉语文本教材的层次化文档结构,实现学术多项选择题的自动化生成与答案预测,并在性能上优于基线方法。

0 人收藏 0 人点赞
#bengali

PatiGonit22K:用于解决复杂孟加拉语数学应用题的综合数据集

arXiv cs.CL · 2026-07-28 缓存

介绍了PatiGonit22K,这是一个扩展后的孟加拉语数学应用题数据集,包含22,441个问题,包括复杂的多步运算问题,旨在推动低资源语言数学推理研究的发展。

0 人收藏 0 人点赞
#bengali

分词器移植:缓解边缘高效孟加拉语ASR中的自回归崩溃

arXiv cs.CL · 2026-07-13 缓存

本文提出了一种适用于Moonshine等轻量级ASR模型的分词器移植流程,以解决孟加拉语中的自回归崩溃问题。通过将以英语为中心的分词器替换为BanglaBERT的WordPiece词汇表,词元繁殖度从9.16降至1.30,序列长度减少85.8%,在Lipi-Ghor数据集上实现了21.54%的词错误率(WER)。

0 人收藏 0 人点赞
#bengali

BanglaMemeEvidence:用于孟加拉语模因的解释性证据检测的多模态基准数据集

arXiv cs.CL · 2026-07-07 缓存

本文介绍了BanglaMemeEvidence,这是一个包含2,917个孟加拉语模因的多模态数据集,这些模因经过注释用于解释性证据检测,并提出了BengaliMemeEvidenceNet,一个混合框架,实现了0.74的F1分数。

0 人收藏 0 人点赞
#bengali

BenSyc:孟加拉语境下LLM对话谄媚与人类对齐的基准评估

Hugging Face Daily Papers · 2026-06-08 缓存

研究人员推出了BenSyc,这是首个在孟加拉社会语境中评估对话谄媚的基准,发现大语言模型难以区分共情支持与验证及升级行为,仅达到约61%的Macro-F1。

0 人收藏 0 人点赞
#bengali

当英语改写本地知识:大语言模型中的全球叙事主导

arXiv cs.CL · 2026-06-01 缓存

本文介绍了CulturalNB(一个孟加拉文化问答对数据集),并评估了九种大语言模型的跨语言文化偏见。研究结果表明,英文提示会增加全球叙事替代并减少本地视角,揭示了大语言模型中的文化失败是立足点和优先级问题,而不仅仅是知识缺失。

0 人收藏 0 人点赞
#bengali

MultiSoc-4D:用于诊断孟加拉语社交媒体封闭集大语言模型标注中指令诱导标签崩溃的基准

arXiv cs.CL · 2026-05-11 缓存

本文介绍了 MultiSoc-4D,这是一个用于诊断大语言模型在标注孟加拉语社交媒体数据时出现的指令诱导标签崩溃问题的基准测试。研究揭示,大语言模型系统性地倾向于使用默认标签,导致对仇恨言论和讽刺等少数类别的检测不足。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈