bangla

标签

Cards List
#bangla

HybridRAG-BN:一种用于孟加拉语KBQA的检索增强框架与微调验证

arXiv cs.CL · 2026-08-14 缓存

本文提出了HybridRAG-BN,一种用于孟加拉语知识库问答的检索增强框架,该框架结合了混合检索、基于Gemma的生成以及LoRA微调的验证,以F1分数0.71654和0.72912获得第一名。

0 人收藏 0 人点赞
#bangla

孟加拉地区方言的多方言神经机器翻译系统

arXiv cs.CL · 2026-08-13 缓存

本文提出了一个统一的用于12种孟加拉地区方言的多方言神经机器翻译系统,引入了迄今最大的多方言平行语料库,并通过使用DoRA微调的BanglaT5模型取得了最先进的BLEU分数。

0 人收藏 0 人点赞
#bangla

形式对齐而非语义对齐:低资源孟加拉语贬损言语中LLM安全性的理解-遏制解耦

arXiv cs.CL · 2026-08-05 缓存

这篇arXiv论文对五种前沿LLM在原生孟加拉语贬损言语上的表现进行了审计,发现安全对齐未能泛化到低资源语言——尽管有高资源对齐,模型仍以高比率理解和生成不安全内容。作者提出了“理解-遏制解耦”概念,并表明推理和人格框架会进一步瓦解安全过滤器。

0 人收藏 0 人点赞
#bangla

Khondo:孟加拉语表单文档包分割的多模态基准

arXiv cs.CL · 2026-07-27 缓存

介绍了 Khondo,这是首个针对孟加拉国政府表单文档包分割的基准。它是一个原生视觉、双语数据集,涵盖多种连接方案,对 MLLMs 的零样本评估表明,页面顺序重建仍然是一个关键的未解决问题。

0 人收藏 0 人点赞
#bangla

当名字不是名字:低资源大语言模型中文化纠缠的孟加拉语同形词的基准数据集与蒸馏推理

arXiv cs.CL · 2026-07-21 缓存

本文介绍了一个包含1,516条经专家验证的孟加拉语句子的基准数据集,用于消解文化纠缠的同形词(既是名字又是普通名词的词语)。研究表明,大语言模型存在主导意义偏见,并提出了对比思维链提示和蒸馏方法来减少这种偏见。

0 人收藏 0 人点赞
#bangla

BaFCo:针对复杂孟加拉语表单理解的文档理解基准

arXiv cs.CL · 2026-07-08 缓存

提出了BaFCo,一个面向孟加拉语表单理解的基准数据集,重点关注文档布局分析(DLA)和关键信息提取(KIE)。该数据集包含200份多页复杂孟加拉国政府表单,涵盖26种实体类型的细粒度标注,并对多个多模态大型语言模型(MLLMs)进行了评估,揭示了当前模型在理解复杂孟加拉语表单方面的局限性。

0 人收藏 0 人点赞
#bangla

超越干净文本:在噪声文本中评估编码器和解码器对孟加拉语事件检测的鲁棒性

arXiv cs.CL · 2026-07-01 缓存

本文介绍了一个包含噪声文本(ASR、拼写错误)的孟加拉语事件检测基准,并评估了仅编码器和仅解码器的大语言模型,发现解码器模型对噪声的鲁棒性更强。

0 人收藏 0 人点赞
#bangla

表面礼貌,实际错误:用于修复多语言孟加拉语生成中敬语失误的精选数据集

arXiv cs.CL · 2026-05-22 缓存

本文介绍BLADE,一个文化对齐的指令微调数据集,包含4,196个交互对,用于修复多语言孟加拉语生成中的敬语失误和语用差距。在此数据集上微调DeepSeek-8B和LLaMA-3.2-3B等模型,在结构保真度和敬语对齐方面取得了显著改进。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈