标签
介绍了BavGround,一个用于评估大语言模型在英语、德语和巴伐利亚语中的地区文化接地与方言能力的基准,发现模型在方言化和本地化的文化知识方面表现不佳。
本文提出了一个统一的用于12种孟加拉地区方言的多方言神经机器翻译系统,引入了迄今最大的多方言平行语料库,并通过使用DoRA微调的BanglaT5模型取得了最先进的BLEU分数。
本文介绍了VialectBench,这是一个评估LLM在六种越南方言群体和四项任务上鲁棒性的基准,发现平均性能下降2.82%,且没有模型完全不受方言影响。
本文研究了通过识别稀疏神经元群体和提取方言激活方向来引导阿拉伯语大语言模型生成特定方言的方法,从而在不进行微调的情况下实现推理时的方言控制。
对 Qwen3.5-35B-A3B 的测试表明,使用 AAVE 编码的提示会导致 MoE 模型做出不同响应,拒绝层掩盖了方言条件化的安全失效,当拒绝被削弱时,这些失效变得可见。