标签
本研究探讨了在大型语言模型上微调文化数据是否能提升比喻语言的理解能力,反之亦然。研究发现,虽然诗歌微调能增强成语理解,但文化微调可能会降低谚语准确率,突显了两者之间关系的非直接性。
本文介绍了一个包含1,516条经专家验证的孟加拉语句子的基准数据集,用于消解文化纠缠的同形词(既是名字又是普通名词的词语)。研究表明,大语言模型存在主导意义偏见,并提出了对比思维链提示和蒸馏方法来减少这种偏见。
本文介绍了一个交叉评估框架,用于在阿拉伯文化和社会语言学知识上对LLM进行基准测试,使用人类专家真值和自动评审。作者贡献了一个针对埃及和伊拉克阿拉伯语的提示-评分标准对数据集,评估了前沿LLM,并发现文化推理仍然是自动评分的主要失败模式。
本文介绍了用于研究 LLM 中谚语条件故事生成的谚语对齐叙事数据集(PAND),发现了一个“解压缩差距”,即模型能生成流畅的故事,但未能忠实地捕捉谚语的道德和因果结构。
本文提出一个自监督框架,利用多语言自一致性和自我批评机制在不同语言间迁移文化知识,通过从本地语言表征中揭示潜在文化知识,在BLEnD基准测试的英语查询中平均提升5.03%。