标签
介绍CCBench,一个通过健康查询和使用跨六种文化的角色评估LLM文化能力的框架,发现即使是最佳模型也仅有20-30%的回答具有文化适切性。
本文介绍了CulturalNB(一个孟加拉文化问答对数据集),并评估了九种大语言模型的跨语言文化偏见。研究结果表明,英文提示会增加全球叙事替代并减少本地视角,揭示了大语言模型中的文化失败是立足点和优先级问题,而不仅仅是知识缺失。
实证研究显示,前沿LLM在描述和评判全球街景时编码了一种偏向西方视角的文化倾斜基线,非西方提示系统性偏离默认更远。