标签
本文研究了用户提示中的礼貌和不礼貌表达如何影响LLM在三种语言和五个主流模型上的响应,发现礼貌效应是语言和模型相关的,而非通用的。作者发布了PLUM多语言语料库,包含1,500个人工验证的提示和礼貌标注,并使用八个因素评估响应质量。