标签
本文研究了AI代理如何从人类行为中学习显式社会规范,以改善动态交互中的协调,并以人-车场景作为测试平台。所提出的基于规范的大语言模型在性能上显著超越基线策略及人类-人类交互。
NormAct是一个基准,用于评估具身规划代理在隐藏社会规范遵守方面的表现,结果显示最先进的多模态大语言模型(MLLMs)在目标达成率为67.3%时,规范遵守率仅为26.4%,并提出了NormPerceptor,将任务成功率从24.2%提升至46.7%。
LoSoNA 是一个用于评估大语言模型在群聊对话中推断并适应局部社会规范能力的基准。它测试模型从先例中识别隐含规范并做出适当回应的能力。
本文提出了一种通过解决方案匹配在自然、自由形式的设置中测量社会规范一致性的框架,介绍了包含3000个丹麦语社会困境的数据集,并评估了大语言模型与人类回答之间的一致性。