标签
FriendBench 是一个新的基准测试,用于评估人类和多模态大语言模型是否能够从一段20秒的破冰对话视频片段中推断出两个人是熟人还是陌生人。结果表明,最佳模型在准确率上与人类相当,但在偏差上有所不同,并且只有人类能从更丰富的视觉行为中受益。