标签
FriendBench 是一个新的基准测试,用于评估人类和多模态大语言模型是否能够从一段20秒的破冰对话视频片段中推断出两个人是熟人还是陌生人。结果表明,最佳模型在准确率上与人类相当,但在偏差上有所不同,并且只有人类能从更丰富的视觉行为中受益。
本文评估了用于测量远程双人协作任务中对话状态(如认知负荷和权力)的多模态特征的预测准确性、跨任务泛化能力和重测信度。研究结果表明,语言特征预测良好但泛化能力差,在控制说话者身份后声学可靠性下降,而交互特征提供了最可靠的信号。
本文介绍了DEPOOL,一个受控基准,评估了六种时序聚合架构在六种冻结语音主干网络上的表现,用于双人交互中的抑郁检测,发现许多配置会坍缩为单类别预测,并且鲁棒性应作为一个关键标准。