标签
本文探讨了视觉-语言模型如何处理上下文知识与参数知识之间的冲突,揭示了不对称偏差:对于文本实体,模型倾向于偏好上下文信息;而对于图像实体,则偏好参数信息,原因是视觉处理较慢。
本文研究了对话时间动态(话轮对时序)作为一种轻量级模态,用于从双人临床访谈中自动检测抑郁。结果表明,一个紧凑的24维时序模块表现出色,并且在融合时能够补充标准的声学和语义特征。