标签
本文介绍了Tactus,一种开放词汇触觉识别模型,将低成本压力阵列数据映射到文本嵌入,在STAG基准上仅使用187条训练记录且无分类器头的情况下,匹配甚至超过了监督式闭集CNN基线。
介绍了OVEarth-Bench,一个用于开放词汇地球观测的基准,扩展了类别覆盖和查询多样性,揭示了现有方法仍有限,而基于MLLM的方法表现最佳。
本文介绍了MER-R1,一个通过协同快速和慢速思维进行多模态情感识别的强化学习框架。它通过双目标解耦和慢速-快速置信度校准,联合优化召回率和精确率,从而实现了最先进的性能。
提出了一种层次化语义约束异构图模型,用于开放词汇的音视频事件定位,解决了多个时间尺度上的跨模态一致性问题以及片段级和视频级之间的层次语义约束问题。在OV-AVEL基准上取得了最先进的结果。
VoLoAgent 将视觉语言模型与机器人能力相结合,用于开放词汇长程操作任务,引入了一个物理编排器,该编排器使用可中断工具进行规划、监控和恢复,并提出了一个名为 RoboVoLo 的基准用于评估。
本文介绍了 DiGSeg 框架,该框架利用潜在空间条件控制和文本引导对齐,将预训练的扩散模型重新用于实现最先进的语义分割和开放词汇分割。
Grounding DINO 是一个开放词汇的目标检测模型,能够根据文本描述检测任意对象,现已在 Replicate 上可用。