标签
本文提出了一种零样本呼吸声音分类框架,通过LLM合成的报告将音频编码器与医学术语对齐,在临床诊断任务中优于CLAP和Qwen2-Audio等模型。
本文介绍了V2TATC,一个用于空中交通管制员情境感知的联合语音-轨迹嵌入框架,并引入了一个用于拥挤空域跨模态检索实验的新型数据集。
MedTVL是一种文本引导的双路径架构,用于医学时间序列分类,它协同时间模态和视觉模态与文本语义,在各种学习设置中展示优越性。
本文提出了Graph-CMMC,一种基于图的伪多模态对比学习框架,用于12导联心电图表示。该框架有效建模导联间依赖关系,在心脏病分类中取得了具有竞争力的性能。
CBPO引入了一种对比分支策略优化方法,用于具有可验证奖励的强化学习中的细粒度信用分配,提升了语言模型在多个基准测试中集成工具的推理任务的性能。
本文介绍了MolEmb,这是一个轻量级框架,它调整多模态大型语言模型以实现通用的分子嵌入,支持上下文感知的表示和跨模态检索,同时还提出了一个诊断基准MolCAR。
本文提出了一种面向GUI代理的长度感知对比学习(LACL-GUI),这是一种对比强化学习框架,通过纳入轨迹级质量信号来解决奖励-梯度错位问题,从而提升代理性能。
这项研究使用非侵入式EEG和对比学习来解码默读过程中的单词,展示了可扩展的词汇信息恢复,其性能随数据量增加而提升。
CLaST 提出了一种用于概率多变量时间序列预测的上下文感知对比变分自编码器框架,并在多个基准测试中展示了相对于基线方法的显著性能提升。
本文介绍了EventTime,一个多分辨率框架,利用多尺度对比学习来估计网络安全事件发生后的财务损失,并为此提出了SECURE数据集。
本文针对未见模态组合的不完整多模态情感分析问题,提出对比混合提示学习(CMPL)模型,该模型利用标签引导的对比学习和模态组合提示来增强泛化能力,在基准数据集上实现了超过5%的准确率提升。
本文介绍了DCGCNet,一种新型深度学习框架,用于从心电图信号中准确且鲁棒地检测心房颤动,展示了最先进的性能和在多样数据集及噪声条件下的强大泛化能力。
本文介绍了HN-CLIP,一种利用文本编码器的文本-文本几何结构为密集描述检索创建自适应相似性边界的方法,解决了对比学习中的饱和问题,并在性能上超越现有方法。
本文介绍了AC-MTM,一种对比逆动态方法,用于防止JEPA世界模型中的编码器崩溃,在多物体任务中无需高斯约束即可提升性能。
Delta2Gamma是一个自监督学习框架,它将EEG信号分解成频段,并使用自适应对比学习进行阿尔茨海默病检测,达到92.4%的准确率。
Mr.Dec是一个基于Transformer的多模态模型,它通过序列化日常电子健康记录更新和胸部X光检查结果来预测30天医院再入院,并在MIMIC数据集上取得了最先进的性能。
ORCA是一个使用对比学习和自编码器的两阶段框架,用于对撞机实验中的可解释异常检测,以提高新物理搜索的灵敏度和可解释性。
S2Dialog介绍了一个框架,用于基于语义和声学风格检索多模态对话,通过对比学习提升在DailyTalk数据集上的检索性能。
本文介绍了GALA,这是一种用于文本到时间序列合成的两阶段方法,它使用生成感知跨模态对齐在TSFragment-600K基准测试中实现了最先进的结果,同时提高了保真度和标题一致性。
This paper introduces low interaction rank as a unified theoretical framework for multiplicative dual-encoder networks, covering approximation, sample complexity, normalization, and identifiability, with experiments on operator learning and CLIP models.