标签
本文提出PTEI框架,通过整合人格特质(MBTI和OCEAN)来增强大语言模型的情商,使用对比学习和人格感知提示。实验表明,该方法在情感理解方面有显著提升,尤其是与思维链推理结合时,准确率额外提高4%。
本文提出了一种面向多模态大语言模型的输出感知安全护栏方法,利用隐藏状态表示和多实例对比学习在生成前预测不安全输出,大幅减少过度拒绝同时保持安全性。该方法仅在实际回答可能有害时进行干预,从而保留模型的实用性。
VTaMo 引入了显式的多粒度视频-文本对齐方法,通过最优传输和对比学习实现手语翻译,在四个基准测试上取得了最先进的性能。
ConOrd提出了一种用于序数回归的对比学习框架,融合了对比学习与顺序学习的优势,在人脸年龄估计、图像质量评估和视频质量评估任务中达到了最先进性能。
COALA是一个鲁棒的上下文偏置框架,用于自动语音识别(ASR),它利用对比正则化器和偏置分数估计来提升从大规模偏置列表中识别领域特定实体的准确性。在LibriSpeech上的实验表明其持续表现出色。
Omni-Sleep 是一种睡眠基础模型,它利用分层对比学习从多模态多导睡眠图中捕捉中枢神经系统-自主神经系统动态,在睡眠分期和多疾病分类上优于强基线模型。
本文通过分析计算,针对基本数据增强和具有平稳统计特性的自然图像,在对比损失下得到了最优表示。结果表明,最优CNN的第一层滤波器是正弦波,且权重可通过注水算法计算。
一位研究人员报告,在细粒度汽车分类任务中使用k-NN时,冻结的SigLIP2(92%)和DINOv2(41%)嵌入之间存在惊人的50个百分点的准确率差距,寻求了解线性探针是否能缩小差距,或者DINOv2是否不适合检索。
本文提出SCISE,一个可扩展的无监督图聚类框架,通过社区感知采样和结构熵克服小批量训练中的结构孤立问题,在基准数据集上取得了最先进的结果。
MABLE将掩码重建与余弦相似度损失相结合,从大型异构图中学习节点和图嵌入,在地球空间矿产勘探数据上进行了演示。它在一个无需标注数据的自监督框架中统一了掩码自编码和度量学习。
KARMA 提出了一种基于知识图谱的方法来生成槽位对齐的对比候选项,并使用槽位并行对齐(SPA)在实体槽位级别应用偏好优化,解决了LLM推理监督中的粒度不匹配问题。
SPARCLE是一种说话者感知的字素表示模型,使用对比学习将字素嵌入与声学表示对齐,从而提升文本到语音的质量,尤其在低资源场景下。
PixCon 提出了一种用于半监督语义分割的干净正样本像素对比框架,通过每类记忆库保证正样本集无污染,在 Pascal VOC、Cityscapes 和 ADE20K 等基准上的准确率优于现有方法。
提出scKDGM框架,利用KAN引导的动态图掩码学习和跨视图对比学习对单细胞RNA-seq数据进行聚类,在12个真实数据集上达到最先进性能。
本文提出Rank-Aware Hyperbolic Alignment (RAHA),一种用于视觉-语言数据集蒸馏的方法,利用双曲几何和对齐容量控制,将大规模图像-文本数据集高效压缩为高质量的合成对。
本文推导了在高斯潜变量模型下的草图线性对比学习的缩放定律,分析了风险如何分解为近似项、优化项和统计项,并为对比学习中平衡模型规模、数据和计算提供了理论指导。
本文介绍了 BitEmbed,一个用于基于 LLM 的文本嵌入的极低位宽框架,它将预训练的 LLM 骨干转换为具有三值权重和量化激活的 BitNet 风格编码器。该框架在显著降低编码和存储成本的同时,实现了与全精度模型相当的性能。
本文介绍了三个数据集(Hell-Char、PaLit-Char、Med-Char),用于古希腊字母形态的历时表征学习,并提出了一种基于相似性加权的有监督对比损失函数,结合空缺驱动增强方法,以鲁棒地学习跨越数百年手写变化的字符嵌入。
本文介绍了MELD数据集,用于评估文本嵌入模型是否能够捕捉不同术语之间的数学等价性,并发现当前模型无法做到。本文提出了一种对比学习方法,用于对齐非正式和正式的数学表述,从而在非正式-正式检索任务以及自然语言任务上均取得改进。
V-Zero 是一种新颖的无标签框架,用于细粒度视觉推理,它利用对比证据门控和在线策略蒸馏,无需标注答案标签即可提升性能,且训练速度远超传统方法。