标签
InsightEmb 是一种用于智能体洞察检索的对比嵌入框架,仅通过数学推理数据即可学习面向进展的检索几何结构,从而在无需环境特定训练的情况下改进 LLM 智能体的检索效果。
本文探讨了三种基于大语言模型的英法双关语翻译方法,结合了对比学习与音义嵌入。其多智能体系统和引导式思维链系统在CLEF JOKER 2025任务2竞赛中,经专家人工评估,分别位列第一和第二。
本文介绍了贝叶斯数据重加权,一种概率框架,自适应地对查询-文档对进行加权,以减轻对比训练中的假阴性问题,从而在多个基于知识的VQA基准上提升多模态检索性能。
本文介绍了CoCoS,一种对比预训练框架,通过互补的转录组视图学习全细胞表征,解决了单细胞基础模型中掩码基因重建的局限性。在细胞类型注释和基因调控网络推断实验上,展示了具有竞争力的迁移性能。
The paper proposes QQ, a framework that leverages the intrinsic duality between multi-hop question generation and question answering via bidirectional alignment constraints and contrastive learning, improving question quality on HotpotQA and MuSiQue.
提出FedTCR,这是首个系统的联邦多模态图学习算法,通过拓扑感知的跨模态路由和三水平对比学习来处理任务、模态和拓扑异质性,在7个领域上优于基线方法。
SKILL-KD是一种对比技能蒸馏框架,通过将教师轨迹与学生轨迹之间的可操作差异蒸馏为文本技能补丁,并利用漂移感知合并机制迭代优化技能,从而提升LLM智能体的性能。
本文描述了一个用于尼泊尔表情包分类的两阶段视觉-语言适配系统,使用Qwen3-VL-8B-Instruct,结合LoRA微调和对比学习。该系统在CHiPSAL 2026共享任务中,在仇恨言论检测中排名第二,在情感分析中排名第四。
本技术报告介绍了Douyin多模态嵌入(DME),这是一个两阶段训练的模型,结合了对比预训练与基于证据的潜在推理和交叉条件重构,在MMEB-v2上取得了最先进的结果,并已部署于Douyin搜索。
提出FATE,一种帧级音视频时间嵌入方法,将帧序列在物理时间轴上对齐,实现语义与时间的联合理解。在时间检索、事件定位和生成评估指标上均优于基线方法。
This paper analyzes contrastive critics used as value-like objectives in reinforcement learning, showing that good ranking accuracy does not make them safe to maximize due to off-support norm inflation and misranking, and demonstrates that value-calibrated scalar critics like TD-Q succeed where contrastive critics fail.
本文针对从红外光谱中无约束分子结构解析的问题,提出了对编码器-解码器Transformer的改进,采用混合专家(MoE)解码器和对比对齐损失函数,在Top-K准确率上提升了超过10个百分点。
作者重新回顾了表征学习中有影响力的开源工作,列出了从MoCo v1到LeJEPA的关键论文,这些工作推动了视觉基础模型和自监督学习的发展。
OmniVAE是一种联合训练的音频-视频VAE,使用分段级对比学习和特征蒸馏来对齐潜在空间,从而提升文本到音频-视频生成中的联合生成质量和同步性。
VCSD通过使用内容擦除的对照图像产生对比信号,消除了在策略自蒸馏中对外部教师、特权答案或视觉证据的需求,在视觉语言基准测试中持续优于现有方法。
本文提出了UMMT,一种基于Token级别的跨模态Transformer与对比多任务学习,用于乳腺癌亚型分类和生存预测,在METABRIC和TCGA-BRCA数据集上取得了最先进的结果。
提出PEACE框架,一种基于知识引导的框架,通过标签条件对比对齐将成人心电图解释迁移至儿科人群,在有限监督下取得显著改进。
本文研究了将边界搜索知识蒸馏(CAKE)应用于瓶颈式生成自编码器时的失效情况,表明共享的潜在流形会产生梯度冲突,阻碍对比样本的有效合成。相反,本文提出了一种简单的噪声前向传播基线方法。
LLM4EHR 提出了一种临床基础模型,该模型通过领域自适应的大语言模型和正则化对比目标,在时间上对齐电子健康记录(EHR)时间序列与医疗事件序列,从而提升下游预测任务的性能。
本文介绍了对比策略优化(CPO),该方法利用参考引导和普通生成分布之间的token级对比差异,在具有可验证奖励的强化学习中进行正确性感知的优势塑造。CPO在域内和域外基准测试中均优于基于熵的RLVR方法。