标签
NAPE是一个自监督音频学习框架,使用因果Transformer预测下一频谱图补丁嵌入,在多个音频和语音基准测试中实现最先进的性能,采用极简设计。
本文介绍了AC-MTM,一种对比逆动态方法,用于防止JEPA世界模型中的编码器崩溃,在多物体任务中无需高斯约束即可提升性能。
本文建立了概率联合嵌入预测学习(JEPA)与隐马尔可夫模型(HMM)之间的理论联系,提供了状态空间解释,并引入了马尔可夫链JEPA以增强一致性。
ConceptFormer学习用于视觉文档检索的连续潜在概念表示,无需文本中间体即可连接视觉证据和语义相关性,相对于基线实现了显著改进。
提出动作条件预测一致性(ACPC),这是一种JEPA世界模型的诊断方法,用于衡量在动作条件展开中干净观测与扰动观测如何发散,并为预测误差和规划器成本提供理论界限。在多个视觉控制任务上的实验验证了该诊断在LeWM和PLDM等模型上的有效性。
本文对心电图自监督表示学习进行了一项受控研究,考察了时间上下文长度(16秒至10分钟)和编码策略(连续补丁嵌入 vs 离散化令牌)如何影响下游节律检测和患者级检索。结果表明,更长的上下文和连续编码器能提升性能,为扩展上下文的心电图基础模型提供了支持。
本文介绍了TTARO,一种在线深度核贝叶斯优化框架,它利用已评估的优值标签在测试时自适应电路表示。它提高了模拟电路拓扑搜索的样本效率,与标准贝叶斯优化相比,遗憾曲线下面积(regret AUC)减少了15.2%,与固定深度核学习相比减少了20.7%。
This paper introduces low interaction rank as a unified theoretical framework for multiplicative dual-encoder networks, covering approximation, sample complexity, normalization, and identifiability, with experiments on operator learning and CLIP models.
本文提出了一种无标注表示学习方法,用于跨数据集手语词汇检测,利用土耳其手语广播中的弱对齐字幕。研究表明,LLM辅助的伪标注规范化能改善时间定位和下游翻译质量。
本文研究β-VAE如何作为有效理论,其中KL权重充当谱截断,并分析非线性交互和网络深度如何影响表示的容差依赖有效维度。
本文介绍了基于层的联邦表示学习(SFRL),这是一个通过可学习的层限制映射和二次粘合正则化器来对齐异构局部表示的框架,无需假设共享的全局潜在空间。提出了一种具有收敛保证的分散式算法(Sheaf-FRL),并证明其在与数据异构和模型异构下的协作分类中优于基线方法。
Introduces Rationale-Guided Learning (RGL), a framework that reframes multimodal emotion recognition in conversation as a cognitively-inspired reasoning task using dual-process theory and MLLM-generated rationales, achieving state-of-the-art results on IEMOCAP and MELD.
本文提出了一种几何感知的对抗攻击框架,针对对比嵌入流形中的关系结构进行攻击,表明诸如 Markmatch 之类的验证系统会因扭曲成对相似度而非决策边界而严重退化。
Introduces DALMA, a probabilistic representation learning framework that uses biological supervision to improve cross-center generalization of MALDI-TOF mass spectrometry models for clinical microbiology tasks like microbial identification and antimicrobial resistance prediction.
DoGMA 是一种中心法则引导的泛癌多组学分析基础模型,采用 Transformer-MoE 架构,通过定向注意力对齐 DNA-RNA-蛋白质信息流,并利用掩码层次组学重构进行预训练。它在癌症表征学习、生存预测和转移预测任务中均表现出强劲性能。
介绍了TREAT,这是一个基准测试,用于评估大型语言模型是否能从数学公式的等价保持变换中恢复已知定理身份。测试中表现最好的模型准确率仅为60.73%,表明定理知识在表示变化下是脆弱的。
作者分享了Leo/PSCLS的早期进展,这是一个实验性系统,能够学习序列间的关系,并在训练更多故事时改进其故事生成效果和指标。
This paper investigates how molecular generative models internally organize molecular identity in their latent spaces, revealing piecewise-constant regions and coarse-to-fine boundaries across three architectures.
本文介绍了NysHD,一种通过Nyström近似将超维计算与核方法桥接起来的方法,允许任何正半定相似性函数用作HDC编码。与现有HDC编码方法相比,它在图数据集和字符串数据集上展示了更高的分类准确率。
本文提出了一种基于神经ODE的正则化方法,该方法强制强化学习智能体中的潜在嵌入遵循一致的ODE流,使表示学习与环境动态对齐,并在Atari和网格世界基准上取得了性能提升。