标签
SMart 是一个新的时间序列表示学习框架,它使用多阶段递归图恢复和源数据集选择器来增强从多个数据集的表示迁移,在分类和回归任务中显示出性能提升。
本文介绍了V2TATC,一个用于空中交通管制员情境感知的联合语音-轨迹嵌入框架,并引入了一个用于拥挤空域跨模态检索实验的新型数据集。
本文提出SciJEPA,一种无需引用网络、利用文档内非对称预测学习构建科学文献表征的框架,并证明正则化可有效提升模型性能。
Google Research 推出了 GlucoFM,一个用于连续血糖监测的轻量级自监督基础模型,提升了代谢预测任务的性能。
LingBot-Vision 是一系列用于密集空间感知的自监督视觉Transformer骨干网络,通过掩码边界建模来捕获语义和几何结构,适用于深度估计和分割等任务。
PRISM是一种无需训练的测试时适应方法,利用冻结的文本原型逆转音频文本模型中的低秩仿射噪声失真,在严重声学噪声下显示显著改进。
介绍了SBCO,一种面向规划智能体的自监督、基于验证器的框架优化器,它通过近似块坐标上升法改进智能体输出,以远少于自修改基线的计算量达到或超越其性能。
本文提出一种双向潜在扩散模型,可让动力系统在时间上向前或向后步进,并利用往返一致性作为自监督的测试时误差信号,在无需真实值或集成的情况下预测展开误差。
本文介绍了自监督技能优化(SSO),这是一个利用LLM评判的成对比较,从未标注的任务实例中学习和优化可复用智能体技能的框架,无需真实标签或奖励。SSO在封闭式基准测试上优于现有的无真实标签提示优化器,并接近基于真实标签的方法。
The paper proposes an unsupervised self-evolving agent framework inspired by diffusion models, using self-supervised semantic diffusion to train external skill libraries for LLM agents in specialized domains like creative screenwriting, without requiring weight access or external supervision.
PhiZero是一个物理世界模型,它从视频中学习一种称为“物理语言”的紧凑离散表示,并在渲染未来视频之前用它来推理世界状态的转换,从而在生成和理解任务中提高物理一致性。
提出自梯度强制(SGF),一种用于自回归视频扩散模型的双通训练策略,为写入有用的上下文记忆提供缺失的监督,即使在短训练窗口下也能实现强大的长视频外推。
提出了一种多模态语音活动预测框架,将仅音频的VAP扩展至视听输入,用于社交机器人的话轮切换预测,采用预训练骨干网络和低秩适应方法。在NoXi和Haru EDR语料库上取得了改进。
一位研究人员报告,在细粒度汽车分类任务中使用k-NN时,冻结的SigLIP2(92%)和DINOv2(41%)嵌入之间存在惊人的50个百分点的准确率差距,寻求了解线性探针是否能缩小差距,或者DINOv2是否不适合检索。
本文提出洛伦兹编码(LE),一种基于物理信息的框架,利用隐式神经表示和物理约束,从稀疏采样数据重建高分辨率CEST MRI,性能优于现有方法。
LingBot Vision 是蚂蚁集团推出的一种自监督视觉骨干网络家族,它采用掩码边界建模方法,在密集空间感知任务上取得了领先性能,在 NYU-Depth v2 基准上超越了更大的 DINOv3 模型。
蚂蚁集团旗下的具身智能公司 Robbyant 发布了 LingBot-Vision,这是一系列自监督视觉骨干网络,参数量从 21M 到 1.1B,采用 Apache-2.0 协议。尽管使用的训练数据不到 DINOv3 的三分之一,它在多个深度和分割基准测试中与 DINOv3 持平或超越,凸显了开放感知模型的推动力。
AdaJEPA引入了一种自适应的潜在世界模型,该模型在测试期间通过闭环模型预测控制持续更新,显著提高了分布偏移下的规划成功率。
提出SAOT,一种用于自监督持续图学习的结构感知最优传输框架,能够跨任务保留关系结构。在多个基准测试中相较于现有最佳方法取得了显著性能提升,其中在Products-CL上改进幅度高达15%。
本文提出了一种自监督定理发现算法,该算法仅从公理和推理规则出发,无需人类先验知识即可构建定理库。实验表明,发现的定理具有意义,并能提升大语言模型的证明性能。