标签
RECTOR 是一个自监督框架,从 EEG/sEEG 信号中学习联合的区域-通道-时间表征,用于情感和认知状态分类,在情绪识别和任务参与度基准测试中取得了最先进的结果。
本文提出用余弦相似度与输入幅值的可学习组合替代稀疏自编码器中的内积评分,结果表明所得特征更具可解释性且与概念对齐,优化器始终偏好余弦而非内积。
本文探讨了使用变分自编码器学习大规模X射线散射数据的潜在表征,从而实现高效的数据压缩和分析。
RepFusion提出了一种方法,在扩散Transformer中将预训练多模态LLM用作噪声表示编码器,用于文本到图像生成,在相似计算量下超越基线。
提出CoMAG,一个用于多模态属性图的统一骨干网络,它学习任务自适应可靠上下文并执行模态保持对齐,在图级预测、模态匹配和图条件生成上达到最先进结果。
介绍了Adelic保运算嵌入(AOE),一种无需训练的表示方法,通过结合实数值与p-adic展开来编码数字,保留加法和乘法结构。在Weaving Pattern基准上实现了完美准确率。
本文提出了一种可证伪的适用性判据,用于基于时滞谱嵌入的多变量时间序列的无训练固定长度描述符,展示了该描述符在何种情况下有望有效,并在多个基准上进行了验证。
RepFusion 提出使用多模态大语言模型作为噪声表示编码器,用于文本到图像生成中的扩散变压器,优于传统的去噪方法。
这篇博文解释了JEPA(联合嵌入预测架构)模型与典型相关分析(CCA)之间的联系,典型相关分析是一种源于1936年的统计方法,文章认为CCA是JEPA的概念前身,并指出在嵌入空间中最大化相关性的思想可追溯到Hotelling。
本文介绍了一种将幺正算子映射到大语言模型潜在空间的方法,实现了量子电路合成以及语言条件化的门约束指定,并在Clifford+T电路合成上取得了与现有方法相竞争的结果。
RepWAM 提出了一种使用表征视觉-动作分词器的世界动作建模方法,旨在学习用于规划与控制的统一视觉和动作表征。
介绍READER,一种用于动态黑盒LLM溯源的轻量级框架,它利用冻结的代理LLM从回复中提取作者身份证据,并在多次查询中进行贝叶斯证据累积,在Agent500数据集上实现了高精度。
本文提出一种基于差分进化的张量潜在因子自动超参数优化框架,以提高大规模动态加权有向网络的预测精度,减少手动调参需求。
本文介绍了SynIB,一种基于信息瓶颈原则的可扩展目标函数,通过在被遮蔽一个模态时对自信预测进行惩罚,来定位多模态学习中的协同信息,从而提升需要跨模态推理的任务的性能。
提出CF-JEPA,一种无掩码的自监督学习框架,用于时间序列表示学习。该方法通过从随机裁剪中进行多视野前向预测,并利用在线编码器与指数移动平均目标编码器之间的不对称性,在分类、预测和异常检测任务上提升了性能。
本书提出了深度表示学习的数学理论,旨在利用优化和信息论揭开大型深度网络内部机制的神秘面纱,使架构设计成为线性代数和微积分的问题。
本文提出了一个在ACDC MRI数据集上进行心脏病理预测的数据高效解剖感知基准,表明在有限标签下,解剖表示比模型复杂性更重要。
TRL-Bench 是一个统一的框架和库,用于标准化对20个编码器、16个任务和87个数据集的表格表示学习模型的评估。它提供了一个通用接口来比较异构表格模型,并揭示了没有一个编码器在所有任务中都是最佳的。
一条推文重点介绍了 Chris Potts 关于大型语言模型如何学习语言结构的演讲,进一步强化了 LLM 能够捕捉句法和语义的观点。
本文认为,表示学习(而非基于模型的规划)是可扩展多任务深度强化学习的关键。文章介绍了MR.Q,一种简单的无模型算法,通过辅助预测目标,在多种连续控制任务上优于之前基于世界模型的方法。