标签
介绍了CANDOR,一种针对冻结基础编码器的概率校准不一致性度量,它纠正了流行偏倚,揭示了没有编码器是完全盲目的,但所有编码器在细粒度发现方面都很弱。
CAMMAR引入了一个表示学习框架,通过分阶段的语义课程将阿拉伯语隐喻意义组织成嵌套的词汇、文化和隐喻子空间,在一个新的跨度标注数据集上实现了强大的隐喻检测(AUC高达0.84)。
本文从动力系统视角研究超图神经网络中的过平滑问题,提出了一种反应-扩散框架(HNRD),该框架保留节点判别性变异并实现深度鲁棒传播。实验表明,该框架相比基线方法有一致改进。
本文应用威尔逊重整化群理论,将Transformer注意力机制视为对已训练MLP残差栈固定点的扰动,并根据数据相关长度判断注意力是相关还是无关。在合成马尔可夫链上的实验证实,注意力的相关性取决于数据生成过程的谱结构,其中第一层头主导了转变。
LLM4EHR 提出了一种临床基础模型,该模型通过领域自适应的大语言模型和正则化对比目标,在时间上对齐电子健康记录(EHR)时间序列与医疗事件序列,从而提升下游预测任务的性能。
AV-JEPA将LeJEPA扩展到音视频自监督学习,在潜在空间中实现跨模态对齐,无需解码器、对比负样本或复杂损失函数,并在VGGSound和AudioSet上取得了有竞争力的分类结果。
本文提出了一种方法,利用潜变量将语言模型的响应分布分解为结构化的、策略条件化的表示,并通过模型导向的重建目标来解决后验塌陷问题。
本文提出FaStR,一种通过CP分解将强化学习中的转移核分解为独立的状态、动作和下一状态编码器的方法,从而提升样本效率,尤其在高维运动控制任务中效果显著。
提出了一种新颖的“蛋糕”表示法,用于随时间变化的游戏关卡,该表示法隐式编码了动态信息;同时提出了一种生成方法(回放轨迹重建分区法,PRP),在Sokoban游戏中,该方法在不牺牲求解多样性的前提下生成了有效关卡,性能优于六种最先进的PCG方法。
本文介绍了一种新颖的方法,利用稀疏自编码器(SAEs)从网络中间激活中学习可解释特征,用于分布外(OOD)检测,该方法达到了最先进的性能,并提供了关于分布偏移如何影响所学表示的见解。
本文介绍了一种白盒仪器,使用隐藏确定性有限自动机分别测量强化学习代理的奖励成功和潜在状态学习,发现高奖励并不意味着任务理解。
本文认为,语言模型表示中的类内方差并非不完全的神经坍缩,而是分配的信息存储,且这种分配服从信息下限定律。在14个模型中,宏观类别结构仅承载4–12%的表示方差,而词元内上下文则占据79–91%。
提出了一种新颖的多级图提示学习框架用于晶体性质预测,通过节点级和图级的软提示捕捉局部化学语义和全局结构对称性,将最先进的GNN性能提升3%-15%,并实现跨性质知识迁移。
研究人员引入了统一手部动作空间(UHAS),这是一种表示方法,使得单一策略能够控制具有不同运动学结构和不同手指数量的机器手,从而推进了跨本体的灵巧操作。
联合嵌入预测架构(JEPA)用于自监督学习的逐步注解实现与解释,涵盖I-JEPA、V-JEPA和LeJEPA。
本文提出通过中间层激活的学习加权和将指令提示压缩为单个激活向量,准确率下降低于2%,并揭示了对LLM激活空间结构的洞察。
本文研究了在大型语言模型(LLM)答案生成过程中置信度相关信息的演化,并提出了未来置信度蒸馏方法。该方法利用后解决方案正确性探针生成的教师置信度估计,对前解决方案隐藏表示进行预测器训练,从而实现可靠且样本高效的置信度估计。
本文介绍了黎曼均值池化(RMP),该方法通过拉回度量利用黎曼几何聚合预训练语言模型的词元嵌入,在句子分类任务上表现出优于欧氏池化的性能。
本文审计了grokking中表示指标的测量效度,表明grokking过渡期的值高估了收敛后的电路复杂度,且压缩滞后于泛化。它提供了将onset与压缩分开的工具,并报告了关于一般性的负面结果。
这项受控研究将几何代数(Cl(3,0))层与针对SO(3)-等变向量学习的最小标量化基线进行了比较,发现几何代数在单阶段任务中没有带来任何好处,但在低数据场景下对于深度组合的群操作显著优于标量化。