标签
本文揭示了LLM水印的一个基本漏洞:当用户能够访问多个模型时,对其输出分布进行平均会抵消水印扰动,从而规避检测。作者提出了WASH方法,并通过实验证明,对3-5个模型进行平均可将检测z分数抑制在阈值以下,同时提升文本质量。
ToolFailBench,一个用于评估工具使用型代理的诊断基准,已被两个 ICML 2026 研讨会(FAGEN 和 AIWILD)接收。
CortexMAE 是一个 fMRI 基础模型家族,基于 2.1K 小时的开放 fMRI 数据训练,已被 ICML 接收。该发布还包括 Brainmarks,一个用于评估此类模型的开放基准套件。
本文提出了用于大语言模型幻觉检测的自动层选择方法,并引入了固有维度首个有效峰值(FEPoID),这是一种无需训练的标准,能够一致地识别出最优中间层,优于现有启发式方法。
提出AvAtar,一个基于最优传输的原理性主动对齐框架,通过主动获取高质量监督来改进对齐效果,并利用伴随状态方法实现高效的梯度计算。
我们提出LIFT,一种可学习性引导的扩散语言模型微调算法,该算法根据 token 难度和时间步对齐训练,在推理基准测试上取得了显著提升。
本立场论文认为,贝叶斯神经网络中基于采样的推理已在计算效率上与基于优化的方法持平,并即将取代后者,提供更优的不确定性量化和预测性能。
本文证明了直接偏好优化(DPO)与基于人类反馈的强化学习(RLHF)之间的等价性是有条件的,并且在实践中经常被违反,揭示了DPO优化相对优势而非绝对对齐的失败模式。作者引入了约束偏好优化(CPO)以实现可证明的对齐,并展示了最先进的性能。
介绍了均衡推理器(EqR),一种学习任务条件神经吸引子的模型,在数独极难版(99.8%)和迷宫(93%)等困难推理任务上实现了高准确率。
该论文提出了上下文防御指令(CDI),一种用于LLM代理隐私防御的新范式,使用强化学习训练的指导模型生成针对具体步骤、具有上下文感知的指导,在隐私保护和有用性之间实现了更好的平衡。
这篇立场论文主张开发‘数据探针’——来自随机过程的合成序列——以系统性地研究数据特征如何影响LLM性能,旨在超越经验启发式方法。
这篇观点论文认为,当前大型语言模型的不确定性量化方法本质上属于无监督聚类,测量的是内部一致性而非外部正确性,因此无法检测出自信的幻觉。作者主张进行范式转变,将不确定性建立在客观真理之上。
本文提出可识别令牌对应(Identifiable Token Correspondence)方法,通过建模跨时间帧的令牌对应关系,提升基于Transformer的世界模型在视觉强化学习中的时间一致性,在多个基准测试中取得最先进结果。
本文从信息论角度解释了合成数据何时会改善或降低LLM训练效果,区分了信息开放和信息封闭的生成循环,并通过数据处理不等式解释了模型崩溃的原因。
PACER 是一个新的可扩展框架,用于从大规模干预数据中进行因果发现,其设计保证了无环性,在包含数千个变量的基准测试中,比基于惩罚的方法实现了高达两个数量级的加速。
本文发现共享上下文多智能体LLM团队在顺序微调时存在一种结构性失效模式,并将其形式化为复合占位偏移。为此提出了TeamTR,一种信任域框架,通过重采样轨迹并施加每个智能体的散度控制,实现了平均7.1%的性能提升。
AudioMosaic 提出了一种基于对比学习的音频编码器,通过对频谱图块应用结构化时频掩码来构建正样本对,实现高效的大批量训练,在音频基准测试中达到最先进性能,并提升了音频-语言模型的效果。
GenCircuit-RL 提出了一个基于层次化验证奖励的强化学习框架,通过代码生成进行基因电路设计,相比二元奖励提升了14-16个百分点,并提供了包含4,753个电路的 SynBio-Reason 基准。