icml

标签

Cards List
#icml

线性集成消除水印:论LLM中分布扰动的脆弱性

arXiv cs.CL ↗ · 2026-06-01 缓存

本文揭示了LLM水印的一个基本漏洞:当用户能够访问多个模型时,对其输出分布进行平均会抵消水印扰动,从而规避检测。作者提出了WASH方法,并通过实验证明,对3-5个模型进行平均可将检测z分数抑制在阈值以下,同时提升文本质量。

0 人收藏 0 人点赞
#icml

@SoHarshhh: 非常高兴地分享,“ToolFailBench” 已被两个 ICML 2026 研讨会(FAGEN 和 AIWILD)接收。大多数基准测试…

X AI KOLs Following ↗ · 2026-06-01 缓存

ToolFailBench,一个用于评估工具使用型代理的诊断基准,已被两个 ICML 2026 研讨会(FAGEN 和 AIWILD)接收。

0 人收藏 0 人点赞
#icml

@humanscotti: CortexMAE,我们的fMRI基础模型预印本已发布(被ICML接收)!我们训练了一个图像基础模型,基于平面脑扫描图像而非自然图像。

X AI KOLs Timeline ↗ · 2026-05-29 缓存

CortexMAE 是一个 fMRI 基础模型家族,基于 2.1K 小时的开放 fMRI 数据训练,已被 ICML 接收。该发布还包括 Brainmarks,一个用于评估此类模型的开放基准套件。

0 人收藏 0 人点赞
#icml

人类策展何时及为何适得其反:多模型自消费循环下的偏好对齐

arXiv cs.AI ↗ · 2026-05-29 缓存

本文研究了多模型体系中的自消费训练,表明由于跨模型交互,人类策展可能适得其反并损害长期对齐。

0 人收藏 0 人点赞
#icml

扩散模型的正交概念擦除

arXiv cs.AI ↗ · 2026-05-29 缓存

本文介绍了正交概念擦除(OCE),一种通过乘法正交参数更新从扩散模型中精确移除目标概念的方法,能够在数秒内高效擦除单个及多达100个概念。

0 人收藏 0 人点赞
#icml

幻觉检测中的自动层选择

arXiv cs.AI ↗ · 2026-05-27 缓存

本文提出了用于大语言模型幻觉检测的自动层选择方法,并引入了固有维度首个有效峰值(FEPoID),这是一种无需训练的标准,能够一致地识别出最优中间层,优于现有启发式方法。

0 人收藏 0 人点赞
#icml

AvAtar:通过主动最优传输学习对齐

arXiv cs.LG ↗ · 2026-05-26 缓存

提出AvAtar,一个基于最优传输的原理性主动对齐框架,通过主动获取高质量监督来改进对齐效果,并利用伴随状态方法实现高效的梯度计算。

0 人收藏 0 人点赞
#icml

可学习性引导的扩散语言模型微调

arXiv cs.CL ↗ · 2026-05-25 缓存

我们提出LIFT,一种可学习性引导的扩散语言模型微调算法,该算法根据 token 难度和时间步对齐训练,在推理基准测试上取得了显著提升。

0 人收藏 0 人点赞
#icml

观点:抽样时机已到!为贝叶斯深度学习绘制新航线

arXiv cs.LG ↗ · 2026-05-22 缓存

本立场论文认为,贝叶斯神经网络中基于采样的推理已在计算效率上与基于优化的方法持平,并即将取代后者,提供更优的不确定性量化和预测性能。

0 人收藏 0 人点赞
#icml

DPO与RLHF的条件等价性:隐含假设、失败模式与可证明的对齐

arXiv cs.AI ↗ · 2026-05-22 缓存

本文证明了直接偏好优化(DPO)与基于人类反馈的强化学习(RLHF)之间的等价性是有条件的,并且在实践中经常被违反,揭示了DPO优化相对优势而非绝对对齐的失败模式。作者引入了约束偏好优化(CPO)以实现可证明的对齐,并展示了最先进的性能。

0 人收藏 0 人点赞
#icml

@huskydogewoof:介绍𝐄𝐪𝐮𝐢𝐥𝐢𝐛𝐫𝐢𝐮𝐦 𝐑𝐞𝐚𝐬𝐨𝐧𝐞𝐫𝐬(𝐄𝐪𝐑)!前馈模型和权重绑定模型的行为非常……

X AI KOLs Timeline ↗ · 2026-05-22

介绍了均衡推理器(EqR),一种学习任务条件神经吸引子的模型,在数独极难版(99.8%)和迷宫(93%)等困难推理任务上实现了高准确率。

0 人收藏 0 人点赞
#icml

@stanfordnlp:众多@stanfordnlp的工作亮相@icmlconf。首尔见!Contextualized Privacy Defense for LLM Agents Yule Wen, @Stev…

X AI KOLs Following ↗ · 2026-05-21 缓存

该论文提出了上下文防御指令(CDI),一种用于LLM代理隐私防御的新范式,使用强化学习训练的指导模型生成针对具体步骤、具有上下文感知的指导,在隐私保护和有用性之间实现了更好的平衡。

0 人收藏 0 人点赞
#icml

立场:让我们开发数据探针,从根本上理解数据如何影响LLM性能

arXiv cs.AI ↗ · 2026-05-20 缓存

这篇立场论文主张开发‘数据探针’——来自随机过程的合成序列——以系统性地研究数据特征如何影响LLM性能,旨在超越经验启发式方法。

0 人收藏 0 人点赞
#icml

观点:大型语言模型中的不确定性量化仅是无监督聚类

arXiv cs.CL ↗ · 2026-05-20 缓存

这篇观点论文认为,当前大型语言模型的不确定性量化方法本质上属于无监督聚类,测量的是内部一致性而非外部正确性,因此无法检测出自信的幻觉。作者主张进行范式转变,将不确定性建立在客观真理之上。

0 人收藏 0 人点赞
#icml

世界模型的可识别令牌对应

arXiv cs.LG ↗ · 2026-05-19 缓存

本文提出可识别令牌对应(Identifiable Token Correspondence)方法,通过建模跨时间帧的令牌对应关系,提升基于Transformer的世界模型在视觉强化学习中的时间一致性,在多个基准测试中取得最先进结果。

0 人收藏 0 人点赞
#icml

高效数据合成的一个信息论准则

arXiv cs.LG ↗ · 2026-05-19 缓存

本文从信息论角度解释了合成数据何时会改善或降低LLM训练效果,区分了信息开放和信息封闭的生成循环,并通过数据处理不等式解释了模型崩溃的原因。

0 人收藏 0 人点赞
#icml

PACER: 从大规模干预数据中进行无环因果发现

arXiv cs.LG ↗ · 2026-05-18 缓存

PACER 是一个新的可扩展框架,用于从大规模干预数据中进行因果发现,其设计保证了无环性,在包含数千个变量的基准测试中,比基于惩罚的方法实现了高达两个数量级的加速。

0 人收藏 0 人点赞
#icml

TeamTR:多智能体LLM协调的信任域微调

arXiv cs.LG ↗ · 2026-05-18 缓存

本文发现共享上下文多智能体LLM团队在顺序微调时存在一种结构性失效模式,并将其形式化为复合占位偏移。为此提出了TeamTR,一种信任域框架,通过重采样轨迹并施加每个智能体的散度控制,实现了平均7.1%的性能提升。

0 人收藏 0 人点赞
#icml

AudioMosaic:对比掩码音频表示学习

arXiv cs.LG ↗ · 2026-05-15 缓存

AudioMosaic 提出了一种基于对比学习的音频编码器,通过对频谱图块应用结构化时频掩码来构建正样本对,实现高效的大批量训练,在音频基准测试中达到最先进性能,并提升了音频-语言模型的效果。

0 人收藏 0 人点赞
#icml

GenCircuit-RL: 基于层次化验证的强化学习基因电路设计

arXiv cs.AI ↗ · 2026-05-15 缓存

GenCircuit-RL 提出了一个基于层次化验证奖励的强化学习框架,通过代码生成进行基因电路设计,相比二元奖励提升了14-16个百分点,并提供了包含4,753个电路的 SynBio-Reason 基准。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈