标签
本文研究了门控机制在State Space Models中的作用,表明它们促进记忆而非上下文学习,但能提高对长序列的泛化能力。
本文通过缩放定律量化了神经网络中记忆到泛化的转变(Grokking),揭示了与模型容量相比,数据复杂度是转变时间的主要驱动因素。
TRACES 是 Apodex 推出的新 AI 基准测试,通过关注问题解决过程而非记忆答案来衡量探索性 AI,挑战传统基准。
本文研究了 LSR-Synth 基准,发现固定词汇表覆盖了大多数任务,而语言模型生成的候选很少扩展可解实例的集合,除非词汇表覆盖被破坏。
本文评估了LLM在理解和生成新型中文歇后语谜语方面的表现,发现像Gemini 3.1 Pro这样的模型虽然因记忆而在理解上表现出色,但在创造性生成方面却逊于人类,凸显了数据污染问题和推理能力的局限性。
提出了一种统一的事后检测框架,用于AI模型中的版权侵权检测,利用条件敏感性和差分隐私来跨模态衡量记忆化。
本文介绍了 OrthoGrad,这是一种几何干预,在优化过程中去除权重梯度的径向分量,并表明它在小数据场景下减少了对噪声标签的记忆,但无法防止最终的记忆。
本文引入了分析可解的贝叶斯信息受限扩散(BIRD)模型,用于研究扩散模型中的记忆-泛化相变,发现生成过程接近记忆边缘,且信息限制有助于规避维度灾难。
本文为Transformer提出原生因子化权重(Native Factorized Weights),即每个线性层从初始化开始就训练为两个低秩矩阵的乘积。实验表明,存在一个由语料库决定的最优秩,可最小化验证损失,并形成一个泛化区间,以更少的参数超越密集基线模型。
本文研究了使用上下文学习的表格基础模型中的参数化记忆现象,提出了一种探测框架(IclMem)来分离基于上下文的预测与记忆。发现在特定条件下存在适度的记忆信号,但在现实训练场景下基本消失。
本文系统研究了语言模型预训练过程中精确文档重复所造成的损害,表明以中等次数重复中等规模的子集对性能的损害最大,并且重复可能导致高达33%的计算浪费(以计算等效损失衡量)。
循环去噪作为一种新颖的提取攻击方法,通过反复对样本进行加噪和去噪,揭示了扩散模型中超稳定的记忆训练图像。该技术无需梯度或权重检查,对隐私审计具有重要意义。
提出输出向量编辑,一种约束优化的权重编辑方法,通过修改MLP神经元的输出向量而不是将激活归零来缓解LLM中的记忆化,实现了高达87.9%的抑制效果,且局部性失败极少。
本文介绍了DiRL,一种方向感知的强化学习框架,能够在LLM探索中区分推理驱动的多样性和记忆驱动的多样性。它从模型表示中提取内在的推理-记忆方向,并塑造奖励以优先考虑与推理一致的探索,在数学和通用推理基准上表现出改进。
本文提出了基础模型代理中“部署时记忆化”的概念,分析了记忆设计选择(摘要激进程度、检索广度、删除模式)如何影响个性化效用、提取风险和删除保真度,并提出了新的指标,如个性化召回率、对抗提取率和遗忘残留分数。
PropMe是一个倾向性感知框架,用于评估LLM的记忆,区分强制复现能力和自然倾向,使用SimpleTrace在开放模型和数据集上进行确定性归因。
本文提出一种通过两阶段样本评分函数分离核心特征与虚假特征学习动态的方法,仅需10%的训练数据即可实现最先进的去偏性能。
本文研究了扩散模型中的记忆化现象,发现它们会优先记忆包含常见子串的原型样本,即使在去重之后也是如此,并且提前停止会导致常见模式的过度生成,这种现象被称为“slop”。