memorization

标签

Cards List
#memorization

关于门控的重要性:State Space Models中的记忆与上下文学习

arXiv cs.LG · 2天前 缓存

本文研究了门控机制在State Space Models中的作用,表明它们促进记忆而非上下文学习,但能提高对长序列的泛化能力。

0 人收藏 0 人点赞
#memorization

量化Grokking中记忆到泛化的转变:缩放定律与相结构

arXiv cs.AI · 6天前 缓存

本文通过缩放定律量化了神经网络中记忆到泛化的转变(Grokking),揭示了与模型容量相比,数据复杂度是转变时间的主要驱动因素。

0 人收藏 0 人点赞
#memorization

@heyshrutimishra: 90%的人工智能进展是一种建立在奖励记忆而非思考的基准测试上的幻觉。TRACES 通过…来剥离这一点…

X AI KOLs Timeline · 2026-08-20 缓存

TRACES 是 Apodex 推出的新 AI 基准测试,通过关注问题解决过程而非记忆答案来衡量探索性 AI,挑战传统基准。

0 人收藏 0 人点赞
#memorization

LSR-Synth 中的库可达性:反记忆化设计如何改变符号发现的度量

arXiv cs.AI · 2026-08-03 缓存

本文研究了 LSR-Synth 基准,发现固定词汇表覆盖了大多数任务,而语言模型生成的候选很少扩展可解实例的集合,除非词汇表覆盖被破坏。

0 人收藏 0 人点赞
#memorization

推理还是记忆:LLM能理解并生成中文歇后语谜语吗?

arXiv cs.CL · 2026-07-28 缓存

本文评估了LLM在理解和生成新型中文歇后语谜语方面的表现,发现像Gemini 3.1 Pro这样的模型虽然因记忆而在理解上表现出色,但在创造性生成方面却逊于人类,凸显了数据污染问题和推理能力的局限性。

0 人收藏 0 人点赞
#memorization

DCS:跨模态版权侵权检测的统一条件灵敏度框架

arXiv cs.LG · 2026-07-27 缓存

提出了一种统一的事后检测框架,用于AI模型中的版权侵权检测,利用条件敏感性和差分隐私来跨模态衡量记忆化。

0 人收藏 0 人点赞
#memorization

正交梯度约束塑造噪声标签记忆动力学

arXiv cs.LG · 2026-07-21 缓存

本文介绍了 OrthoGrad,这是一种几何干预,在优化过程中去除权重梯度的径向分量,并表明它在小数据场景下减少了对噪声标签的记忆,但无法防止最终的记忆。

0 人收藏 0 人点赞
#memorization

贝叶斯扩散模型中泛化相变的精确信息理论

arXiv cs.LG · 2026-07-10 缓存

本文引入了分析可解的贝叶斯信息受限扩散(BIRD)模型,用于研究扩散模型中的记忆-泛化相变,发现生成过程接近记忆边缘,且信息限制有助于规避维度灾难。

0 人收藏 0 人点赞
#memorization

[论文] 语言模型到底记住了多少?

Reddit r/LocalLLaMA · 2026-07-07

本文探讨了语言模型记住训练数据的程度,并探讨其对隐私和安全的影响。

0 人收藏 0 人点赞
#memorization

训练Transformer:初始化时每层权重W = V·Uᵀ,揭示语料库确定的最优秩 — 寻找arXiv背书人 (cs.LG) [D]

Reddit r/MachineLearning · 2026-07-03

本文为Transformer提出原生因子化权重(Native Factorized Weights),即每个线性层从初始化开始就训练为两个低秩矩阵的乘积。实验表明,存在一个由语料库决定的最优秩,可最小化验证损失,并形成一个泛化区间,以更少的参数超越密集基线模型。

0 人收藏 0 人点赞
#memorization

探析表格上下文学习的记忆机制

arXiv cs.LG · 2026-07-01 缓存

本文研究了使用上下文学习的表格基础模型中的参数化记忆现象,提出了一种探测框架(IclMem)来分离基于上下文的预测与记忆。发现在特定条件下存在适度的记忆信号,但在现实训练场景下基本消失。

0 人收藏 0 人点赞
#memorization

用统计力学解释机器学习与记忆化

arXiv cs.LG · 2026-07-01 缓存

本文使用统计力学解释机器学习与记忆化之间的关系。

0 人收藏 0 人点赞
#memorization

内部数据重复破坏语言模型

arXiv cs.LG · 2026-06-25 缓存

本文系统研究了语言模型预训练过程中精确文档重复所造成的损害,表明以中等次数重复中等规模的子集对性能的损害最大,并且重复可能导致高达33%的计算浪费(以计算等效损失衡量)。

0 人收藏 0 人点赞
#memorization

循环去噪揭示扩散模型中的超稳定记忆

arXiv cs.LG · 2026-06-24 缓存

循环去噪作为一种新颖的提取攻击方法,通过反复对样本进行加噪和去噪,揭示了扩散模型中超稳定的记忆训练图像。该技术无需梯度或权重检查,对隐私审计具有重要意义。

0 人收藏 0 人点赞
#memorization

大型语言模型中记忆缓解的输出向量编辑

arXiv cs.CL · 2026-06-18 缓存

提出输出向量编辑,一种约束优化的权重编辑方法,通过修改MLP神经元的输出向量而不是将激活归零来缓解LLM中的记忆化,实现了高达87.9%的抑制效果,且局部性失败极少。

0 人收藏 0 人点赞
#memorization

推理还是记忆?LLM强化学习中的方向感知多样性探索

arXiv cs.AI · 2026-06-10 缓存

本文介绍了DiRL,一种方向感知的强化学习框架,能够在LLM探索中区分推理驱动的多样性和记忆驱动的多样性。它从模型表示中提取内在的推理-记忆方向,并塑造奖励以优先考虑与推理一致的探索,在数学和通用推理基准上表现出改进。

0 人收藏 0 人点赞
#memorization

基础模型代理的部署时记忆化

arXiv cs.AI · 2026-06-10 缓存

本文提出了基础模型代理中“部署时记忆化”的概念,分析了记忆设计选择(摘要激进程度、检索广度、删除模式)如何影响个性化效用、提取风险和删除保真度,并提出了新的指标,如个性化召回率、对抗提取率和遗忘残留分数。

0 人收藏 0 人点赞
#memorization

大语言模型能泄露训练数据,但它们愿意吗?对LLM记忆的倾向性感知评估

Hugging Face Daily Papers · 2026-06-04 缓存

PropMe是一个倾向性感知框架,用于评估LLM的记忆,区分强制复现能力和自然倾向,使用SimpleTrace在开放模型和数据集上进行确定性归因。

0 人收藏 0 人点赞
#memorization

利用记忆引导的数据集去偏方法缓解虚假相关性

arXiv cs.LG · 2026-06-03 缓存

本文提出一种通过两阶段样本评分函数分离核心特征与虚假特征学习动态的方法,仅需10%的训练数据即可实现最先进的去偏性能。

0 人收藏 0 人点赞
#memorization

扩散模型优先记忆原型样本——或:为何我的扩散模型偏爱“Slop”?

arXiv cs.LG · 2026-06-01 缓存

本文研究了扩散模型中的记忆化现象,发现它们会优先记忆包含常见子串的原型样本,即使在去重之后也是如此,并且提前停止会导致常见模式的过度生成,这种现象被称为“slop”。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈