用统计力学解释机器学习与记忆化
摘要
本文使用统计力学解释机器学习与记忆化之间的关系。
arXiv:2606.31110v1 Announce Type: new
摘要:人工神经网络(NN)和机器学习算法从理论角度尚缺乏深入理解,这使其难以充分发挥潜力并克服自身弱点。例如,机器学习算法通过将NN权重沿其允许值的低维子空间移动来进行训练,但这种隐式的低维学习结构并未被充分利用以改进训练,因为其本质尚未被充分理解。此外,训练好的NN容易受到普遍存在的对抗性攻击的干扰,而其理论基础仍不明确。本论文旨在提升对NN和机器学习的理论理解,特别关注对抗性攻击和隐式低维学习。为此,我们使用统计力学的数学工具研究不同类型的NN及其拟合数据的方式。具体而言,我们研究了两类以不同程度学习和记忆拟合数据的模型:密集联想记忆模型(DAM)和受限玻尔兹曼机(RBM)。在此过程中,我们探讨了这些模型的不同版本之间的联系,这有助于更高效地进行分析研究。
查看缓存全文
缓存时间: 2026/07/01 05:33
# 用统计力学解释机器学习与记忆化 来源:https://arxiv.org/abs/2606.31110 文献工具 ## 文献与引用工具 文献浏览器 切换 代码、数据与媒体 ## 本文相关的代码、数据与媒体 演示 ## 演示 相关论文 ## 推荐与搜索工具 IArxiv 推荐器 切换 关于 arXivLabs ## arXivLabs:与社区合作者的实验项目 arXivLabs 是一个框架,允许合作者直接在我们的网站上开发和分享 arXiv 的新特性。 与 arXivLabs 合作的个人和组织都已接受并认同我们关于开放性、社区、卓越性和用户数据隐私的价值观。arXiv 恪守这些价值观,仅与遵守这些价值观的伙伴合作。 有能为 arXiv 社区带来价值的项目想法吗?**了解更多关于 arXivLabs** (https://info.arxiv.org/labs/index.html)。
相似文章
探索物理问题中的结构:AI智能体能发现统计力学映射吗?
本文介绍了StatMechBench-v0,一个用于评估基于LLM的AI智能体能否从原始配分函数中发现统计力学映射到可处理表示的基准。结果表明,智能体常常能通过数值检查,但会错误识别底层结构,这凸显了当前LLM推理的局限性以及对更丰富验证方式的需求。
深度表示学习的原理与实践:或记忆的数学理论
本书提出了深度表示学习的数学理论,旨在利用优化和信息论揭开大型深度网络内部机制的神秘面纱,使架构设计成为线性代数和微积分的问题。
灾难性遗忘的机制起源:为什么RL比SFT更好地保留电路?
本文研究了LLM中灾难性遗忘的机制起源,发现强化学习比监督微调更好地保留了内部计算电路,从而减少了对先前能力的遗忘。
AutoMem: 作为认知技能的记忆自动化学习
AutoMem 引入了一个框架,将记忆管理作为 LLM 的可训练技能进行自动化学习,通过优化记忆结构和熟练度,将长期任务的性能提升 2-4 倍。
从机制上理解大语言模型微调中记忆知识无法泛化的原因
本文形式化了大语言模型微调中的“知道-使用鸿沟”,即模型记忆事实但无法泛化。引入了自修补干预方法,并确定知识回路错位为根本原因,通过简单启发式方法恢复了58-75%的泛化失败。