LSR-Synth 中的库可达性:反记忆化设计如何改变符号发现的度量
摘要
本文研究了 LSR-Synth 基准,发现固定词汇表覆盖了大多数任务,而语言模型生成的候选很少扩展可解实例的集合,除非词汇表覆盖被破坏。
arXiv:2607.28684v1 公告类型:新
摘要:现有的科学方程发现基准大多由公共领域中已有的著名方程组成,因此很难判断模型是在从数据中发现规律,还是仅仅从训练语料中回忆答案。LSR-Synth 通过将新颖的合成项引入已有科学机制,并对其产生的任务进行新颖性、可解性和科学合理性筛选,从而缓解了这一问题。本文考察一个更具体的度量问题:这些任务能否进一步区分由语言模型提供的科学先验,与不访问任务语义的常规算子搜索?我们使用具有公开记录来源的固定词汇表构建了一个无语义基线,并通过语义遮蔽、库削弱和匹配算子族敲除来评估候选覆盖的作用。在当前的任务快照、搜索预算和评分协议下,固定词汇表已覆盖大多数任务,而语言模型生成的候选很少扩展可解实例的集合。只有当词汇表覆盖被选择性破坏时,它们的边际贡献才会变得显著。严格的分布外评估降低了所有方法的绝对成功率,但没有改变这一关系。这些发现既没有否定 LSR-Synth 针对完整公式记忆的对照设计,也不意味着语言模型先验通常没有帮助。相反,它们支持一个更有限的结论:大多数当前任务仍然适合评估对未见过表达式的拟合与重组,但仅凭这些任务不足以识别超出固定搜索空间的先验贡献。
查看缓存全文
缓存时间: 2026/08/03 07:29
# 反记忆化设计如何改变符号发现的度量 来源:https://arxiv.org/html/2607.28684 ## LSR-Synth 中的库可达性:反记忆化设计如何改变符号发现的度量 Liang Yin,Zhihao Gao,Boxuan Zhang,Xiaoyu Wu,Linjing Li,Rongyan Wang,Tingwei Chen,Youwei Wang,Xiaolin Zhao,Jiahui Shi,Jianjun Liu ###### 摘要 现有的科学方程发现基准大多由公开领域中广为人知的方程组成,因此很难判断一个模型是从数据中发现了规律,还是仅仅从训练语料中回忆出答案。LSR-Synth 通过将新的合成项引入既有的科学机制,并对生成的任务进行新颖性、可解性和科学合理性过滤,缓解了这一问题。本文考察一个更具体的度量问题:这些任务能否进一步区分语言模型提供的科学先验与不访问任务语义的常规算子搜索?我们使用一个来源公开可查的固定词表构建无语义基线,并通过语义遮蔽、词表弱化和匹配算子族敲除来评估候选覆盖的作用。在当前任务快照、搜索预算和评分协议下,固定词表已经覆盖了大多数任务,而语言模型生成的候选很少能扩大可解实例的集合。只有在词表覆盖被选择性破坏时,它们的边际贡献才会变得显著。严格的分布外评估会降低所有方法的绝对成功率,但不会改变这一关系。这些发现既不会否定 LSR-Synth 对完整公式记忆化的控制,也不意味着语言模型先验普遍无用。相反,它们支持一个更有限的结论:大多数当前任务仍然适合评估对未见过的表达式的拟合与重组,但单独而言不足以识别固定搜索空间之外的先验贡献。 符号回归、科学发现、大型语言模型、基准评测、记忆化 ## 1 引言 当大型语言模型被应用于符号回归时,一个直接的评测担忧是测试方程可能已经出现在模型的训练语料中。传统符号回归主要根据数值误差和表达式复杂度来评估候选表达式(La Cava 等人,2021 (https://arxiv.org/html/2607.28684#bib.bib1)),而语言模型也可能直接从变量名、问题描述和先验科学知识中回忆出公式。来自 Feynman 等广泛使用数据集中的方程及其随附解释,在公开文本中大量存在(Udrescu 和 Tegmark,2020 (https://arxiv.org/html/2607.28684#bib.bib3);Shojaee 等人,2025c (https://arxiv.org/html/2607.28684#bib.bib4))。因此,当模型生成正确表达式时,它可能从数据中推断出了潜在关系,也可能只是识别出问题并重现了已知答案;仅凭最终精度无法区分这两种可能(McCoy 等人,2019 (https://arxiv.org/html/
相似文章
大语言模型在未知环境中协调的词汇发现
提出神经符号词汇发现(NSLD)框架,其中基于LLM的智能体在未知环境中自主为未知视觉指代物开发共享词汇,从而为自主探索任务的部署前规划提供支持。
语言模型通过控制搜索引导符号方程发现
本文介绍了LLM-PySR,一种通过控制搜索参数让语言模型引导符号方程发现的方法,同时使用数值符号回归进行拟合。该方法在基准任务上实现了准确性与复杂性的良好平衡。
从信号到结构:记忆架构如何驱动LLM智能体中的语言涌现
这篇论文研究了记忆架构如何影响玩刘易斯信号游戏的LLM智能体中语言的涌现,发现持久化的私有笔记本记忆优于无状态智能体,并防止高容量崩溃。
关于大型语言模型(LLMs)的问题:我自己的观察:非指令性文本前缀可能在无需对抗性提示的情况下绕过RLHF约束。
一位用户报告称,一段冗长的非指令性文本前缀可以无需对抗性提示即可使LLM激活发生偏移并绕过RLHF安全约束,并询问这是否反映了模型中不同的世界区域。
大型语言模型中的类人回指消解
本文研究了五个开放权重的大型语言模型在回指消解中是否表现出对心理语言学因素的人类类似敏感性,使用惊奇度和理解准确率作为行为指标。结果显示选择性认知对齐:一些模型在回指消解中匹配了人类的话语敏感性,但对语义干扰效应的敏感性较弱或缺失。