超越固定表征:开放式AI中的词汇与验证鸿沟
摘要
本文指出了两个关键鸿沟——词汇鸿沟与验证鸿沟——这些鸿沟阻止了当前AI系统实现真正的开放式智能,并提出了一个超越固定表征框架的评估和推进创新的框架。
arXiv:2607.09560v1 公告类型:新
摘要:现代AI系统正越来越被评估其在推理、编码、证明定理、使用工具以及长期研究任务方面的能力。这些是强大的能力,但它们共享一个结构性限制:模型运行的表征框架,包括其概念词汇、可搜索的可行解空间以及评估成功的标准,通常是固定的并预先提供。本文认为,构建能够进行开放式创新的更强大智能系统需要额外的操作类别:创建、稳定和重用新的表征基元,这些操作改变了正在搜索的空间,而不仅仅是在其中搜索。
我们通过两个鸿沟来描述当前AI系统与真正开放式智能之间的距离。第一个是词汇鸿沟,即发明和稳定新表征基元的困难,而不仅仅是重新组合现有基元。第二个是验证鸿沟,即判断一个新基元价值的困难,因为其全部收益可能只有在未来重用时才能显现。我们通过一个统一的框架——将智能视为认知差异缩减——来解释这两个鸿沟。通过将智能行为视为一系列认知变换,我们区分了空间内变换(在固定表征框架内操作)与生成性变换(可能修改框架本身)。在此基础上,我们提出了一个创新自主性阶梯,并概述了推进开放式AI的几个方向,包括奖励有用表征变化的目标、用于发明基元的持久记忆架构,以及能够与所评估的表征共同进化的自适应验证机制。
查看缓存全文
缓存时间: 2026/07/13 07:54
# 超越固定表示:开放领域 AI 中的词汇差距与验证器差距 来源:https://arxiv.org/html/2607.09560 ###### 摘要 现代 AI 系统正越来越多地在其推理、编程、定理证明、工具使用以及长周期研究任务等能力上接受评估。这些能力强大,但存在一个结构性局限:模型运作的表示框架(包括其概念词汇、可搜索的合法解空间以及成功评判准则)通常是预先固定并提供好的。本文认为,要构建能够实现开放领域创新的更强智能系统,需要额外一类操作:创造、稳定和重用新的表示原语——这些操作改变了被搜索的空间,而不仅仅是在其中搜索。我们通过两个“差距”来刻画当前 AI 系统与真正开放领域智能之间的距离。第一个是**词汇差距**:发明并稳定新的表示原语(而不仅仅是将现有原语重新组合)的困难。第二个是**验证器差距**:判断一个新原语的价值时,其全部收益可能只有在未来重用后才能显现的困难。我们将这两个差距统一在一个智能作为认知差异缩减的框架下进行解读。通过将智能行为视为一系列认知转换,我们区分了**空间内转换**(在固定表示框架内操作)与**生成性转换**(可能修改框架本身)。在此基础上,我们提出了一个创新自主性的阶梯,并概述了推进开放领域 AI 的几个方向,包括:奖励有利用表示变化的目标、用于发明原语的持久记忆架构,以及能够与所评估表示共同演化的自适应验证机制。 ## 1 引言 通常有两种“智能”活动被混为一谈。第一种是在给定框架内解决问题:给定一个目标、一个具有固定表示空间且训练好的模型,以及一种检查答案的方法,寻找一个好的解决方案。第二种需要改变框架本身,例如创建新的概念、关系、度量、抽象或评估器,使得之前在原有框架下无法解决的问题变得可表达和可解决。第一种活动是在一个空间内搜索,而第二种活动则改变了被搜索的空间本身。 当代 AI 在第一种类型上表现出色,并且主要仍在这一类任务上进行基准测试。推理谜题、竞赛数学、代码生成、定理证明、工具使用以及智能体任务完成,这些评估都针对那些表示框架在很大程度上预先固定的问题——模型的权重由训练数据分布固定;基准提供任务、可接受的答案形式以及成功标准;编程环境提供编程语言和测试;定理证明器提供形式语言和检查器;AI 驱动科学流程提供主题、工具栈、文献语料库和验证程序。这种框架化的问题对于衡量进展是有用的,但也施加了一个重要限制:我们的核心指标本质上是对第二种能力的弱测试,而第二种能力需要更强的能力。它们几乎不能告诉我们一个系统是否能处理真正开放领域的创新任务,在这些任务中,关键步骤不仅仅是在给定空间内寻找解决方案,而是认识到该空间本身不足,必须引入一个新的表示原语。 科学和社会进步的历史,在很大程度上可以被理解为通过开放领域的新概念创造来扩展表示空间的历史。文明的进步依赖于自然语言、数学和逻辑语言,这些语言逐渐扩展了可以被符号化、度量和推理的内容。“数”的概念将异构的集合重组为共同的量化表示。“负数”的发明使先前不允许的代数运算变得有意义。“熵”引入了一套词汇来表达在旧表示框架中自然不可见的规律性。同样,能量、信息、反馈、基因、算法和注意力等概念已成为表示原语,它们重构了可描述、可搜索、可度量、可重用的空间。在社会领域,权利、市场、激励和法律等概念在组织集体行为和政治推理中发挥了类似作用。从这个意义上说,进步不仅仅是固定框架内事实的积累,而是框架本身的持续转化,使以前无法触及的模式变得可思考。 这正是当前 AI 系统仍然受限的地方。现有模型在解决第一类问题(即操作在给定且冻结的表示框架内,其中表示原语、搜索空间和评估标准基本预先固定)方面越来越强大。最近关于 LLM 驱动自主研究的分析表明,LLM 生成的研究想法狭窄且高度集中于对多个现有想法进行重组和综合的模式[55, 8, 4],这与人类的构思模式显著不同。要在 AGI 的阶梯上攀登得更高,需要系统也能处理第二类问题:其解决方案需要开放领域的表示扩展、概念形成以及创建初始框架未提供的新原语,以实现自主创新。 在本文中,我们分析这一局限性并提出以下主张。首先,我们认为,当前 AI 系统与真正开放领域智能系统之间的距离可通过两个核心差距来刻画。第一个是“词汇差距”,即发明并稳定新的表示原语(而非仅仅重组外部提供的现有原语)的困难。第二个是“验证器差距”,即当新引入的原语的价值尚未被系统当前拥有的任何标准所验证时,判断其是否值得保留的困难。其次,我们通过认知差异缩减的视角来解读这些创新差距。在这种统一观点下,智能由减少当前状态与未解决需求状态之间差距的压力所驱动,通过预测、解释和创造来实现。当现有表示无法充分缩减此类差距时,概念发明变得必要。因此,智能不仅仅是在已知原子单元上搜索,还包括转化表示空间,使先前未解决的张力变得可处理,以缩小差距。第三,我们定义了一个创新自主性阶梯,其特点是系统能够关闭何种差距。在较低层级,系统执行**空间内**转换,其中搜索、推理和重组发生在固定的表示空间内。在较高层级,系统必须执行表示转换,从而能够发明新的原语、操作、抽象和评估程序,改变表示空间本身。我们认为,大多数现有 AI 模型和智能体系统处于该阶梯的较低层级。向上移动需要超越更强模式匹配和补全的能力增强。最后,我们讨论为了实现 AI 系统向更强形式的开放领域智能迈进,需要改变哪些目标和架构。流行的下一个标记预测目标可以被解释为差异缩减的一个具体实例,但该目标本身并不奖励系统表示空间的自主扩展。特别是,它没有提供直接机制来提议、验证、稳定和重用那些可能在表示框架改变后其价值才显现的新原语。因此,向开放领域智能的进展需要更广泛的目标和架构设计,明确支持表示增长。 ## 2 与开放领域智能的距离 如上所述,现有 AI 系统在固定表示方案、预定义目标和既定问题框架内已变得日益强大。然而,它们距离更强形式的开放领域智能仍然遥远。这种智能不仅解决给定问题,还能自主扩展可能问题、概念和方法的空间,从而形成新的解决方案。在本节中,我们确定 AI 系统要获得这种开放领域能力必须缩小的两个核心差距:词汇差距和验证器差距。 ### 2.1 词汇差距 真正的发现依赖于概念发明。在可以搜索问题之前,必须有人提供用于编写候选解决方案的原语;最深刻的进步往往不是新答案,而是新原语:一个先前不存在的变量,一个无人孤立出的关系,一种使隐藏规律变得可读的度量。以这种方式阅读,科学和社会进步在很大程度上是一部词汇变迁史。矩阵被发明出来以抽象数组的阵列,特征值被发明出来以捕捉矩阵的不变结构。经济的概念将生产、交换和资源管理抽象为一个可以被度量和研究的对象。当前 AI 系统在提供的词汇内是强大的搜索器和重组器,但它们很少自行决定词汇应该如何以及何时增长。 概念创造是一种抽象行为,它提取跨多种不同对象共享的不变属性。将广泛观察分组到一个可重用的单一单元下,缩短了所有使用它的事物的描述。这是抽象的最小描述长度(MDL)观点,其中原语通过压缩一系列观察、减少表达它们所需的表示预算来证明其价值。在琐碎情况下,将几乎任意符号附加到一组原始感知上会减少描述长度,并使某些东西在预算内变得可触及。然而,关键要求是分摊:一个原语必须在一系列问题上证明其表示价值,而不是仅仅在单个局部实例上。“数”适用于任何对象的集合,而不仅仅是当前正在观察的。“政策”适用于组织可能执行的任何规则,而不仅仅是已经采取的行动。 为了精确说明这一点,设 L_{\mathcal{L}}(\cdot) 表示在语言 \mathcal{L} 下的描述长度,设 L^B_{\mathcal{L}}(f) 表示在搜索预算 B 下、在语言 \mathcal{L} 内可发现的任务 f 的最短解的长度(如果预算内未找到解则取 \infty)。对于任务族 F,添加原语 \pi 得到 \mathcal{L}' = \mathcal{L} \cup \{\pi\},当以下两个条件都成立时,该添加相对于 F 和 B 是生成性的: 1. (i) 分摊压缩: L_{\mathcal{L}}(\pi) + \sum_{f \in F} L^B_{\mathcal{L}'}(f) \;<\; \sum_{f \in F} L^B_{\mathcal{L}}(f) (原语的编码成本在该任务族中得到偿还)。 2. (ii) 可行性扩展: 存在某个子类 C \subseteq F,使得 L^B_{\mathcal{L}}(f) = \infty 但 L^B_{\mathcal{L}'}(f) < \infty (在 \pi 之前预算内不可行的任务在之后变得可行)。 当前模型确实会形成概念并构建词汇,但这些是从训练分布中继承而来,而非自主发起。¹ 注意,机器已经可以做到有界版本。DreamCoder 的觉醒-睡眠周期解决任务,将重复出现的程序片段抽象为可重用的库函数,并使用扩大的库解决未来任务。Stitch[7]及相关系统从程序语料库中大规模提取此类抽象。然而,这些系统是在形式语言上程序归纳的狭窄领域内进行的,具有固定的任务分布和提供的评估器。开放的挑战是在通用环境中、跨更广泛任务的表示扩展。此外,正如下一节所论证的,更深的障碍不仅是发明原语,还包括知道哪些值得保留。 模型获得抽象由其出现的数据分布和有限上下文所塑造。开放领域智能需要更强的能力来在没有这种指导的情况下引入原语。想象一个从未接受过数学训练的模型,因此没有“数”的概念。现在向模型展示涉及不同数量物体的场景,比如五个苹果、七把椅子、三个人。它能否自主创建一个“数”的概念,并增强自己的词汇和表示空间以供未来重用?没有当前系统能做到这一点,没有这种自主词汇扩展,开放领域创新就遥不可及。² ²我们注意到,概念创造不一定总是引入新符号,有时也可以将新的稳定含义赋予现有符号。这也是当前 AI 系统所缺乏的词汇增长类型:不仅仅是使用继承的意义,而是创建或重新利用概念,使其成为未来思想的持久工具。 ### 2.2 验证器差距 当表示框架固定时,评估通常快速、廉价且决定性。生成的程序通过测试或失败,证明被检查者接受或拒绝,设计要么改进目标要么不做。验证器已经在固定表示和候选空间上定义。近期 AI 辅助发现的最强成功大多发生在这一领域。AI 发现在验证便宜、形式化且自动化的领域进展最快:代码、数学、算法设计、定理证明和模拟密集型科学。这些系统之所以变得强大,主要是因为领域提供了高效评分候选解的方式,使得强化、选择和迭代自我改进极为高效。在此类环境中,系统可以积极搜索并进行递归改进,因为目标和成功标准已经清晰提供,因此验证器从外部封闭了循环。 相比之下,开放领域智能的验证要困难得多,因为验证本身成了问题的一部分。难点不仅仅在于好的候选解难以生成,还在于可能不清楚应该如何评判它们。这种困难有两种不同的版本。第一种是**延迟且昂贵的验证**。在许多现实世界的科学问题中,成功标准在概念上可能清晰,但实践中观察起来缓慢或昂贵。一个生物学假设可能需要数月的实验。一个候选药物可能需要数年的临床验证。一个材料方案可能需要在表征、压力测试和放大后才能知道其价值。在这些情况下,即使最终的验证器存在,但相似文章
AI中的开环与闭环问题
本文讨论了AI中的开环/闭环问题,将GPU硬件从通用到专用ASIC的历史演变与AI模型的学习循环进行类比,对比了开环训练与大脑中发现的闭环学习。
Open ai
文章讨论了行业共识:人工智能正变得极其强大,但在高风险任务上的可靠性仍是一个未解决的工程问题。强调当前系统优化的是合理性而非确定性真理,前进方向是分层验证系统而非单一完美模型。
验证器瓶颈
一篇概念性文章,认为人工智能中的递归自我改进受限于验证而非计算,并使用了认识论封闭的提示矩阵和数据加工不等式的隐喻。
AI 智能体能否进行开放式 AI 研究?来自两个案例研究的早期证据
本文介绍了一种名为影子评估的新评估方法,用于测试 AI 智能体能否进行开放式 AI 研究。在两个案例研究中,智能体在没有人类帮助的情况下完成了所有工程任务,但未能对研究问题取得实质性进展,揭示了五种反复出现的故障模式。
开放与封闭AI模型:2025-2026年差距如何缩小及未来走向
本文探讨了从2025年初到2026年中,开放与封闭AI模型之间的性能差距如何急剧缩小,以DeepSeek开放模型的发布及其后续市场影响为例。文章还讨论了中国实验室在推动开放前沿方面的作用及其对行业的影响。