@DSPyOSS: 一种更清晰的持续学习操作化方案,适用于那些被错误地归类为“RAG”或“RL”的问题…
摘要
提出了一种名为“Machine Studying”的新型持续学习框架,其中AI系统能够自主从语料库中发展专业知识,并引入了StudyBench用于评估。
查看缓存全文
缓存时间: 2026/06/18 08:04
一种更清晰的持续学习操作化方式,能匹配那些被错误地当作“RAG”或“RL”处理的问题。请阅读下方来自 @jacobli99 的帖子,或访问博客:https://jacobxli.com/blog/2026/machine-studying/…
机器研习 | Jacob Xiaochen Li
来源:https://jacobxli.com/blog/2026/machine-studying/
目录
我们越来越需要 AI 智能体在训练时从未见过的领域工作,比如使用一个新的编程库,或利用围绕某种新疾病涌现的文献。这类领域最自然地以文档语料库的形式出现,就像关于某个技术主题的教科书,或描述一个新工具的手册。
面对这样的语料库,当前智能体极度依赖推理计算,并立即将这个问题简化为“RAG”或“长上下文”,然后简单地依赖上下文学习、近似它的权重更新 (https://arxiv.org/abs/2506.06266) 和 (https://arxiv.org/abs/2512.23675) 这种 (https://arxiv.org/abs/2602.16284) 方法,或将其扩展到更长上下文的智能体搜索和递归 (https://arxiv.org/abs/2512.24601)。如果一个领域足够重要,当今的最佳实践是手动构建一个 RL 环境 (https://arxiv.org/abs/2508.06813)(或者买一个!),以便智能体可以通过试错来练习一些相关技能。在所有这些方法中,我们不禁注意到,当前智能体与新领域的互动方式是浅层且手工设计的。人类可以通过阅读教科书并积极思考材料,将其转化为深层知识甚至专长。为什么智能体还做不到呢?
我们将这个问题称为机器研习。给定一个仅包含语料库 \\mathbf\{D\} = \(d\_1, \\ldots, d\_n\),AI 系统能否自主发展出在该底层领域的专长?研习算法是智能体在知道任何下游评估之前,利用 \\mathbf\{D\} 对自身所做的事情。研习可能更新智能体的权重或其 harness 中的任何内容。重要的是,机器研习在定义上并非关于“将语料库内化到权重中”:几乎每个智能体在测试时仍然可以完全访问语料库!问题是它能在该语料库中发展出多少专长。
我们首先定义专长。领域 \\mathbf\{D\} 中的专家是能够高效地将推理计算转化为准确工作的智能体。一个敏锐的新手最终也许能通过纯粹的蛮力通过开卷考试,但只有专家才能轻松产生高质量答案,并在有更多时间时做得更好。具体来说,我们衡量专长是加权面积,即随着推理计算增长,智能体在表现曲线下的面积。(这反过来给出了智能体的智力的概念:一个聪明的智能体能快速在新主题上发展出专长。照此标准,当前的智能体似乎还不太聪明。)
我们将此具体化为StudyBench (https://huggingface.co/datasets/jacobli/studybench),这是我们正在构建的一个基准,用于研究智能体的研习能力。我们仅在很小的规模上触及了皮毛,但想在这篇短文中分享一些初步想法和发现。首先,我们发现,能力相当的尖端智能体在配备搜索能力后,在训练截止日期之后流行起来的领域上,其专长显示出巨大差距。其次,我们报告了我们尝试将流行的自监督或有监督方法用于研习的部分结果。我们发现,要让它们显著提升智能体(而非原始模型)的专长,即使不算不可能,也是极其困难的。总体而言,我们预期权重更新对深层研习至关重要(我们对此有一些不错的想法 (https://noahziems.com/pedagogical-rl)),但我们怀疑近似长上下文注意力并非正确的目标。
我们在项目早期阶段就分享想法和数据,因为机器研习目前是下游 AI 成功的一个核心且未被认识到的瓶颈。“持续学习”目前被广泛讨论,但多数解释是:在职改进 (https://www.dwarkesh.com/p/timelines-june-2025) 和跨会话改进 (https://www.letta.com/blog/continual-learning),在从新任务流中学习时避免灾难性遗忘 (https://arxiv.org/abs/2302.00487) 和 (https://arxiv.org/abs/2606.05661),或者仅仅是更好的上下文管理 (https://www.interconnects.ai/p/contra-dwarkesh-on-continual-learning)。StudyBench 是我们尝试创造的一个具体挑战,供大家共同攀登,目标是仅从语料库就能在新的领域发展出专长的智能体。
1. 研习将语料库转化为专长
预训练和后训练结束后,人们和组织期望他们的智能体能够使用新的库、基于新的研究论文工作,并处理在训练时智能体无法访问的私有语料库。
人类经常面临学习新领域的问题,而我们默认的答案之一是研习。在考试前,即使是开卷考试,我们也会阅读教科书或文献,大声思考,自我测试,并编写自己的笔记。这种准备往往是有回报的,即使我们无法接触到“考试”问题的分布。通过试错进行动手实践(比如使用过去的考试,类似 RL)通常只占努力的一小部分。大部分专长来自于阅读和思考本身的主动努力。
我们希望 AI 智能体也能有同样的能力。给定一个文档语料库 \\mathbf\{D\} 共同定义某个领域,没有任何额外信息(如问答对或奖励函数),一个智能的智能体应当能够研习 \\mathbf\{D\} 以建立对该领域的深层理解。这里的智能体只是一个模型和 harness,\\Sigma = \(\\mathbf\{M\}, \\mathbf\{H\}\),研习算法可能会改变权重或智能体的提示、工具,以及它在环境中维护的索引和笔记。关键的是,语料库在测试时仍然是世界的一部分:智能体仍然可以使用它,但有效的研习应该使这种使用更具针对性且更高效。
从某种角度看,机器学习研究的是当我们有精确的优化目标时,系统如何从数据中改进。**机器研习研究的是,当一个智能体被给予一个声明性的语料库而没有下游任务时,它应该做什么。**当然,这需要预训练的智能体具有关于世界的准确先验。智能体在研习时可能会提出自己的问题和评分标准,就像一个学生自我测试一样,但它不能假设我们会告诉它太多关于任务分布或最终将用于评分它的奖励。
2. 智能体不能直接搜索语料库吗?
对于当前的智能体和推理时计算扩展的兴起,今天最诱人的做法是完全跳过准备阶段。智能体可以在测试时使用 grep、读取文件和运行代码,那么为什么不就每个问题花费更多的推理 token 呢?但这混淆了访问语料库与发展深层专长这两个概念:你不会仅仅因为我们能非常聪明地用谷歌搜索法律文献就雇佣我们中任何一个人当律师。至少,一个好律师之所以好,是因为知道要找什么、去哪里找,以及在找到一段文字后该怎么做。
你可以说,推理和搜索与知识是不可分的 (https://x.com/lateinteraction/status/1909011076605518124)。一个智能体决定 grep 什么或打开哪个文件,是根据其当前权重行动的,而这些权重可能与语料库中编码的世界积极冲突。图 1 展示了一个有趣的例子:我们让 Sonnet 4.6 给出一个加载 Qwen 3.6(一个在 Sonnet 训练后发布的模型)的代码片段。但它的先验太强了,以至于它没有去搜索 Qwen 3.6,而是认为我们的提示有误,转而搜索了 Qwen3 0.6B。
图 1. 要求提供加载 Qwen 3.6(一个在其训练截止日期后发布的模型)的代码,Sonnet 4.6 认为这个名称一定是笔误,于是悄悄搜索了 Qwen3 0.6B。一个研习过新领域的智能体搜索更少,并且每次搜索获得更多,因为它知道语料库包含什么,它应该不信任自己的哪些先验,以及甚至存在哪些可以询问的抽象概念。
3. 专长:将计算转化为准确度的效率
大多数基准报告的是在智能体恰好花费的推理预算下的准确度。最近,有越来越多 (https://aclanthology.org/2023.findings-acl.738.pdf) 的推动力,要求在多个推理计算水平上报告质量 (https://aclanthology.org/anthology-files/anthology-files/pdf/findings/2025.findings-emnlp.1172.pdf) 并 (https://x.com/polynoamial/status/2064210146558136827)。
在机器研习中,这种质量与成本之间的权衡正是我们试图测量的精确量。我们对其在特定任务上的能力本身并不那么感兴趣,而是对其在新领域快速培养专长的能力更感兴趣。毕竟,如果一个用例足够流行,下一代模型很可能开箱即用就能完美解决,但部署期间总是会有新领域。
为了理解这种对质量与成本权衡的强调,请注意,由于语料库在测试时总是可用的,即使一个新手智能体原则上也可以在考试期间学习,比如在每次回答前重新阅读每个相关文件,并且只要有足够的时间,可能也能做得任意好。借用扩展定律的一些直觉,一个研习算法所承诺的是整个质量/成本曲线的移位,即在相同预算下实现更高准确度,或在更小预算下实现相同准确度。
也就是说,整条曲线直接比较起来很不方便。如果最终能用一个数字来量化“专长”就好了。确实,在许多情况下,两条曲线会收敛甚至交叉,而交叉点是否使上升的线比另一条“更好”,取决于哪些推理预算在实际中是可行的。因此,在机器研习中,我们认为你应该先决定多快的昂贵预算应该被折现(即赋予更小的权重),一旦你做了这个,将每条曲线简化为其加权面积。我们称这个加权面积为专长:
\[\text{专长} = \int \text{在某个推理预算下的表现} \times \text{该预算的重要性}\]一个只有在大量搜索后才变得准确的智能体可以达到峰值表现,但我们认为它在该领域的专长较低。将这个加权面积记为 \\mathcal\{E\}\(\\Sigma; \\mathbf\{D\}\),我们也就得到了研习的成功标准。研习算法 \\pi 将一个智能体和一个语料库映射到一个新的智能体,它有效当且仅当
\[\mathcal{E}\big(\pi(\Sigma, \mathbf{D});\, \mathbf{D})\big) \;>\; \mathcal{E}\big(\Sigma;\, \mathbf{D})\big),\]专长 = 表现 vs. 推理计算
示意曲线 · 每个数字后的值 = 专长(加权面积,更强调便宜预算)
推理计算(token,对数刻度)
图 2. 示意性的表现 vs. 推理计算曲线,定义了专长。
图 2 显示了四个理想化的智能体:一个普通能干但非专家的智能体,一个研习过语料库但只是“浅层”研习的临阵磨枪智能体,一个蛮力 harness,以及我们理想化的专家。普通曲线随着计算增长而缓慢上升。专家曲线位于其上方和左侧,在几乎所有预算下都更好。临阵磨枪曲线起始很高,因为浅层研习者记住了材料但没有理解,然后趋于平缓。对它来说,额外时间在开卷下收益甚微,我们将在下文对模型在合成问题上的训练中遇到这种形状。蛮力 harness(基本上是在考试期间研习的那种)最终达到最高点,但只在那些应该被极度折现的预算下才如此。
注意如何计算专长专长是表现关于对数计算的加权平均,
\\mathcal\{E\}\(\\Sigma; \\mathbf\{D\}\) = \\int p\_\{\\Sigma,\\mathbf\{D\}\}\(x\)\\, w\(x\)\\, dx, \\qquad w\(x\) \\geq 0, \\quad \\int w\(x\)\\, dx = 1,
其中 p\_\{\\Sigma,\\mathbf\{D\}\}\(x\) 是智能体 \\Sigma 在领域 \\mathbf\{D\} 中,对数 token 轴位置 x 上的表现。权重 w 表示每个预算的相对重要性。将 w 归一化确保专长与表现处于同一尺度。在本文中,x=0 对应 3\\text\{k\} 生成 token,这通常是现代推理模型阅读问题并提供完整答案所需的最小值。每增加 \+1 表示 token 增加十倍。我们使用指数衰减 w\(x\) = \(\\ln 10\)\\, 10^\{\-x\},因此每次计算翻倍,预算的权重减半。
在实践中,我们评估一组有限的预算,并将 p\_\{\\Sigma,\\mathbf\{D\}\}\(x\) 解释为智能体使用至多 x 个 token 所能达到的最佳分数。对于低于第一个测量点的预算,分数默认为最小值(多选题为 0 或随机猜测),反映了假设智能体无法用更少的 token 回答。能在此情况下回答的智能体将访问权重最高的区域。超过最后一个测量预算后,我们无限期地保持最终分数,因为尾部无论如何权重都很小。
作为一个实例,预算为 5\\text\{k\}, 10\\text\{k\}, 20\\text\{k\}, 100\\text\{k\} 个 token,分数分别为 10\\%, 20\\%, 30\\%, 40\\%,对应的权重为 0\.30, 0\.15, 0\.12, 0\.03,得到 \\widehat\{\\mathcal\{E\}\} \\approx 10\.8\\%。这些权重之和为 0\.60 而非 1。剩余的 0\.40 分配到 5\\text\{k\} token 以下的区域,该区域分数为零。因此,即使一个智能体在所有测量预算上表现完美,其专长分数也不能超过 60\\%。这个差距反映了无法用更少 token 回答的成本。下图说明了这一计算。
权重所在区域
3k10k100k1M3k–5k 被置零 → 0权重 w(x)推理计算(token,对数)重要性每 2 倍计算减半(每翻倍 ÷2),因此集中在廉价端 — 但对该系统而言,3k–5k 块被置零,所以该权重被浪费。
专长矩形
1005005k10k20k100k置零块3k–5k,分数 0阴影面积 = 专长 = 10.8%条宽 = 权重(重要性)· 总和为 1每个测量预算是一个矩形:宽 = 其权重,高 = 其分数。阴影阶梯是专长分数。置零块(3k–5k,约占 40% 的权重)高度为零,因此不增加任何东西。
将专长定义为以这种方式计算的标量,使我们能够定义研习智力。对于机器研习而言,一个智能的智能体是能够快速获得在全新领域的专长的智能体。这无非是一个曲线,即针对某个使用特定研习算法的智能体,将专长与研习计算作图得出的曲线。绘制此曲线需要在许多研习预算下进行训练运行,这超出了本文的范围,但提升智能体的智力确实是最终目标。
注意研习智力的概念对于每个研习计算量,我们先绘制智能体的完整表现曲线并将其简化为一个专长分数,然后将专长作为研习计算的函数来看待。这条次级曲线下的加权面积,使用相同的一层构造,就是(研习)智力:
\\text\{智力\} = \\int \\text\{研习预算后的专长\} \\times \\text\{该预算的重要性\}。
智力 = 专长 vs. 研习计算
示意曲线 · 每个数字后的值 = 智力(加权面积,更强调廉价研习)
相似文章
@lateinteraction: 把链接放在这里,给那些想直接看长文的人:https://jacobxli.com/blog/2026/machine-stud…
介绍“Machine Studying”作为一个问题,AI代理必须从语料库中自主发展专业知识,超越RAG或长上下文,并提出了StudyBench基准进行评估。
@jacobli99: 持续学习目前被广泛讨论,但大多是关于在职提升或避免灾难性遗忘…
Jacob Li介绍了'Machine Studying'这一概念,将其视为一种独特且紧迫的持续学习形式,其中AI系统必须仅凭文档语料库在一个新领域发展专业知识。
@DSPyOSS: “从某种意义上说,机器学习探讨的是当拥有明确的优化目标时,系统如何从数据中提升。机器学…
一条由@DSPyOSS和Jacob X. Li发布的推文,对比了机器学习(基于明确目标从数据中优化)与“机器研学”(从无下游任务的声明式语料库中学习),强调了AI系统迫切需要从非结构化文档中发展专业知识。
@jacobli99: 为了比较 Machine Studying 的流程,我们首先定义专业知识。语料库在测试时始终可用…
Jacob Li 引入了 'Machine Studying' 作为持续学习中的一个新问题:AI系统如何仅凭文档语料库在不熟悉的领域发展专业知识,这与避免灾难性遗忘不同。
@omarsar0: // Continual Learning Bench // 持续学习是投入大量资金的研究领域之一。虽然存在…
CL-Bench 是一个经过专家验证的跨六个领域的新基准,用于评估基于LLM的智能体是否真正从序列经验中学习。它发现,朴素上下文学习往往优于专用的记忆系统,表明当前架构增加了开销而非真正的学习。