关于自改进测试时智能的综述:基于反馈的自适应、学习与推理扩展
摘要
本综述提出了自改进测试时智能的统一视角,将测试时适应、学习和扩展联系起来,用于AI系统在部署期间使用基于反馈的方法改进其行为。
arXiv:2609.01679v1 Announce Type: new
摘要:AI系统在部署期间改进其行为的能力正变得越来越重要。随着推理超越固定训练模型的静态执行,越来越多的研究探讨模型如何利用测试时信息和额外计算来实时改进其行为。这些发展主要沿两个方向进行:使用测试时信号修改模型状态的方法,以及通过额外推理时资源(如更多采样和工具使用)改进预测的方法。然而,这些方向通常在不同的社区中研究,使用不同的术语,使得它们的联系更难看出。在本综述中,我们提出基于反馈的测试时智能(TTI)作为理解这种部署时改进的统一视角。我们使用这一视角来关联测试时适应、测试时学习和测试时扩展,突出它们的区别以及在混合系统中日益增长的重叠。这一统一框架有助于连接先前分散的想法,并为研究推理时自改进提供了更清晰的概念基础。我们回顾了主要的方法论范式、代表性应用以及在视觉、语言、多模态学习、生成模型、机器人技术和医疗保健方面的开放挑战。我们的目标是为测试时自改进AI系统的研究提供一个连贯的基础和研究路线图。
查看缓存全文
缓存时间: 2026/09/03 06:08
# 自我改进测试时智能综述:反馈驱动的适配、学习与扩展
来源:https://arxiv.org/html/2609.01679
测试时智能:综述
牛少鹏1,2,⋆,陈国浩1,2,⋆,陈耀福1,温志泉1,胡进武1,邓泽帅1,陈德宇1,张书海1,陈仁杰1,连子昊1,徐守凯1,戴刚1,张云贝3,罗伟4,张一帆5,谭明奎1,4,†,邓成6,†
1华南理工大学 3杜兰大学 4琶洲实验室 5新加坡国立大学 6河海大学
⋆同等贡献,†通讯作者
###### 摘要
人工智能系统在部署过程中改进其行为的能力正变得愈发重要。随着推理超越固定训练模型的静态执行模式,大量研究开始探索模型如何通过利用测试时信息和额外计算来动态优化其行为。这些发展主要沿两个方向展开:一是利用测试时信号修改模型状态的方法,二是通过额外推理时资源(如更多采样和工具使用)来改进预测的方法。然而,这两个方向往往在术语不同的独立社区中被研究,使得它们之间的联系更难以被发现。在本综述中,我们提出了**反馈驱动的测试时智能**作为理解此类部署时改进的统一视角。我们利用这一视角关联了测试时适应、测试时学习和测试时扩展,并强调了它们之间的区别以及在混合系统中日益增长的重叠。这一统一框架有助于连接先前碎片化的概念,并为研究推理时自我改进提供了更清晰的概念基础。我们回顾了在视觉、语言、多模态学习、生成模型、机器人技术和医疗保健等领域的主要方法论范式、代表性应用和开放挑战。我们的目标是为研究测试时自我改进的人工智能系统提供一个连贯的基础和研究路线图。相关资源集合可在https://github.com/mr-eggplant/awesome_test_time_intelligence获取。
###### 目录
1. 1 引言 (https://arxiv.org/html/2609.01679#S1)
2. 2 概念基础 (https://arxiv.org/html/2609.01679#S2)
1. 2.1 测试时智能 (https://arxiv.org/html/2609.01679#S2.SS1)
2. 2.2 统一视角:更新与计算 (https://arxiv.org/html/2609.01679#S2.SS2)
3. 3 测试时学习 (https://arxiv.org/html/2609.01679#S3)
1. 3.1 问题设定与设计维度 (https://arxiv.org/html/2609.01679#S3.SS1)
2. 3.2 测试时学习的反馈信号 (https://arxiv.org/html/2609.01679#S3.SS2)
1. 3.2.1 基于熵和置信度的信号 (https://arxiv.org/html/2609.01679#S3.SS2.SSS1)
2. 3.2.2 基于一致性和增强的信号 (https://arxiv.org/html/2609.01679#S3.SS2.SSS2)
3. 3.2.3 基于重构和自监督的信号 (https://arxiv.org/html/2609.01679#S3.SS2.SSS3)
4. 3.2.4 基于伪标签和自训练的信号 (https://arxiv.org/html/2609.01679#S3.SS2.SSS4)
5. 3.2.5 来自工具、环境或用户的外部反馈 (https://arxiv.org/html/2609.01679#S3.SS2.SSS5)
3. 3.3 测试时更新什么? (https://arxiv.org/html/2609.01679#S3.SS3)
1. 3.3.1 输入适配 (https://arxiv.org/html/2609.01679#S3.SS3.SSS1)
2. 3.3.2 部分参数更新 (https://arxiv.org/html/2609.01679#S3.SS3.SSS2)
3. 3.3.3 辅助参数更新 (https://arxiv.org/html/2609.01679#S3.SS3.SSS3)
4. 3.3.4 骨干与全参数更新 (https://arxiv.org/html/2609.01679#S3.SS3.SSS4)
5. 3.3.5 外部记忆与缓存更新 (https://arxiv.org/html/2609.01679#S3.SS3.SSS5)
4. 3.4 测试时学习的时域特性 (https://arxiv.org/html/2609.01679#S3.SS4)
1. 3.4.1 监督时域:单样本 vs. 多样本学习 (https://arxiv.org/html/2609.01679#S3.SS4.SSS1)
2. 3.4.2 持续时域:情景式与持续学习 (https://arxiv.org/html/2609.01679#S3.SS4.SSS2)
5. 3.5 用于适应的测试时学习 (https://arxiv.org/html/2609.01679#S3.SS5)
1. 3.5.1 分布偏移与分布对齐 (https://arxiv.org/html/2609.01679#S3.SS5.SSS1)
2. 3.5.2 测试时训练与全测试时适应 (https://arxiv.org/html/2609.01679#S3.SS5.SSS2)
3. 3.5.3 无源、在线与持续适应 (https://arxiv.org/html/2609.01679#S3.SS5.SSS3)
4. 3.5.4 仅前向与无梯度适应 (https://arxiv.org/html/2609.01679#S3.SS5.SSS4)
5. 3.5.5 测试时适应的理论理解 (https://arxiv.org/html/2609.01679#S3.SS5.SSS5)
6. 3.6 超越适应:记忆、个性化与自我改进 (https://arxiv.org/html/2609.01679#S3.SS6)
1. 3.6.1 基于演进记忆的测试时学习 (https://arxiv.org/html/2609.01679#S3.SS6.SSS1)
2. 3.6.2 递归自我改进 (https://arxiv.org/html/2609.01679#S3.SS6.SSS2)
3. 3.6.3 个性化与用户特定学习 (https://arxiv.org/html/2609.01679#S3.SS6.SSS3)
4. 3.6.4 环境特定与任务特定专业化 (https://arxiv.org/html/2609.01679#S3.SS6.SSS4)
5. 3.6.5 来自用户反馈的交互式改进 (https://arxiv.org/html/2609.01679#S3.SS6.SSS5)
4. 4 测试时扩展 (https://arxiv.org/html/2609.01679#S4)
1. 4.1 问题表述 (https://arxiv.org/html/2609.01679#S4.SS1)
2. 4.2 推理时计算扩展 (https://arxiv.org/html/2609.01679#S4.SS2)
1. 4.2.1 更长推理与更深度推断 (https://arxiv.org/html/2609.01679#S4.SS2.SSS1)
2. 4.2.2 最优N采样与重复解码 (https://arxiv.org/html/2609.01679#S4.SS2.SSS2)
3. 4.2.3 自一致性与共识机制 (https://arxiv.org/html/2609.01679#S4.SS2.SSS3)
4. 4.2.4 基于搜索的推断与规划 (https://arxiv.org/html/2609.01679#S4.SS2.SSS4)
5. 4.2.5 自适应计算与动态预算 (https://arxiv.org/html/2609.01679#S4.SS2.SSS5)
6. 4.2.6 测试时扩展的理论理解 (https://arxiv.org/html/2609.01679#S4.SS2.SSS6)
3. 4.3 利用外部资源扩展 (https://arxiv.org/html/2609.01679#S4.SS3)
1. 4.3.1 检索与外部知识 (https://arxiv.org/html/2609.01679#S4.SS3.SSS1)
2. 4.3.2 工具使用与程序执行 (https://arxiv.org/html/2609.01679#S4.SS3.SSS2)
3. 4.3.3 验证器、评判器与重排序器 (https://arxiv.org/html/2609.01679#S4.SS3.SSS3)
4. 4.3.4 多智能体推断与协作推理 (https://arxiv.org/html/2609.01679#S4.SS3.SSS4)
4. 4.4 扩展所改进和实现的 (https://arxiv.org/html/2609.01679#S4.SS4)
1. 4.4.1 推理质量 (https://arxiv.org/html/2609.01679#S4.SS4.SSS1)
2. 4.4.2 可靠性与校准 (https://arxiv.org/html/2609.01679#S4.SS4.SSS2)
3. 4.4.3 控制与规划中的决策质量 (https://arxiv.org/html/2609.01679#S4.SS4.SSS3)
5. 4.5 纯粹扩展的局限性 (https://arxiv.org/html/2609.01679#S4.SS5)
1. 4.5.1 高计算成本 (https://arxiv.org/html/2609.01679#S4.SS5.SSS1)
2. 4.5.2 默认无持续改进 (https://arxiv.org/html/2609.01679#S4.SS5.SSS2)
3. 4.5.3 收益递减与不稳定性 (https://arxiv.org/html/2609.01679#S4.SS5.SSS3)
5. 5 学习与扩展的交叉点 (https://arxiv.org/html/2609.01679#S5)
1. 5.1 为学习而扩展 (https://arxiv.org/html/2609.01679#S5.SS1)
1. 5.1.1 共识与自生成目标 (https://arxiv.org/html/2609.01679#S5.SS1.SSS1)
2. 5.1.2 验证器衍生的反馈 (https://arxiv.org/html/2609.01679#S5.SS1.SSS2)
3. 5.1.3 搜索衍生的监督与蒸馏 (https://arxiv.org/html/2609.01679#S5.SS1.SSS3)
2. 5.2 学习如何扩展 (https://arxiv.org/html/2609.01679#S5.SS2)
1. 5.2.1 自适应预算分配 (https://arxiv.org/html/2609.01679#S5.SS2.SSS1)
2. 5.2.2 学习何时推理、检索或搜索 (https://arxiv.org/html/2609.01679#S5.SS2.SSS2)
3. 5.2.3 学习扩展行为 (https://arxiv.org/html/2609.01679#S5.SS2.SSS3)
3. 5.3 联合学习与扩展系统 (https://arxiv.org/html/2609.01679#S5.SS3)
1. 5.3.1 测试时强化学习 (https://arxiv.org/html/2609.01679#S5.SS3.SSS1)
2. 5.3.2 自合成监督 (https://arxiv.org/html/2609.01679#S5.SS3.SSS2)
6. 6 应用 (https://arxiv.org/html/2609.01679#S6)
1. 6.1 视觉感知 (https://arxiv.org/html/2609.01679#S6.SS1)
2. 6.2 生成模型 (https://arxiv.org/html/2609.01679#S6.SS2)
1. 6.2.1 图像恢复与生成 (https://arxiv.org/html/2609.01679#S6.SS2.SSS1)
2. 6.2.2 视频生成 (https://arxiv.org/html/2609.01679#S6.SS2.SSS2)
3. 6.2.3 3D生成与重建 (https://arxiv.org/html/2609.01679#S6.SS2.SSS3)
4. 6.2.4 推理时扩展 (https://arxiv.org/html/2609.01679#S6.SS2.SSS4)
3. 6.3 语言与多模态模型 (https://arxiv.org/html/2609.01679#S6.SS3)
1. 6.3.1 空间推理 (https://arxiv.org/html/2609.01679#S6.SS3.SSS1)
2. 6.3.2 语音识别与音频处理 (https://arxiv.org/html/2609.01679#S6.SS3.SSS2)
4. 6.4 具身智能与机器人技术 (https://arxiv.org/html/2609.01679#S6.SS4)
1. 6.4.1 策略对未知条件的适应 (https://arxiv.org/html/2609.01679#S6.SS4.SSS1)
2. 6.4.2 在线技能改进 (https://arxiv.org/html/2609.01679#S6.SS4.SSS2)
3. 6.4.3 规划时扩展 (https://arxiv.org/html/2609.01679#S6.SS4.SSS3)
5. 6.5 智能体AI (https://arxiv.org/html/2609.01679#S6.SS5)
6. 6.6 医疗保健与个性化AI (https://arxiv.org/html/2609.01679#S6.SS6)
7. 7 开放挑战与未来方向 (https://arxiv.org/html/2609.01679#S7)
1. 7.1 开放挑战 (https://arxiv.org/html/2609.01679#S7.SS1)
2. 7.2 未来方向 (https://arxiv.org/html/2609.01679#S7.SS2)
8. 8 结论 (https://arxiv.org/html/2609.01679#S8)
9. 参考文献 (https://arxiv.org/html/2609.01679#bib)
## 1 引言
人工智能系统传统上是在“训练-推理”范式下开发的\[118 (https://arxiv.org/html/2609.01679#bib.bib118)\]:模型在训练阶段被优化,在部署后被冻结,然后期望在推理时可靠地执行,无需进一步修改。然而,现实世界的智能很少如此静态:人类在行动时会持续适应\[63 (https://arxiv.org/html/2609.01679#bib.bib63)\],借鉴过去的经验,并为困难情况分配更多努力。随着人工智能系统日益部署在动态开放世界\[457 (https://arxiv.org/html/2609.01679#bib.bib457), 269 (https://arxiv.org/html/2609.01679#bib.bib269), 16 (https://arxiv.org/html/2609.01679#bib.bib16), 90 (https://arxiv.org/html/2609.01679#bib.bib90), 184 (https://arxiv.org/html/2609.01679#bib.bib184)\]和个性化设置\[169 (https://arxiv.org/html/2609.01679#bib.bib169), 351 (https://arxiv.org/html/2609.01679#bib.bib351), 366 (https://arxiv.org/html/2609.01679#bib.bib366)\]中,固定模型能够处理所有测试时场景的假设正变得越来越站不住脚。在实际部署中,模型常常暴露于环境不断变化、存在潜在分布偏移\[120 (https://arxiv.org/html/2609.01679#bib.bib120), 177 (https://arxiv.org/html/2609.01679#bib.bib177), 303 (https://arxiv.org/html/2609.01679#bib.bib303), 389 (https://arxiv.org/html/2609.01679#bib.bib389)\]、用户特定需求\[169 (https://arxiv.org/html/2609.01679#bib.bib169), 320 (https://arxiv.org/html/2609.01679#bib.bib320), 103 (https://arxiv.org/html/2609.01679#bib.bib103)\]以及任务难度因实例而异显著变化\[112 (https://arxiv.org/html/2609.01679#bib.bib112), 146 (https://arxiv.org/html/2609.01679#bib.bib146), 473 (https://arxiv.org/html/2609.01679#bib.bib473)\]的环境中。因此,仅通过执行一次固定模型并返回其输出,不再总能获得良好的测试时性能。相反,推理日益成为一个动态过程。部署的系统可能需要利用测试时反馈、更新其部分内部状态\[380 (https://arxiv.org/html/2609.01679#bib.bib380), 329 (https://arxiv.org/html/2609.01679#bib.bib329)\]、检索外部知识\[7 (https://arxiv.org/html/2609.01679#bib.bib7)\]、与工具交互\[45 (https://arxiv.org/html/2609.01679#bib.bib45), 97 (https://arxiv.org/html/2609.01679#bib.bib97)\]、为困难案例分配更多计算\[112 (https://arxiv.org/html/2609.01679#bib.bib112), 473 (https://arxiv.org/html/2609.01679#bib.bib473)\],或通过多步推理和验证来完善其输出\[251 (https://arxiv.org/html/2609.01679#bib.bib251)\],*等等*。这一转变正推动人们对能够在部署期间自我改进的人工智能系统产生日益增长的兴趣,而不是在训练后保持完全静态。
##### 什么是测试时智能?
超越静态推理的一个主要途径是Sun*等人*提出的**测试时学习**\[356 (https://arxiv.org/html/2609.01679#bib.bib356)\],该研究表明,模型可以通过在推理时使用无标签测试数据更新模型状态来获得改进。这一思想催生了大量关于**测试时适应**的工作\[380 (https://arxiv.org/html/2609.01679#bib.bib380), 267 (https://arxiv.org/html/2609.01679#bib.bib267), 269 (https://arxiv.org/html/2609.01679#bib.bib269), 185 (https://arxiv.org/html/2609.01679#bib.bib185), 389 (https://arxiv.org/html/2609.01679#bib.bib389), 15 (https://arxiv.org/html/2609.01679#bib.bib15), 214 (https://arxiv.org/html/2609.01679#bib.bib214)\],其中模型通过更新归一化层\[380 (https://arxiv.org/html/2609.01679#bib.bib380), 133 (https://arxiv.org/html/2609.01679#bib.bib133)\]、提示词\[329 (https://arxiv.org/html/2609.01679#bib.bib329), 487 (https://arxiv.org/html/2609.01679#bib.bib487)\]、低秩适配器\[144 (https://arxiv.org/html/2609.01679#bib.bib144), 470 (https://arxiv.org/html/2609.01679#bib.bib470), 236 (https://arxiv.org/html/2609.01679#bib.bib236)\]、输入\[89 (https://arxiv.org/html/2609.01679#bib.bib89), 440 (https://arxiv.org/html/2609.01679#bib.bib440)\]或全参数\[356 (https://arxiv.org/html/2609.01679#bib.bib356), 240 (https://arxiv.org/html/2609.01679#bib.bib240), 478 (https://arxiv.org/html/2609.01679#bib.bib478), 389 (https://arxiv.org/html/2609.01679#bib.bib389)\]进行适应,目标包括熵最小化\[380 (https://arxiv.org/html/2609.01679#bib.bib380)\]、一致性正则化\[271 (https://arxiv.org/html/2609.01679#bib.bib271)\]或基于重构的监督\[88 (https://arxiv.org/html/2609.01679#bib.bib88), 47 (https://arxiv.org/html/2609.01679#bib.bib47)\]。尽管许多文献关注分布偏移下的鲁棒性,但测试时学习并不局限于鲁棒性本身。它可以更广泛地作为利用测试时信号来提高预测质量或任务能力的通用流程\[268 (https://arxiv.org/html/2609.01679#bib.bib268), 128 (https://arxiv.org/html/2609.01679#bib.bib128), 115 (https://arxiv.org/html/2609.01679#bib.bib115), 217 (https://arxiv.org/html/2609.01679#bib.bib217)\]。
图 1:反馈驱动的自我改进测试时智能AI与传统静态训练-推理AI的比较。
另一个主要途径是**测试时扩展**,其中性能通过额外的推理时计算而提升,不一定改变模型状态。示例包括重复解码\[27 (https://arxiv.org/html/2609.01679#bib.bib27)\]、自一致性\[399 (https://arxiv.org/html/2609.01679#bib.bib399)\]、工具使用\[45 (https://arxiv.org/html/2609.01679#bib.bib45), 97 (https://arxiv.org/html/2609.01679#bib.bib97)\]、基于搜索的推断\[444 (https://arxiv.org/html/2609.01679#bib.bib444)\]以及生成模型中的推理时优化\[249 (https://arxiv.org/html/2609.01679#bib.bib249)\]。类似的思想也出现在机器人和具身系统中,其中规划相似文章
Test Time Training(3分钟阅读)
本文讨论了Test Time Training作为AI开发中潜在的新扩展轴,分析了一篇将其定位为线性注意力形式的论文,并探讨了其对模型训练和持续学习的影响。
当模型学习时(4分钟阅读)
本文解释了测试时训练,即AI模型在推理过程中适应以提高个性化并减少内存使用,但代价是增加每用户计算量。文章讨论了对大规模服务模型的影响,以及在长上下文和用户并发之间的平衡。
EvoTest:面向自我改进智能体系统的进化式测试时学习
EvoTest 引入了 J-TTL,一个衡量智能体测试时学习能力的基准,并提出了一个进化框架,其中 Actor 智能体玩游戏,而 Evolver 智能体在不进行微调的情况下迭代改进系统的提示、记忆和超参数。该方法在基于复杂文本的游戏中表现出优于基于反思和记忆的基线方法的性能。
@HuggingPapers: 现代智能体系统中的自我改进——一项涵盖239篇论文的调研,关于AI智能体如何通过更新模型…
一项涵盖239篇论文的调研,分析AI智能体如何通过更新模型本身或框架(提示、记忆、工具)来自我提升。
AI中的递归自我改进:从有界自我优化到自主研究循环
对2024–2026年间1,250篇关于AI递归自我改进的论文进行了全面综述,提出了将有界自我优化与开放式递归自我改进相区分的分类体系,并分析了评估器设计空间和失败模式。