一步预测陷阱(人工智能研究中的)
摘要
Rich Sutton 讨论了在人工智能研究中依赖一步预测的常见错误,并提倡使用选项和GVF的时间抽象模型。
暂无内容
查看缓存全文
缓存时间: 2026/07/12 19:50
# 苦涩的教训
来源:http://incompleteideas.net/IncIdeas/OneStepTrap.html
## 单步陷阱(人工智能研究领域)
## 里奇·萨顿
### 2024年7月18日为X撰写
单步陷阱是一种常见错误,即认为AI智能体学到的预测全部或大部分可以是单步预测,而所有更长期的预测只需通过迭代单步预测即可生成。该陷阱最重要的表现是:当单步预测构成一个关于世界及其随时间演变的模型时,人们很容易认为,只需学习一个单步转移模型,然后通过“展开”来预测某种行为方式的所有长期后果。这种单步模型被视为类似于物理学或逼真的模拟器。
这一错误的吸引力在于,它包含了一部分真理:如果所有单步预测都能做到完美准确,那么它们就可以用来完美准确地做出所有长期预测。然而,如果单步预测并非完美准确,那情况就完全不同了。在实践中,迭代单步预测通常会产生糟糕的结果。单步误差会累积放大,导致长期预测出现巨大偏差。此外,从单步预测计算长期预测的计算复杂度也高得令人望而却步。在随机世界或针对随机策略时,未来不再是单一轨迹,而是一棵可能性之树,每条分支都需要被想象并按概率加权。因此,从单步预测计算长期预测的计算复杂度与预测长度呈指数关系,通常不可行。
归根结底,世界的单步模型虽然极具吸引力,但却毫无希望,并且被广泛应用于POMDPs、贝叶斯分析、控制理论以及人工智能的压缩理论中。
在我看来,解决方案是使用选项和GVFs来构建世界的时间抽象模型,如下述参考文献所述。
Sutton, R.S., Precup, D., Singh, S. (1999). Between MDPs and semi-MDPs: A Framework for Temporal Abstraction in Reinforcement Learning. Artificial Intelligence 112:181-211.
Sutton, R. S., Modayil, J., Delp, M., Degris, T., Pilarski, P. M., White, A., Precup, D. (2011). Horde: A scalable real-time architecture for learning knowledge from unsupervised sensorimotor interaction. In Proceedings of the Tenth International Conference on Autonomous Agents and Multiagent Systems, Taipei, Taiwan.
Sutton, R. S., Machado, M. C., Holland, G. Z., Timbers, D. S. F., Tanner, B., & White, A. (2023). Reward-respecting subtasks for model-based reinforcement learning. Artificial Intelligence 324.
相似文章
@BenjaminDEKR:使用 AI 进行开发时一个真正的陷阱就是“解决问题作秀”——那种做法看起来、感觉上都像是你在精心设计解决方案……
作者探讨了人工智能开发中一个常见的陷阱,即“伪解决问题行为”:在这种模式下,看似有效的工作实际上会带来效率低下且复杂的处理流程。
从单一动作到预测、规划与不可逆性:世界模型中预测的路径空间形式化
本文提出了一种AI世界模型中预测的路径空间形式化方法,将未来轨迹的分布视为基本预测对象。研究表明,预测、规划和不确定性表现为对单一作用泛函的操作,并证明学习模型中的注意力不对称性与数据中的不可逆性相关。
@AlexiGlad: 人工智能的进步源于采用更弱假设的方法,这使其能够更好地扩展。但表示…
引入了视觉时域差分(TDV),这是一种全新的表示学习范式,仅依赖于因果关系,无需数据增强、掩码或裁剪,并在密集空间任务上达到了与DINO和iBOT等最先进方法相当的性能。
语义步骤预测:通过步骤采样实现LLM推理轨迹中的多步潜在预测
本文介绍了语义步骤预测,该方法在推理步骤边界而非随机令牌位置上应用几何正则化,在ProcessBench上相比固定基线实现了168倍的多步潜在预测提升。
OneVL:基于视觉语言解释的单步隐式推理与规划
# 论文页面 - OneVL:基于视觉语言解释的单步隐式推理与规划 来源:[https://huggingface.co/papers/2604.18486](https://huggingface.co/papers/2604.18486) 发布于 4月20日 [\#1 每日论文](https://huggingface.co/papers/date/2026-04-21) 作者:, , , , , , , , , , , , , , , , , , , , ## 摘要 OneVL 提出了一个统一的视觉-语言-行动框架,通过整合语言和 v