一步预测陷阱(人工智能研究中的)

Hacker News Top 论文

摘要

Rich Sutton 讨论了在人工智能研究中依赖一步预测的常见错误,并提倡使用选项和GVF的时间抽象模型。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/07/12 19:50

# 苦涩的教训 来源:http://incompleteideas.net/IncIdeas/OneStepTrap.html ## 单步陷阱(人工智能研究领域) ## 里奇·萨顿 ### 2024年7月18日为X撰写 单步陷阱是一种常见错误,即认为AI智能体学到的预测全部或大部分可以是单步预测,而所有更长期的预测只需通过迭代单步预测即可生成。该陷阱最重要的表现是:当单步预测构成一个关于世界及其随时间演变的模型时,人们很容易认为,只需学习一个单步转移模型,然后通过“展开”来预测某种行为方式的所有长期后果。这种单步模型被视为类似于物理学或逼真的模拟器。 这一错误的吸引力在于,它包含了一部分真理:如果所有单步预测都能做到完美准确,那么它们就可以用来完美准确地做出所有长期预测。然而,如果单步预测并非完美准确,那情况就完全不同了。在实践中,迭代单步预测通常会产生糟糕的结果。单步误差会累积放大,导致长期预测出现巨大偏差。此外,从单步预测计算长期预测的计算复杂度也高得令人望而却步。在随机世界或针对随机策略时,未来不再是单一轨迹,而是一棵可能性之树,每条分支都需要被想象并按概率加权。因此,从单步预测计算长期预测的计算复杂度与预测长度呈指数关系,通常不可行。 归根结底,世界的单步模型虽然极具吸引力,但却毫无希望,并且被广泛应用于POMDPs、贝叶斯分析、控制理论以及人工智能的压缩理论中。 在我看来,解决方案是使用选项和GVFs来构建世界的时间抽象模型,如下述参考文献所述。 Sutton, R.S., Precup, D., Singh, S. (1999). Between MDPs and semi-MDPs: A Framework for Temporal Abstraction in Reinforcement Learning. Artificial Intelligence 112:181-211. Sutton, R. S., Modayil, J., Delp, M., Degris, T., Pilarski, P. M., White, A., Precup, D. (2011). Horde: A scalable real-time architecture for learning knowledge from unsupervised sensorimotor interaction. In Proceedings of the Tenth International Conference on Autonomous Agents and Multiagent Systems, Taipei, Taiwan. Sutton, R. S., Machado, M. C., Holland, G. Z., Timbers, D. S. F., Tanner, B., & White, A. (2023). Reward-respecting subtasks for model-based reinforcement learning. Artificial Intelligence 324.

相似文章

OneVL:基于视觉语言解释的单步隐式推理与规划

Hugging Face Daily Papers

# 论文页面 - OneVL:基于视觉语言解释的单步隐式推理与规划 来源:[https://huggingface.co/papers/2604.18486](https://huggingface.co/papers/2604.18486) 发布于 4月20日 [\#1 每日论文](https://huggingface.co/papers/date/2026-04-21) 作者:, , , , , , , , , , , , , , , , , , , , ## 摘要 OneVL 提出了一个统一的视觉-语言-行动框架,通过整合语言和 v