value-function

标签

Cards List
#value-function

Agentic Monte Carlo: 为黑盒智能体模拟强化学习

arXiv cs.LG · 2026-06-05 缓存

提出了Agentic Monte Carlo (AMC)方法,利用序贯蒙特卡洛方法对黑盒大语言模型智能体进行强化学习风格的优化,无需访问模型参数。

0 人收藏 0 人点赞
#value-function

在线规划,离线学习:通过基于模型的控制实现高效学习和探索

OpenAI Blog · 2018-11-05 缓存

OpenAI 提出 POLO(在线规划,离线学习)框架,结合基于模型的控制、价值函数学习和协调探索,能够在人形机器人运动和灵巧手部操纵等复杂控制任务中实现高效学习,同时最小化真实世界经验需求。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈