标签
提出了Agentic Monte Carlo (AMC)方法,利用序贯蒙特卡洛方法对黑盒大语言模型智能体进行强化学习风格的优化,无需访问模型参数。
OpenAI 提出 POLO(在线规划,离线学习)框架,结合基于模型的控制、价值函数学习和协调探索,能够在人形机器人运动和灵巧手部操纵等复杂控制任务中实现高效学习,同时最小化真实世界经验需求。