标签
本文介绍了一种强化学习方法,用于训练智能体在序列决策任务中策略性地等待,从而在任务性能与资源节约之间取得平衡。实验表明,在家庭环境和连续状态环境中均出现了显著的等待行为。
介绍Rushes,一个大规模数据集,记录了人类在AI生成的分支叙事中的参与偏好。结果表明,当前如GPT-5等大语言模型在预测用户选择方面甚至无法超越简单基线,凸显了个性化对齐的必要性。
本文以爱荷华赌博任务为测试平台,研究诱导情绪是否会影响LLM的序贯决策。作者发现,虽然情绪诱导对平均决策动态没有显著影响,但愤怒情绪会降低对惩罚的敏感性并减少早期阶段的探索。
本文研究了一种随机线性赌博机问题,其中智能体仅能观测到动作坐标的随机子集,证明了当动作具有低本征维度时可以实现次线性遗憾,并提出了一种具有理论保证的TOFU-POV算法。
提出了一种三阶段训练范式,将世界模型规划内化到LLM智能体中,使其具备前瞻性决策能力。在搜索和数学推理任务上优于基线方法。
本文提出了一种名为“智能体自主世界建模”(AAWM)的训练流程,该流程基于策略自身的决策需求构建世界模型监督,而非依赖下一观测预测,从而使学习目标与有效决策所需的动态特性对齐。
本文介绍了 Agentick,这是一个用于评估涵盖强化学习(RL)、大型语言模型(LLM)和视觉语言模型(VLM)范式的通用序贯决策智能体的统一基准测试。该基准提供了 37 个程序化生成的任务,并揭示目前尚无单一方法占据主导地位,突显了智能体自主性方面仍有巨大的提升空间。
本文介绍了 PRISM,这是一个通过动态问答流程整合视觉-语言模型和大语言模型的框架,旨在提升具身 AI 任务中的顺序决策能力。