标签
蒙特利尔高等商学院(HEC Montréal)与MILA的一篇论文提出了针对主-次弱耦合马尔可夫决策过程的公平策略优化方法,以单调凹公平函数取代功利主义目标,并引入一种基于计数比例的深度强化学习方法,其中包含基于优先级的采样器,该方法在机器置换任务以及纽约市出租车定价与调度任务上得到了验证。
介绍PrimeScientist,这是一种在自主研究智能体中使用自适应MCTS策略来策略性分配研究投入的方法,旨在资源约束下提高研究质量和样本效率。
本文解决了一个开放问题,表明一个单一算法在无知对手下的多臂老虎机中,针对每个S值都能实现最优切换遗憾。
本文介绍了Cros,一种用于序列临床诊断代理的风险约束停止层,确保诊断错误和覆盖率的有限样本保证,并在源自MIMIC的基准上进行评估。
本文提出了ProSE-Plan,一个贝叶斯自适应规划器,通过考虑用户在有限理性下的可评估性来改进AI辅助,使用提议作为探测来学习偏好并增强决策。
本文提出RATTL,一个使用Wasserstein距离基于贝叶斯信念不确定性调整智能体谨慎程度的框架,用于安全序列决策,适用于基于LLM的系统。
本文介绍了一种强化学习方法,用于训练智能体在序列决策任务中策略性地等待,从而在任务性能与资源节约之间取得平衡。实验表明,在家庭环境和连续状态环境中均出现了显著的等待行为。
介绍Rushes,一个大规模数据集,记录了人类在AI生成的分支叙事中的参与偏好。结果表明,当前如GPT-5等大语言模型在预测用户选择方面甚至无法超越简单基线,凸显了个性化对齐的必要性。
本文以爱荷华赌博任务为测试平台,研究诱导情绪是否会影响LLM的序贯决策。作者发现,虽然情绪诱导对平均决策动态没有显著影响,但愤怒情绪会降低对惩罚的敏感性并减少早期阶段的探索。
本文研究了一种随机线性赌博机问题,其中智能体仅能观测到动作坐标的随机子集,证明了当动作具有低本征维度时可以实现次线性遗憾,并提出了一种具有理论保证的TOFU-POV算法。
提出了一种三阶段训练范式,将世界模型规划内化到LLM智能体中,使其具备前瞻性决策能力。在搜索和数学推理任务上优于基线方法。
本文提出了一种名为“智能体自主世界建模”(AAWM)的训练流程,该流程基于策略自身的决策需求构建世界模型监督,而非依赖下一观测预测,从而使学习目标与有效决策所需的动态特性对齐。
本文介绍了 Agentick,这是一个用于评估涵盖强化学习(RL)、大型语言模型(LLM)和视觉语言模型(VLM)范式的通用序贯决策智能体的统一基准测试。该基准提供了 37 个程序化生成的任务,并揭示目前尚无单一方法占据主导地位,突显了智能体自主性方面仍有巨大的提升空间。
本文介绍了 PRISM,这是一个通过动态问答流程整合视觉-语言模型和大语言模型的框架,旨在提升具身 AI 任务中的顺序决策能力。