标签
介绍了一个针对LLM游戏智能体的自动提示优化框架,该框架将观察-行动流水线分解为两个智能体,并通过环境回报引导的进化循环迭代优化提示。在BabyAI任务上评估,显著提高了成功率(例如,在PutNext上从0%提升到72.5%),且无需更新模型权重。
OmniGameArena 引入了一个统一的基准,用于在多样化的Unreal Engine 5游戏环境中评估VLM代理,该基准包含一个改进动态曲线,用于追踪技能在反思轮次中的演化过程。