标签
GraphThink 是一个将任务图与场景图相结合的框架,旨在增强基于LLM的长时程具身任务规划,在ALFRED基准上取得了最先进的结果,并提升了泛化能力和闭环重规划能力。
AnovaX是一款优先本地的桌面语音助手,它利用LLM规划器和多代理编排器在用户电脑上执行任务。它具有安全层、自适应恢复以及手机友好的远程界面。
RoboTALES引入了一个两阶段框架,结合基于LLM的规划和基于VLM的批评,以改进任务对齐的视频生成和机器人策略训练,在长时域操作任务上显著优于现有方法。
shadcn 发布了 Agent Skill 项目 improve,让高价模型进行代码审计和规划,低价模型执行,形成可安装、可编排、带执行闭环的系统。
本文提出了一种符号反馈驱动的迭代自我改进框架,以提高大语言模型在长周期规划任务中的鲁棒性和可靠性。该方法利用自然语言提示、符号验证器和计划识别器来增强可行性与正确性。
本文提出UP-NRPA,一种在线框架,将用户画像与基于大语言模型的嵌套展开策略自适应相结合,无需离线训练即可动态定制对话策略,在多个对话任务上实现了100%的成功率。
介绍了Simmer,这是一个基准测试,用于评估LLM生成的可执行计划中的潜在故障,使用了在厨房领域人工策划的符号世界模型。实验表明,前沿LLM最多只能生成17%的无错误计划,高达56%的计划包含潜在故障,而反事实前瞻模拟能显著减少故障。