标签
This paper proposes InK, a neurosymbolic hierarchical reinforcement learning approach that uses incremental knowledge for symbolic planning and reward-shaped low-level neural modules, achieving improved sample efficiency in navigation tasks.
HyperAgent is a research framework that models tool relations via a Tool-Schema Hypergraph to improve planning and execution for LLM agents, reducing API calls and token usage on the AppWorld benchmark.
NeSyFS是一个面向部分可观测环境下LLM智能体的神经符号框架,利用知识图谱表示信念状态,结合快慢思考与不确定性感知规划及反思机制,在ALFWorld、Webshop和ScienceWorld上取得了显著效果。
一项针对ARC-AGI-3谜题、比较Claude Opus 5 High与GPT 5.6 Sol Max的分析显示,Opus通过在可见输出中保留详细状态而获胜,而Sol则依赖被丢弃的隐藏推理。
VisualPatchWorld 提出了一种将世界动力学学习为代码的方法,能够从数据中构建可检查和可编辑的模拟器。在导航和操作任务中,它实现了强大的规划成功率。
一份1984年解密的 technical report 详细介绍了 Shakey 机器人(1966-1972年),这是首款能够感知环境、构建内部模型并利用 STRIPS 规划系统自主制定行动方案的移动机器人。
本文引入了一个受控的多轮环境,以系统研究基础模型智能体在预训练、后训练(通过GRPO与在线策略蒸馏)以及集成(通过多教师在线策略蒸馏)阶段的长程规划能力。
Andrew Ng 发布了一份8页的PDF,详细介绍了四个关键的智能代理工作流程:反思、工具使用、规划和多代理协作,强调一个弱模型通过适当的架构可以胜过强模型。
Cursor的研究表明,多模型智能体系统使用前沿模型作为规划者,用更便宜的模型作为执行者,可以将Token成本降低15倍,从而实现更高效的复杂智能体。
Cursor 的新型 Agent 集群设计采用规划器与工作器模型,将任务分解为树状结构,实现了显著的降本增效。在一项用 Rust 从头重写 SQLite 的测试中,新型集群在四小时内达到 80% 通过率,而旧集群则失败了。
Schema是一个框架,使前沿AI模型能够通过编写可执行程序来建模游戏环境、测试预测和规划,从而在ARC-AGI-3基准测试中达到99%的准确率。
李飞飞博士宣布斯坦福大学 BEHAVIOR 挑战赛进入第二年,这是一项针对长周期、复杂日常任务的机器人竞赛,新增了任务、改进了评估方式,并设有 11,000 美元的奖金池。
GATS引入了一种基于图增强的树搜索与分层世界模型(符号型、学习型、生成型),消除了规划过程中的LLM调用,在合成任务和压力测试中实现了100%的成功率,优于LATS和ReAct。
Matt Pocock 发布了 skills 工具的 v1.1 版本,新增了用于规划、规格说明、实现和代码审查的命令。发帖人已经从 superpowers 切换至该工具。
本文综合了2023-2026年间27篇基准测试、分类学和审计论文,形成了一个统一的LLM代理局限性分类体系,识别出六大失败集群,包括工具调用错误、规划失败、长期退化、多代理协调问题、安全性问题以及测量有效性问题。
本文定义具身算子为具身智能流水线中的可复用功能模块,提出一个涵盖五大类别的分类体系,并构建了一个多维基准框架来评估其可部署性和可组合性。
AdaJEPA引入了一种自适应的潜在世界模型,该模型在测试期间通过闭环模型预测控制持续更新,显著提高了分布偏移下的规划成功率。
Micro-JEPA 是一个轻量级的JEPA(联合嵌入预测架构)Python实现,使智能体能够学习环境表征、在潜在空间中预测未来状态,并规划动作以避开障碍物。