标签
建议使用Fable-5作为协调者,Codex作为执行者以节省积分,并附有可组合AI代理技能库的链接,用于自主软件开发。
The tweet thread compares two AI agent development frameworks (Superpowers and Grill with Docs) as best practices from different eras, highlighting how their planning strategies reflect assumptions about agent capabilities for long-range tasks.
Matt Pocock 正在开发一款名为 /wayfinder 的新规划工具,它能帮助识别决策前沿,并建议通过原型设计、研究或"深度探讨"来减少不确定性。
一位开发者勾勒了生产级AI智能体的结构化技能栈,涵盖规划、工具使用、权限、恢复、观察、预算和升级,这些被视为显式契约而非松散的工具包装器。
本文提出ACID方法,通过逆动力学模型引入循环动作一致性,增强世界模型中的决策时间规划,确保预测的可实现性,并在多个任务中以更少的计算量提升规划效率。
Delta-JEPA 引入了一种无重建的世界模型,通过潜在差异动作解码器增强潜在前向预测,以防止崩溃并提高动作敏感性,从而在视觉连续控制任务上实现更好的规划性能。
本文介绍了非对话规划心智理论(NCP-ToM)及新型评估框架NCP-ExploreToM,旨在评估LLMs能否通过行动而非对话诱导其他智能体产生特定信念状态。在600个任务中对前沿模型与人类进行测试,GPT-5成功率达到约80%,优于人类,但所有模型在错误信念状态任务上表现更差。
本文将监管文件审查问题建模为LLM引导的规划问题,采用无向量文档树,配备浏览、读取和搜索工具,并以动态知识图谱作为状态。在针对NuScale FSAR文档的200个问题基准测试中,该系统达到了81.5%的准确率和0.93的RAGAS忠实度,显著优于现有RAG方法。
本文提出了一种AI世界模型中预测的路径空间形式化方法,将未来轨迹的分布视为基本预测对象。研究表明,预测、规划和不确定性表现为对单一作用泛函的操作,并证明学习模型中的注意力不对称性与数据中的不可逆性相关。
本文介绍了基于迭代语言规划(GILP),一种将小型参数化世界模型与基于LLM的推理相结合的方法,以减少LLM代理中的幻觉传播。实验表明,在图结构规划基准上,GILP将幻觉状态率从0.176降低到0.035,并将任务成功率从0.668提高到0.838。
本文分析了图世界模型(GWM)中的长时域展开误差,提出了一个包含动态边的统一框架,并引入了误差感知图世界模型(Error-Aware GWM),该模型利用谱正则化、展开一致性和关键节点加权来防止发散。
RS-Diffuser 提出了一种风险敏感的离线扩散规划框架,结合扩散轨迹生成和分布值批评器,通过尾部感知目标在推理时灵活调整风险偏好,在安全关键任务中提升了回报和鲁棒性。
讨论World Models(通过学习内部环境表示来模拟物理和规划行动)是否能够克服类似LLMs的被动预测文本模型的局限性,从而通向AGI。
Jayden Teoh提出Next-Latent Prediction(NextLat),一种自监督学习方法,教Transformer学习预测下一个隐状态,从而形成紧凑的世界模型,用于推理和规划,并通过自推测解码将推理速度提升3.3倍。
介绍多个Hermes插件:主题皮肤、持久规划、Draw.io自动流程图、文学编程技能包、魔幻技能实验室等,将Hermes打造成多功能终端和智能规划工具。
讨论使用 Qwen 27B 进行规划任务,使用 Qwen 35B-A3B 进行执行任务,提出了一种专门的模型方法。
PlanBench-XL是一个新的基准测试,用于评估LLM代理在能见度有限且存在动态干扰的大规模工具生态系统中进行规划和适应的能力。实验显示,GPT-5.4在无阻断设置下仅达到51.9%的准确率,而在严重阻断条件下骤降至11.36%,凸显了长期规划中的重大挑战。
Kent C. Dodds 和 Sean Roberts 之间关于产品工程、结合实际业务背景进行规划,以及对话和好奇心相对于纯粹数据的重要性的讨论。
Vesta 是一个统一的通用具身模型,它将定位、空间推理、导航和长期规划整合到单个基础模型中,在基准测试上比专业模型性能提升超过20%,在真实世界机器人任务上提升超过35%。
本文调研了世界模型的评估方法,主张采用以决策为中心的框架,优先考虑反事实推理、规划与策略优化,而非视觉质量。文中引入了L0–L7评估阶梯及基准协议,使评估与声称的效用一致。