planning

标签

Cards List
#planning

@dzhng: 实用建议:使用Fable-5进行规划并作为总的协调者和评审者,用Codex作为实际执行者,从而……

X AI KOLs Following · 2026-07-02 缓存

建议使用Fable-5作为协调者,Codex作为执行者以节省积分,并附有可组合AI代理技能库的链接,用于自主软件开发。

0 人收藏 0 人点赞
#planning

@kasong2048: 为什么之前 Superpowers 很火,最近 Grill with Docs ?因为他们是 Agent 发展不同时期的最佳实践 Superpowers 的流程会输出详细执行计划,这意味着他假设: 1. Agent 无法执行长程任务,所以…

X AI KOLs Timeline · 2026-07-02 缓存

The tweet thread compares two AI agent development frameworks (Superpowers and Grill with Docs) as best practices from different eras, highlighting how their planning strategies reflect assumptions about agent capabilities for long-range tasks.

0 人收藏 0 人点赞
#planning

@mattpocockuk: /wayfinder 就是它了。今天继续推进这个工作,我觉得它会取代我技术栈中的 /grill-with-docs(作为管理……的编排器)

X AI KOLs Timeline · 2026-07-02 缓存

Matt Pocock 正在开发一款名为 /wayfinder 的新规划工具,它能帮助识别决策前沿,并建议通过原型设计、研究或"深度探讨"来减少不确定性。

0 人收藏 0 人点赞
#planning

我在生产环境前想要的智能体技能栈

Reddit r/AI_Agents · 2026-07-02

一位开发者勾勒了生产级AI智能体的结构化技能栈,涵盖规划、工具使用、权限、恢复、观察、预算和升级,这些被视为显式契约而非松散的工具包装器。

0 人收藏 0 人点赞
#planning

ACID:通过逆动力学实现世界模型规划中的动作一致性

Hugging Face Daily Papers · 2026-07-02 缓存

本文提出ACID方法,通过逆动力学模型引入循环动作一致性,增强世界模型中的决策时间规划,确保预测的可实现性,并在多个任务中以更少的计算量提升规划效率。

0 人收藏 0 人点赞
#planning

Delta-JEPA: 通过潜在差异解码学习动作敏感的世界模型

arXiv cs.AI · 2026-07-01 缓存

Delta-JEPA 引入了一种无重建的世界模型,通过潜在差异动作解码器增强潜在前向预测,以防止崩溃并提高动作敏感性,从而在视觉连续控制任务上实现更好的规划性能。

0 人收藏 0 人点赞
#planning

超越对话的心智理论与说服:评估LLMs通过规划与行动诱导信念状态的能力

arXiv cs.CL · 2026-07-01 缓存

本文介绍了非对话规划心智理论(NCP-ToM)及新型评估框架NCP-ExploreToM,旨在评估LLMs能否通过行动而非对话诱导其他智能体产生特定信念状态。在600个任务中对前沿模型与人类进行测试,GPT-5成功率达到约80%,优于人类,但所有模型在错误信念状态任务上表现更差。

0 人收藏 0 人点赞
#planning

面向多模态核监管文件多跳推理的LLM引导规划

arXiv cs.AI · 2026-06-30 缓存

本文将监管文件审查问题建模为LLM引导的规划问题,采用无向量文档树,配备浏览、读取和搜索工具,并以动态知识图谱作为状态。在针对NuScale FSAR文档的200个问题基准测试中,该系统达到了81.5%的准确率和0.93的RAGAS忠实度,显著优于现有RAG方法。

0 人收藏 0 人点赞
#planning

从单一动作到预测、规划与不可逆性:世界模型中预测的路径空间形式化

arXiv cs.LG · 2026-06-30 缓存

本文提出了一种AI世界模型中预测的路径空间形式化方法,将未来轨迹的分布视为基本预测对象。研究表明,预测、规划和不确定性表现为对单一作用泛函的操作,并证明学习模型中的注意力不对称性与数据中的不可逆性相关。

0 人收藏 0 人点赞
#planning

基于迭代语言规划:参数化世界模型如何减少LLM代理中的幻觉传播

arXiv cs.AI · 2026-06-29 缓存

本文介绍了基于迭代语言规划(GILP),一种将小型参数化世界模型与基于LLM的推理相结合的方法,以减少LLM代理中的幻觉传播。实验表明,在图结构规划基准上,GILP将幻觉状态率从0.176降低到0.035,并将任务成功率从0.668提高到0.838。

0 人收藏 0 人点赞
#planning

理解图世界模型中的展开误差

arXiv cs.AI · 2026-06-29 缓存

本文分析了图世界模型(GWM)中的长时域展开误差,提出了一个包含动态边的统一框架,并引入了误差感知图世界模型(Error-Aware GWM),该模型利用谱正则化、展开一致性和关键节点加权来防止发散。

0 人收藏 0 人点赞
#planning

RS-Diffuser: 风险敏感的扩散规划与分布值引导

arXiv cs.LG · 2026-06-29 缓存

RS-Diffuser 提出了一种风险敏感的离线扩散规划框架,结合扩散轨迹生成和分布值批评器,通过尾部感知目标在推理时灵活调整风险偏好,在安全关键任务中提升了回报和鲁棒性。

0 人收藏 0 人点赞
#planning

你认为World Models会通向AGI吗?

Reddit r/ArtificialInteligence · 2026-06-27

讨论World Models(通过学习内部环境表示来模拟物理和规划行动)是否能够克服类似LLMs的被动预测文本模型的局限性,从而通向AGI。

0 人收藏 0 人点赞
#planning

@FinanceYF5: 下一 token 预测是短视的。那如果 Transformer 学会预测自己的下一个隐状态呢? Jayden Teoh提出 Next-Latent Prediction(NextLat):一种自监督学习方法,教 Transformer 形…

X AI KOLs Following · 2026-06-26 缓存

Jayden Teoh提出Next-Latent Prediction(NextLat),一种自监督学习方法,教Transformer学习预测下一个隐状态,从而形成紧凑的世界模型,用于推理和规划,并通过自推测解码将推理速度提升3.3倍。

0 人收藏 0 人点赞
#planning

@GitTrend0x: Hermes 美学 + 规划 + 奇幻三连杀插件! Hermes Skins 自定义主题,Planning-with-Files 持久规划、http://Draw.io 自动流程图技能、Litprog 文学编程、Wizards-of-th…

X AI KOLs Timeline · 2026-06-22 缓存

介绍多个Hermes插件:主题皮肤、持久规划、Draw.io自动流程图、文学编程技能包、魔幻技能实验室等,将Hermes打造成多功能终端和智能规划工具。

0 人收藏 0 人点赞
#planning

Qwen 27B 用于规划,Qwen 35B-A3B 用于执行?

Reddit r/LocalLLaMA · 2026-06-21

讨论使用 Qwen 27B 进行规划任务,使用 Qwen 35B-A3B 进行执行任务,提出了一种专门的模型方法。

0 人收藏 0 人点赞
#planning

PlanBench-XL:评估大规模工具生态系统中LLM工具使用代理的长期规划能力

Hugging Face Daily Papers · 2026-06-21 缓存

PlanBench-XL是一个新的基准测试,用于评估LLM代理在能见度有限且存在动态干扰的大规模工具生态系统中进行规划和适应的能力。实验显示,GPT-5.4在无阻断设置下仅达到51.9%的准确率,而在严重阻断条件下骤降至11.36%,凸显了长期规划中的重大挑战。

0 人收藏 0 人点赞
#planning

@kentcdodds: 关于结合实际业务背景进行规划的更多内容:

X AI KOLs Following · 2026-06-20 缓存

Kent C. Dodds 和 Sean Roberts 之间关于产品工程、结合实际业务背景进行规划,以及对话和好奇心相对于纯粹数据的重要性的讨论。

0 人收藏 0 人点赞
#planning

Vesta:一种通用具身推理模型

Hugging Face Daily Papers · 2026-06-18 缓存

Vesta 是一个统一的通用具身模型,它将定位、空间推理、导航和长期规划整合到单个基础模型中,在基准测试上比专业模型性能提升超过20%,在真实世界机器人任务上提升超过35%。

0 人收藏 0 人点赞
#planning

世界模型应如何评估?一种以决策为中心的立场

arXiv cs.LG · 2026-06-16 缓存

本文调研了世界模型的评估方法,主张采用以决策为中心的框架,优先考虑反事实推理、规划与策略优化,而非视觉质量。文中引入了L0–L7评估阶梯及基准协议,使评估与声称的效用一致。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈