planning

标签

Cards List
#planning

CEO-Bench:智能体能否玩转长线游戏?

Hugging Face Daily Papers · 2026-06-16 缓存

CEO-Bench 引入了一个模拟基准测试,评估语言模型智能体在500天内管理初创公司的能力,测试内容包括长期规划、噪声处理、适应性和多任务协调。结果显示,即使是最强的模型也表现挣扎,只有Claude Opus 4.8和GPT-5.5的最终余额高于起始资金。

0 人收藏 0 人点赞
#planning

@mattpocockuk: 打造一个 /decision-mapping 技能,用于将计划拆分为多个会话 类似于 /to-issues,但针对计划…

X AI KOLs Following · 2026-06-15 缓存

Matt Pocock 介绍了一种决策映射技能,用于将计划拆分为多个会话,类似于 /to-issues,旨在简化绿地构建和棕地构建。

0 人收藏 0 人点赞
#planning

一个使用前沿模型进行规划但在本地运行大部分token的代理(为我的双RTX 3090机器构建)

Reddit r/LocalLLaMA · 2026-06-15

作者构建了一个个人AI代理,它使用前沿模型(Codex)进行高层次规划,同时在双RTX 3090系统上本地运行大部分token处理,支持长时间任务并具备确定性验证。该代理支持三个可互换的层级:规划器、本地和高级,并以开源仓库形式提供。

1 人收藏 0 人点赞
#planning

用于 Monte Carlo Tree Search 规划的因果对象中心模型

arXiv cs.AI · 2026-06-15 缓存

COMET 是一种基于模型的强化学习算法,结合了冻结的对象中心编码器、基于 Transformer 的世界模型和 Monte Carlo Tree Search,通过因果注意力聚焦于任务相关对象,在视觉强化学习基准上取得了更高分数。

0 人收藏 0 人点赞
#planning

Deep Work Plan

Product Hunt · 2026-06-15

Deep Work Plan 是一款帮助用户为其AI代理提供结构化计划的产品,强调上下文比模型更重要。

0 人收藏 0 人点赞
#planning

@omarsar0:一样。对 Opus 4.8(规划)和 GPT-5.5(执行)很满意。另外,把步骤拆分成更小的部分来提高质量这一点被严重低估了。

X AI KOLs Following · 2026-06-11 缓存

一位开发者分享了对 Opus 4.8(用于规划)和 GPT-5.5(用于执行)的满意,强调将任务分解成更小的步骤能提高质量,并且动态工作流程被低估了。

0 人收藏 0 人点赞
#planning

SVoT: 基于强化学习的状态感知思维可视化空间推理

arXiv cs.AI · 2026-06-11 缓存

论文提出了SVoT,一种用于多模态大语言模型(MLLMs)中多跳空间推理的强化学习框架,该框架生成交错、可验证的中间状态和可视化,在涉及多对象交互和数值推理的新基准测试上取得了显著的准确性提升。

0 人收藏 0 人点赞
#planning

是否有人在生产环境中部署了多智能体AI员工?

Reddit r/AI_Agents · 2026-06-10

关于在生产环境中部署多智能体AI系统的讨论,其中不同的智能体负责规划、执行、沟通和项目管理,询问实际经验与瓶颈。

0 人收藏 0 人点赞
#planning

超越API:探究MLLMs在物理工具使用中的极限

arXiv cs.CL · 2026-06-10 缓存

本文介绍了PhysTool-Bench,一个用于评估多模态大语言模型在真实世界场景中识别和规划物理工具使用能力的基准。作者发现,即使是最佳模型也只能识别58.7%的工具,并仅完成21.0%的端到端查询,揭示了感知和功能常识两个层面的缺陷。

0 人收藏 0 人点赞
#planning

Front-to-Attractors: 改进双向搜索中的前向-前向启发式

arXiv cs.AI · 2026-06-08 缓存

介绍了一种新的双向搜索启发式类——前向-吸引子(F2A),通过评估到一小簇吸引子的距离,而非整个对面前沿,降低了计算成本,相比现有方法,能够减少多达11.2倍的成对评估次数和4.8倍的节点扩展次数。

0 人收藏 0 人点赞
#planning

弥合智能体-世界鸿沟:面向基于LLM的智能体的文本世界模型

Hugging Face Daily Papers · 2026-06-08 缓存

本文系统综述了面向基于LLM的智能体的文本世界模型,涵盖基础、构建范式、在规划与训练中的应用以及评估方法。

0 人收藏 0 人点赞
#planning

Stride

Product Hunt · 2026-06-06

Stride 是一个由人工智能驱动的工作空间,帮助您规划、设计和交付项目。

0 人收藏 0 人点赞
#planning

我们不再让AI代理提前规划三步,可靠性迅速提升

Reddit r/AI_Agents · 2026-06-02

一位实践者观察到,限制AI代理每次只规划一步而非多步,能显著提升涉及CRM和潜在客户资格认定的现实自动化工作流的可靠性,因为长期计划在外部状态变化时变得脆弱。

0 人收藏 0 人点赞
#planning

生成式规划模型的高效测试时推理

arXiv cs.AI · 2026-06-02 缓存

本文介绍了OCLGen,一种计算高效的测试时搜索算法,它将生成式规划模型与经典的开闭列表框架相结合,提高了组合规划领域的解质量。

0 人收藏 0 人点赞
#planning

世界模型:架构、方法、推理范式与应用的全面综述

arXiv cs.LG · 2026-06-02 缓存

关于世界模型的全面综述,提供了一个多轴分类体系,涵盖架构、方法、推理策略以及跨AI领域的应用,包括Dreamer、MuZero和Sora等关键系统。

0 人收藏 0 人点赞
#planning

@RayFernando1337:在多任务工作流中使用 Cursor 的 Opus 4.8 Max Thinking,在长上下文理解、速度和实现……

X AI KOLs Timeline · 2026-06-02 缓存

一位开发者分享了他使用 Cursor 的子代理工具与 Opus 4.8 Max Thinking 进行长上下文理解和在 Swift 中实现大型功能的工作流程,强调了动手规划和分阶段验收测试。

0 人收藏 0 人点赞
#planning

基于规划器的深度研究强化学习框架:结构感知奖励

arXiv cs.AI · 2026-06-01 缓存

DecomposeR 提出了一种以规划器为中心的强化学习框架,将研究计划表示为类型化的有向无环图(DAG),从而实现对深度研究任务中规划与执行的细粒度优化,在开源基线基础上提升 5.1–8.0 个点。

0 人收藏 0 人点赞
#planning

重根Levin树搜索中的结构诱导信息

arXiv cs.AI · 2026-06-01 缓存

本文针对Levin树搜索提出了三种重根器设计,利用状态空间结构和学习启发式方法,无需显式子目标生成即可提升搜索效率,实现了当前最优的在线训练效率。

0 人收藏 0 人点赞
#planning

将FTS转换并编码为SAT求解:什么有帮助,什么有害(扩展版本)

arXiv cs.AI · 2026-06-01 缓存

本文研究了如何将因子化规划任务(FTS)编码为SAT,提出了多种编码策略,并分析了任务转换对基于SAT的规划性能的影响。其目的是将SAT求解扩展到比启发式搜索更紧凑的规划表示。

0 人收藏 0 人点赞
#planning

你使用什么机制来区分“智能体忙碌”和“任务完成”?

Reddit r/openclaw · 2026-05-29

本文讨论了AI智能体系统中的一种反模式:智能体看似忙碌却未能完成任务。作者建议通过分离职责并要求完成证明来解决。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈