标签
本文提出了Informed Masking(IM),一种针对扩散大型语言模型中强化学习的结构感知扰动方法,该方法优先处理下游令牌,提高了在数学和规划基准测试中的性能。
本文总结了针对编码代理的框架设计的实证研究,表明上下文管理可防止溢出故障、在 LLM 摘要之前进行基于规则的省略具有成本效益,并且规划的作用随模型强度而变化。
一条讨论在规划中使用各种AI模型(如GPT 5.6 Sol XHigh、GLM 5.3 Flash和DeepSeek V4.1 Flash)的推文,强调并非总是需要前沿智能。
DeliveryGym是一个用于自适应课程的长期具身智能体规划的3D强化学习环境,通过强化学习展示了性能提升。
本研究在开放模型和跨层转码器上对语言模型中韵律规划的可泛化性进行压力测试,发现有效规划位置是发射相邻的,而非之前报道的换行符驻留。
Diurnal 是一款原生 Mac 应用,用于快速日程规划,允许用户通过键盘快捷键或语音命令记录想法,与 Google 日历集成,并支持离线使用。
一位推特用户分享了一个提示,该提示使用陶哲轩的'傻问题'方法,通过提出关键问题来压力测试任何计划,以揭示隐藏假设并增进理解。
本文介绍了反事实隐世界模型(CLWM),用于解决世界模型中的反事实坍缩问题,通过对比目标提高部分可观测性下具身推理的规划成功率。
本文通过将控制流不确定性下的业务流程调度构建为机会约束优化问题,提出分解式和整合式方法,并在真实数据和合成数据上进行评估。
介绍了ARC-Bench作为基准,用于审计冻结的JEPA风格世界模型是否正确基于潜在距离对候选动作进行排序,揭示了官方检查点中严重且结构性的失败。论文解释说,闭环重规划掩盖了这些缺陷,导致成功率被高估。
Bioinfoysis 是一个用于生物信息学的多代理框架,它使用持久化运行和基于工件的执行,在像 BixBench 和 LAB-Bench 2 这样的基准测试中实现最先进的准确性。
文章认为,世界模型使人工智能系统能够表示环境、预测结果并做出决策,正在成为下一个主要的人工智能范式,正如著名研究者如Yann LeCun、Demis Hassabis和Fei-Fei Li的共识所示。
本文提出基于信念的世界模型(BB-WMs),旨在通过直接访问关于不确定状态的信念,提升LLM智能体在部分可观测环境中的决策性能,并展示任务表现的改善。
LangChain Academy将于9月17日举办一场关于Deep Agents的现场研讨会,教导参与者构建具备规划、记忆和子智能体的智能体,以处理复杂任务。
Qwen 3.8 Max 的实操评测,重点介绍其速度、强大的规划与简化能力、严谨的实验态度以及创造性实现能力。
本文探讨了潜在世界模型为何在长时程规划中失败,发现瓶颈在于规划目标(潜在距离的平方)而非预测器的准确性;用学得的代价函数替换该目标可显著提升规划性能。
这项arXiv综述(1,547篇论文,2024-2026年)系统性地描绘了长视界LLM智能体领域,厘清了长视界、长上下文和长期记忆三个概念,并将研究组织为六个生命周期类别,同时指出了核心的“视界差距”和开放的度量问题。