标签
本文介绍了WM-SAR,一种面向Agent规划的世界模型纠正方法,该方法修复因果子图而非可见症状,在令牌预算下相比标准LLM纠正器实现了更好的稳定性。
本文介绍了 CreativityBench,这是一个用于评估大型语言模型基于可供性推理创造性地重新利用工具能力的基准测试。文章强调,尽管当前模型在通用推理方面表现出色,但在创造性问题解决方面仍面临困难。