sequential-reasoning

标签

Cards List
#sequential-reasoning

MultivationBench:多模态序列动机推理基准

arXiv cs.AI · 2026-07-31 缓存

介绍了MultivationBench,这是一个基于马斯洛需求层次和赖斯基本欲望的故事驱动视觉叙事,用于评估多模态大语言模型序列动机推理能力的基准。结果表明,所有测试模型在动态动机推断方面均表现不佳。

0 人收藏 0 人点赞
#sequential-reasoning

Complexity Ceiling Benchmark:深度缩放下的多领域顺序推理评估

arXiv cs.AI · 2026-06-30 缓存

介绍复杂度天花板基准(CCB),该基准评估LLM推理能力随顺序步骤增加而衰减的情况,涵盖三个领域。研究发现一致的每步几何衰减,并且所有模型在传递性社会逻辑中在5步内崩溃,即使整体准确性很高。

0 人收藏 0 人点赞
#sequential-reasoning

为何通用人工智能需要世界模型:大型语言模型的不足与世界模型的潜在优势

arXiv cs.AI · 2026-05-26 缓存

本文认为,大型语言模型在因果推理和长时域规划方面存在困难,其原因在于序列预测与对潜在环境动态的推理之间存在目标层面的不匹配,并引入了潜在动态推断视角以及Flux环境来研究这些局限性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈