标签
本文证明了在不规则、非平稳观测下主权代理网格中实现最优推理的两个必要条件:自适应时间尺度和间隙依赖性。这些条件仅由液态(连续时间)网络满足。
MindZero 提出了一种自监督强化学习框架,用于训练多模态大语言模型,使其能够高效且鲁棒地进行在线心智推理,而无需心智状态标注,在准确性和效率上均优于基于模型的方法。