面向进化环境中具身智能体的多尺度世界模型混合
摘要
本文介绍了MuSix,一个面向具身智能体的框架,通过尺度感知的世界模型混合与进化机制,处理进化环境中的多尺度推理与动态适应,在EmbodiedBench和HAZARD上相比基线方法取得了改进。
查看缓存全文
缓存时间: 2026/07/02 05:40
# 面向演化环境中具身智能体的多尺度世界模型混合架构 来源:https://arxiv.org/abs/2607.00457 查看 PDF (https://arxiv.org/pdf/2607.00457) > **摘要:**在真实世界中运行的具身智能体需要随着条件变化进行多尺度推理与知识适应。我们识别出将混合专家(MoE)应用于该场景时的两大挑战:路由机制缺乏显式的尺度概念,导致无法在特定尺度上进行针对性更新;而统一的更新策略无法适应各尺度知识以不同速率变得过时的情况。我们提出 MuSix,一个通过尺度感知的世界模型混合与演化来同时解决上述挑战的框架。两阶段路由机制将尺度选择建立在体验距离——一种受解释水平理论启发的环境情境新颖性度量——之上:元路由器首先将该度量映射为连续尺度空间上的权重,随后各尺度的基础路由器在已识别的尺度内选择世界模型。在适应过程中,尺度依赖的遗忘速率使得低尺度知识快速刷新,而高尺度抽象保持持久;门控跨尺度转移则维持整个层级的一致性。在 EmbodiedBench 和 HAZARD 上的实验表明,MuSix 在多尺度推理与动态适应方面超越了最先进的基线方法。 ## 提交历史 来自:Jinwoo Jang \[查看邮件 (https://arxiv.org/show-email/3b4d85fb/2607.00457)\] **\[v1\]** 2026年7月1日星期三 05:23:56 UTC(9,191 KB)
相似文章
MultiWorld:可扩展的多智能体多视角视频世界模型
MultiWorld 是一个统一的多智能体多视角视频世界建模框架,通过多智能体条件模块与全局状态编码器,在精准控制多智能体行为的同时保持多视角一致性。
多智能体世界模型(3分钟阅读)
γ-World 是一个生成式多智能体世界模型,支持独立可控、排列对称的智能体,采用 Simplex Rotary Agent Encoding 和 Sparse Hub Attention 技术,实现了实时 24 FPS 的推演,并具有从两个玩家到四个玩家的零样本泛化能力。
Agent-World:面向演进式通用智能体的现实世界环境合成扩展
# 论文页面 - Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence 来源:[https://huggingface.co/papers/2604.18292](https://huggingface.co/papers/2604.18292) 发布于 4 月 20 日 · 提交者[https://huggingface.co/dongguanting](https://huggingface.co/dongguanting) [](https://huggingface.co/dongguanting) [KABI](https://huggingface.co/donggua
超越单纯的环境扩展:为多模态智能体学习设计有效的环境分布
本文认为简单地扩展多模态环境并不总能改善智能体训练,并提出了能力感知环境选择(AES)和分层难度课程(HDC),以在多样性和难度维度上更好地构建环境分布。
MASS:具有权威共享状态的多玩家世界模型
本文介绍了MASS,一种多玩家世界模型方法,通过使用权威共享状态将世界动态与视图渲染解耦,从而实现可扩展且一致的多智能体模拟,支持多达1,024个并发玩家。