标签
本文提出了一种可迁移的学习时间先验方法,用于疫情传播重建。在真实安第斯病毒基准测试中展示了改进的性能,并强调了量化传播标签中不确定性的重要性。
本文提出了一种强化学习方法,使大型语言模型能够通过利用上下文中的语言知识来翻译未见过的语言,其表现优于上下文学习和监督微调。
ReactiveGWM是一种反应式游戏世界模型,通过扩散模型和交叉注意力模块将玩家控制与NPC行为解耦,实现动态的玩家-NPC互动,并能在不同游戏间实现零样本策略迁移。
本文介绍了 Diamond Attention,这是一种用于多智能体强化学习的方法,通过引入结构化随机性来打破对称性,从而实现同质智能体之间的角色区分,在 XOR 游戏等对称任务中实现了完美的协调。
CPCANet 是一种域泛化框架,利用通用主成分分析(CPCA)来发现结构化的域不变子空间,在零样本迁移任务中达到了最先进的性能。