EMMA:从多模态数据中提取多个物理参数

Hugging Face Daily Papers 论文

摘要

EMMA是一种基于物理信息的多模态框架,利用液体时间常数网络和物理约束损失,从原始视频、音频和图像数据中恢复动力学参数,在多种基准测试中显著优于现有基线方法。

我们提出了EMMA,一种基于物理信息的多模态框架,能够直接从原始视频、音频和基于图像的时间序列观测中恢复系统的所有可识别动力学参数。与以往仅依赖视频的方法不同——这些方法往往难以处理遮挡状态、隐藏的驱动输入,或需要已知初始条件及坐标系的假设——EMMA在统一的连续时间模型中对显式参数、隐式动力学分量及标定不变量进行联合推理。EMMA利用液体时间常数(LTC)网络从异构模态中学习潜在动力学,同时通过物理约束损失确保与支配微分方程的一致性。统一的特征管道能够实现视频轨迹、声学信号和图表测量值之间的稳定对齐,从而使EMMA能够在受迫、隐式和多元动力学场景下估计参数,无需分割掩码、可微渲染或专用传感器。在涵盖五个标准动力学基准(75个Delfys视频)、具有隐藏输入的真实世界火星车和四旋翼系统,以及跨越生物和混沌系统的仿真图表案例研究等100多个场景中,EMMA实现了稳健的多参数恢复,并显著优于现有的单模态和方程发现基线方法。我们的结果确立了EMMA作为一种通用、可扩展的解决方案,用于从机会性多模态数据中提取物理一致的模型。代码和数据可在 https://github.com/ImpactLabASU/EMMA-CVPR2026 获取。
查看原文
查看缓存全文

缓存时间: 2026/06/09 08:41

论文页面 - EMMA: 从多模态数据中提取多个物理参数

来源: https://huggingface.co/papers/2605.24047

摘要

EMMA 是一个物理信息多模态框架,利用液态时间常数网络和物理约束损失,直接从原始视频、音频和图像数据中恢复动力学参数。

我们提出 EMMA,这是一个物理信息多模态框架 (https://huggingface.co/papers?q=multimodal%20framework) ,能够直接从原始视频、音频和基于图像的时间序列观测中恢复系统所有可识别的动力学参数 (https://huggingface.co/papers?q=dynamical%20parameters)。与先前仅基于视频的方法不同,后者难以处理遮挡状态、隐藏驱动输入或依赖已知初始条件和坐标框架的假设,EMMA 在统一的连续时间模型 (https://huggingface.co/papers?q=continuous-time%20model) 内对显式参数、隐含动态分量和标定不变量进行联合推理。EMMA 利用液态时间常数 (Liquid Time-Constant, LTC) 网络从异构模态 (https://huggingface.co/papers?q=heterogeneous%20modalities) 中学习隐含动力学 (https://huggingface.co/papers?q=latent%20dynamics),同时通过物理约束损失 (https://huggingface.co/papers?q=physics-constrained%20loss) 强制与支配微分方程 (https://huggingface.co/papers?q=differential%20equations) 保持一致。统一的特征管道 (https://huggingface.co/papers?q=unified%20feature%20pipeline) 使得视频轨迹、声学信号和图表导出测量之间能够一致对齐,从而使 EMMA 能够在受迫、隐含和多变量动力学下估计参数,无需分割掩膜、可微渲染或专用传感器。在 100 多个场景中,包括五个标准动力学基准(75 个 Delfys 视频)、具有隐藏输入的真实世界漫游车和四旋翼系统,以及涵盖生物和混沌系统的仿真图表案例研究,EMMA 实现了鲁棒的多参数恢复,并在性能上显著优于现有的单模态和方程发现基线。我们的工作确立了 EMMA 作为一种通用、可扩展的解决方案,用于从机会性多模态数据 (https://huggingface.co/papers?q=opportunistic%20multimodal%20data) 中提取物理一致的模型。代码和数据可在 https://github.com/ImpactLabASU/EMMA-CVPR2026 获取

查看 arXiv 页面 (https://arxiv.org/abs/2605.24047) 查看 PDF (https://arxiv.org/pdf/2605.24047) 项目页面 (https://impactlabasu.github.io/EMMA-CVPR2026/) GitHub (https://github.com/ImpactLabASU/EMMA-CVPR2026) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.24047)

在您的代理中获取此论文:

hf papers read 2605\.24047

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型引用此论文

在模型的 README.md 中引用 arxiv.org/abs/2605.24047 以从此页面链接。

引用此论文的数据集0

没有数据集引用此论文

在数据集的 README.md 中引用 arxiv.org/abs/2605.24047 以从此页面链接。

引用此论文的 Spaces1

包含此论文的集合0

没有集合包含此论文

将此论文添加到集合 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

LongMoE:基于轨迹感知的混合专家模型的纵向多模态学习

arXiv cs.LG

LongMoE提出了一个统一框架,同时解决多模态临床学习中的模态缺失和纵向动态问题,利用上下文感知插补、注意力令牌化、轨迹感知编码和稀疏混合专家路由。在ADNI、OASIS-3和MIMIC-IV上的实验表明,在缺失模态情况下鲁棒性得到提升,同时在完整模态设置下仍具有竞争力。