EMMA:从多模态数据中提取多个物理参数
摘要
EMMA是一种基于物理信息的多模态框架,利用液体时间常数网络和物理约束损失,从原始视频、音频和图像数据中恢复动力学参数,在多种基准测试中显著优于现有基线方法。
查看缓存全文
缓存时间: 2026/06/09 08:41
论文页面 - EMMA: 从多模态数据中提取多个物理参数
来源: https://huggingface.co/papers/2605.24047
摘要
EMMA 是一个物理信息多模态框架,利用液态时间常数网络和物理约束损失,直接从原始视频、音频和图像数据中恢复动力学参数。
我们提出 EMMA,这是一个物理信息多模态框架 (https://huggingface.co/papers?q=multimodal%20framework) ,能够直接从原始视频、音频和基于图像的时间序列观测中恢复系统所有可识别的动力学参数 (https://huggingface.co/papers?q=dynamical%20parameters)。与先前仅基于视频的方法不同,后者难以处理遮挡状态、隐藏驱动输入或依赖已知初始条件和坐标框架的假设,EMMA 在统一的连续时间模型 (https://huggingface.co/papers?q=continuous-time%20model) 内对显式参数、隐含动态分量和标定不变量进行联合推理。EMMA 利用液态时间常数 (Liquid Time-Constant, LTC) 网络从异构模态 (https://huggingface.co/papers?q=heterogeneous%20modalities) 中学习隐含动力学 (https://huggingface.co/papers?q=latent%20dynamics),同时通过物理约束损失 (https://huggingface.co/papers?q=physics-constrained%20loss) 强制与支配微分方程 (https://huggingface.co/papers?q=differential%20equations) 保持一致。统一的特征管道 (https://huggingface.co/papers?q=unified%20feature%20pipeline) 使得视频轨迹、声学信号和图表导出测量之间能够一致对齐,从而使 EMMA 能够在受迫、隐含和多变量动力学下估计参数,无需分割掩膜、可微渲染或专用传感器。在 100 多个场景中,包括五个标准动力学基准(75 个 Delfys 视频)、具有隐藏输入的真实世界漫游车和四旋翼系统,以及涵盖生物和混沌系统的仿真图表案例研究,EMMA 实现了鲁棒的多参数恢复,并在性能上显著优于现有的单模态和方程发现基线。我们的工作确立了 EMMA 作为一种通用、可扩展的解决方案,用于从机会性多模态数据 (https://huggingface.co/papers?q=opportunistic%20multimodal%20data) 中提取物理一致的模型。代码和数据可在 https://github.com/ImpactLabASU/EMMA-CVPR2026 获取
查看 arXiv 页面 (https://arxiv.org/abs/2605.24047) 查看 PDF (https://arxiv.org/pdf/2605.24047) 项目页面 (https://impactlabasu.github.io/EMMA-CVPR2026/) GitHub (https://github.com/ImpactLabASU/EMMA-CVPR2026) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.24047)
在您的代理中获取此论文:
hf papers read 2605\.24047
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型引用此论文
在模型的 README.md 中引用 arxiv.org/abs/2605.24047 以从此页面链接。
引用此论文的数据集0
没有数据集引用此论文
在数据集的 README.md 中引用 arxiv.org/abs/2605.24047 以从此页面链接。
引用此论文的 Spaces1
包含此论文的集合0
没有集合包含此论文
将此论文添加到集合 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
EmoS:面向细粒度流式情感理解的高保真多模态基准
本文介绍了 EmoS,这是一个专为细粒度流式情感理解设计的高保真多模态基准,旨在解决现有数据集中存在的生态效度不足和标注可靠性低的问题。
基于生理信号的多模态情感识别的深度时间建模与集成融合
本文评估了深度学习模型(LSTM、TCN、Transformer)在WESAD数据集上基于生理信号的多模态情感识别表现,结果表明集成方法达到了98.91%的准确率。
LongMoE:基于轨迹感知的混合专家模型的纵向多模态学习
LongMoE提出了一个统一框架,同时解决多模态临床学习中的模态缺失和纵向动态问题,利用上下文感知插补、注意力令牌化、轨迹感知编码和稀疏混合专家路由。在ADNI、OASIS-3和MIMIC-IV上的实验表明,在缺失模态情况下鲁棒性得到提升,同时在完整模态设置下仍具有竞争力。
用于特征发现与控制的多模态模型对比分析
MMDiff利用多模态稀疏自编码器来隔离、检测和控制多模态语言模型中的特征,提升可解释性并针对视觉和安全行为进行定向引导。
C$^2$MOE:基于一致性与互补性引导的混合专家框架用于不完整多模态情感学习
论文提出C²MOE,一种基于一致性与互补性引导的混合专家框架,用于对话中的不完整多模态情感识别,利用信息论分解在模态缺失时提高鲁棒性。