标签
LiveGrid 是一个免费的基于浏览器的工具,让用户可以观看来自Twitch、YouTube和Kick等平台的多个直播流,在一个可自定义的网格布局中,用于电竞和体育等活动。
一篇关于使用多视图匹配和单目先验对任意图像集进行光束调整的研究论文,在计算机视觉中取得了最先进的结果。
CoVeR 是一种无需训练的空间令牌选择器,通过强制执行精确的令牌预算和全面的场景覆盖,提高视觉语言模型中的3D推理能力,超越了先前的最先进方法。
DUSt3R 团队的一篇论文提出了用于多视图图像 3D 场景生成的稀疏自回归建模方法,使用了体素对齐的 3D 潜空间与占用感知的掩码自回归 Transformer。
提出MBDiff,一种用于概率性公用事业数据填补的多视图行为感知扩散模型,该模型从全局、局部和实例级视图学习用户行为,并使用条件注意力去噪网络。在佛罗里达州的真实公用事业数据上进行的评估表明,它优于最先进的基线模型。
DSTFView是一种用于云边工作负载预测的双输入时空频多视角框架,联合建模邻近性和周期依赖关系,并采用自适应融合机制捕获突变。
CodeNib是一个多视图数据系统,通过为每次提交构建可复用的词汇视图、密集视图和结构视图,向编码智能体提供仓库上下文,从而实现更快的更新和高效的上下文服务。
G-MAD是一个开源框架,利用Arma 3生成同步的多视角RGB-T航空目标检测数据,解决了真实世界数据集的局限性。它还引入了AMOD基准。
MultiView-Bench是一个诊断基准,用于评估视觉语言模型将多个视角整合为一致3D心智模型的能力,揭示了3D空间推理中的系统性失败,并引入了ViewNavigator以缓解这些问题。
Deform360是一个大规模视触觉数据集,包含198个物体、超过215小时的观测数据,用于研究可变形物体动力学,支持在机器人操作中比较2D视频与3D粒子世界模型。
提出了一种将图嵌入高维空间并搜索信息性二维视角的方法,这些视角优化了美学和可读性指标(例如边交叉和角分辨率),这得益于一种新颖的边交叉可微替代方法。引入了一个交互式系统DataFly,用于探索多个候选视角。
本文提出了一种前馈框架,能够从无位姿的多视图图像中将3D场景分解为实例结构的令牌组,从而在没有3D标注的情况下实现直接的对象级重建、分割和操控。
MVTrack4Gen提出了一种训练框架,利用多视角点跟踪作为几何监督来增强运动感知扩散模型,在从单目视频生成新视角视频中实现了最先进的几何一致性和运动保真度。
DR-MV3D 提出了一种基于地图的强化学习框架,通过密集奖励来改进多视角3D视觉问答能力,其核心包括全局地图构建、视角轨迹规划和自我中心定位。
PAIWorld 通过几何感知和跨视图注意力机制增强扩散变换器世界模型,提升机器人操作任务中的多视图三维一致性,在基准测试上达到最优结果。
本文提出了一种非参数多视图高斯过程框架,用于检测机器生成的文本,该框架对诸如释义等对抗性操作具有鲁棒性。通过结合互补特征并提供校准的不确定性,它在保留攻击上优于现有检测器。
WEAVER是一种用于机器人操作的多视角世界模型,通过流匹配损失实现了高保真度、一致性和效率,在策略评估、策略改进和测试时规划中表现出色,并在真实世界中取得了显著改进。
X-Stream 引入了首个多流视频理解基准,将MLLMs作为多路复用器在多个并发流中进行评估。研究表明,当前MLLMs仅能达到约50%的准确率,暴露了处理多流时的显著局限性。
PaGeR 适配了多视角透视基础模型 Depth Anything 3,利用固定的立方体贴图表示,从单张等距柱状投影图像中预测尺度不变深度、度量深度、表面法线和天空分割,同时保持 VRAM 和运行时间恒定。本文还发布了 ZüriPano 和 PanoInfinigen 数据集。
提出GARD,一种基于扩散的框架,在前馈三维重建器的特征空间中操作,从退化输入中联合恢复场景几何和高质量图像。