标签
一篇关于使用多视图匹配和单目先验对任意图像集进行光束调整的研究论文,在计算机视觉中取得了最先进的结果。
在ECCV 2026的AI City挑战赛中,展示了开发稳健视觉AI系统的获胜者,其中顶级解决方案在视频预测中使用NVIDIA Cosmos世界基础模型,用于场景理解和预测等任务。
Antioch Robotics宣布了由GreylockVC领投的3200万美元A轮融资,以开发数字孪生来模拟机器人和无人机中的物理世界测试,旨在加速物理自主性。
GPT-6 Astra 可以自动识别并标注篮球录像中的各种元素,如球员和裁判,可能使手动数据标注变得过时。
一个实验,其中两个分割模型使用GPT-6 Astra Ultra作为编排器进行训练,未使用人工标签,由于时间限制提示较为随意,并展示了在保留视频上的预测结果。
SynthGait-19K 是一个用于步态分析的大型合成视频数据集,支持基准测试,并展示了合成监督到真实数据的迁移。它包括用于视频生成的 Gait2Vid 和用于估计的 GaitXFormer 等方法。
Marigold V2通过单步推理和新颖的微调协议,改造扩散变换器用于单目深度估计,实现了更清晰的深度图,并在KITTI和ETH3D等基准测试上取得了显著改进。
WuJi 已开源其 MINT 模型和 EgoPipeline,用于从第一人称视频中重建3D手部和摄像头运动,以及1,021小时的自我中心数据,以辅助机器人学习。
RelightFormer 引入了一种前馈生成Transformer,用于直接单视图和多视图图像重光照,使用交叉注意力进行光照注入和排列不变编码以处理无序视图,通过在大量合成数据集上训练实现最先进的视觉质量。
World Labs的Atlas通过新视角预测统一了AI生成和3D重建,使用稀疏图像推断场景。该播客以Fei Fei Li讨论构建AI世界模型的竞赛为特色。
一段演示展示了如何仅用 10 行 Python 代码分析无人机拍摄的拥挤街道画面,检测并清点数百人,体现了计算机视觉技术已变得触手可及。
TransNormal-2通过几何感知训练损失和轻量级RGB引导细化模块校正VAE重建误差,改善单目法线估计,在最少标注下取得强劲成果。
DUSt3R 团队的一篇论文提出了用于多视图图像 3D 场景生成的稀疏自回归建模方法,使用了体素对齐的 3D 潜空间与占用感知的掩码自回归 Transformer。
本文探讨了为何AI生成的食物图像常常看起来不那么诱人,解释了扩散模型的技术局限性以及人类对这些图像的心理反应。
本文开发了NTK-KIP、MetaQuill和MetaQuill-KIP算法,以改善从稀疏观测中重建神经场,使基于神经切向核(NTK)的神经场变得非线性和元可学习,从而实现高效的少样本适应。
LatentStream 引入了一个渐进式潜在工作记忆框架,该框架内化流式视觉证据以进行连续推理,在视频基准测试中实现了最先进的结果。
World Labs 推出了 Atlas,这是首个多模态世界模型,能够生成具有像素级完美相机控制的图像和视频,并在3D中重建它们。
本研究探讨了重新利用YOLO26深度估计模型的主干网络用于图像去雨,表明在受控实验中,深度训练初始化相比随机初始化提供了持续的改进。
本文提出了一种用于知识蒸馏中Transformed Teacher Matching的样本级自适应温度缩放方法,通过局部最小化教师和学生分布之间的KL散度,在图像分类基准上提升性能。
FoldingAgent是一个智能框架,它使用视觉语言模型和专用工具,通过顺序推理和物理验证,从演示视频中推断参数化折纸折叠程序。