标签
在ECCV 2026的AI City挑战赛中,展示了开发稳健视觉AI系统的获胜者,其中顶级解决方案在视频预测中使用NVIDIA Cosmos世界基础模型,用于场景理解和预测等任务。
ZipDepth 是一种轻量级零样本单目深度估计模型,实现了最佳精度-效率权衡,可在从手机到服务器GPU的任何设备上实时运行,并已被ECCV 2026接受。
PriorEye 为端到端自动驾驶引入了地理空间视觉先验,通过双重记忆架构增强了预见性和鲁棒性,如在 ECCV 2026 上所展示。
360 AI Research Institute 的 MoSA(Motion-Grounded Segment Anything),已被 ECCV 2026 接收,它训练 Segment Anything 模型利用未标注视频中的运动线索来分割物体,无需人工注释即可生成数百万个伪标签。
宣布 RT-DocLayout,这是世界上首个能够在真实文档中进行像素级多点多边形框的布局分析模型,已被 ECCV 2026 接收。论文指出,尽管端到端模型日益强大,布局分析仍然至关重要,并介绍了一个高效的 33M 参数模型,运行速度达 132.1 FPS。