标签
包含所有15篇CVPR 2026论文决赛入选作品的完整列表现已在PapersWithCode上发布,提供GitHub仓库、Hugging Face模型工件和评估结果的链接。
Jerry Liu的团队正在CVPR 2026上展示ParseBench,这是一个针对视觉语言模型(VLM)的全面文档理解基准。该基准包含2000页真实企业文档,以及针对表格、图表和视觉定位的评估指标。
Meta 的 FAIR 团队发布了 Flowception 的代码,这是 CVPR 2026 的一篇论文,介绍了一种非自回归视频生成框架。该框架通过交错帧插入与连续去噪,减少了误差累积和计算成本。
Meta AI 和牛津大学 VGG 发布了 VGGT-Omega,这是一个用于 3D 视觉的基础模型,附有项目页面和 GitHub 仓库。