computer-vision

标签

Cards List
#computer-vision

@kwangmoo_yi: Leroy et al., "BLASt3R: Bundle Adjustment of Any Image Set with Multi-View Matching and Monocular Priors" 我们又回到了……

X AI KOLs Timeline ↗ · 2026-09-08 缓存

一篇关于使用多视图匹配和单目先验对任意图像集进行光束调整的研究论文,在计算机视觉中取得了最先进的结果。

0 人收藏 0 人点赞
#computer-vision

@NVIDIAAI: 视觉AI需要识别场景,理解发生了什么,并预测接下来可能发生什么。对于AI City挑战……

X AI KOLs Timeline ↗ · 2026-09-08 缓存

在ECCV 2026的AI City挑战赛中,展示了开发稳健视觉AI系统的获胜者,其中顶级解决方案在视频预测中使用NVIDIA Cosmos世界基础模型,用于场景理解和预测等任务。

0 人收藏 0 人点赞
#computer-vision

@svpino: 我过去从事机器人和无人机的计算机视觉模型工作,没有什么比必须运行机器人更慢的了……

X AI KOLs Timeline ↗ · 2026-09-08 缓存

Antioch Robotics宣布了由GreylockVC领投的3200万美元A轮融资,以开发数字孪生来模拟机器人和无人机中的物理世界测试,旨在加速物理自主性。

0 人收藏 0 人点赞
#computer-vision

@FinanceYF5: 数据标注正在“消失”!GPT-6 Astra 可以轻松区分凯尔特人和尼克斯队的球员,并 deter…

X AI KOLs Timeline ↗ · 2026-09-08

GPT-6 Astra 可以自动识别并标注篮球录像中的各种元素,如球员和裁判,可能使手动数据标注变得过时。

0 人收藏 0 人点赞
#computer-vision

@LearnOpenCV: 1/20 我使用GPT-6 Astra Ultra作为编排器训练了两个分割模型,未提供人工标签。我的提…

X AI KOLs Timeline ↗ · 2026-09-08 缓存

一个实验,其中两个分割模型使用GPT-6 Astra Ultra作为编排器进行训练,未使用人工标签,由于时间限制提示较为随意,并展示了在保留视频上的预测结果。

0 人收藏 0 人点赞
#computer-vision

SynthGait-19K: 一种基于物理的合成视频数据集,用于步态参数估计

Hugging Face Daily Papers ↗ · 2026-09-08 缓存

SynthGait-19K 是一个用于步态分析的大型合成视频数据集,支持基准测试,并展示了合成监督到真实数据的迁移。它包括用于视频生成的 Gait2Vid 和用于估计的 GaitXFormer 等方法。

0 人收藏 0 人点赞
#computer-vision

Marigold V2:重新审视扩散变换器在单目深度估计中的应用

Hugging Face Daily Papers ↗ · 2026-09-08 缓存

Marigold V2通过单步推理和新颖的微调协议,改造扩散变换器用于单目深度估计,实现了更清晰的深度图,并在KITTI和ETH3D等基准测试上取得了显著改进。

0 人收藏 0 人点赞
#computer-vision

@ErenChenAI: WuJi 刚刚开源了其 MINT 模型和 EgoPipeline,用于从第一人称视频中重建3D手部加摄像头运动…

X AI KOLs Timeline ↗ · 2026-09-07 缓存

WuJi 已开源其 MINT 模型和 EgoPipeline,用于从第一人称视频中重建3D手部和摄像头运动,以及1,021小时的自我中心数据,以辅助机器人学习。

0 人收藏 0 人点赞
#computer-vision

RelightFormer: 用于多视图物体重光照的前馈生成Transformer

Hugging Face Daily Papers ↗ · 2026-09-07 缓存

RelightFormer 引入了一种前馈生成Transformer,用于直接单视图和多视图图像重光照,使用交叉注意力进行光照注入和排列不变编码以处理无序视图,通过在大量合成数据集上训练实现最先进的视觉质量。

0 人收藏 0 人点赞
#computer-vision

Fei Fei Li: 构建AI世界模型的竞赛 (45分钟播客)

TLDR AI ↗ · 2026-09-07

World Labs的Atlas通过新视角预测统一了AI生成和3D重建,使用稀疏图像推断场景。该播客以Fei Fei Li讨论构建AI世界模型的竞赛为特色。

0 人收藏 0 人点赞
#computer-vision

@IntuitMachine:即时统计人群人数

X AI KOLs Timeline ↗ · 2026-09-06 缓存

一段演示展示了如何仅用 10 行 Python 代码分析无人机拍摄的拥挤街道画面,检测并清点数百人,体现了计算机视觉技术已变得触手可及。

0 人收藏 0 人点赞
#computer-vision

TransNormal-2:基于几何的修正流与边缘感知解码以实现精确法线估计

Hugging Face Daily Papers ↗ · 2026-09-06 缓存

TransNormal-2通过几何感知训练损失和轻量级RGB引导细化模块校正VAE重建误差,改善单目法线估计,在最少标注下取得强劲成果。

0 人收藏 0 人点赞
#computer-vision

@zhiwen_fan_: DUSt3R 团队的论文

X AI KOLs Timeline ↗ · 2026-09-05 缓存

DUSt3R 团队的一篇论文提出了用于多视图图像 3D 场景生成的稀疏自回归建模方法,使用了体素对齐的 3D 潜空间与占用感知的掩码自回归 Transformer。

0 人收藏 0 人点赞
#computer-vision

为何AI生成的食物图像看起来如此怪异

The Verge ↗ · 2026-09-04 缓存

本文探讨了为何AI生成的食物图像常常看起来不那么诱人,解释了扩散模型的技术局限性以及人类对这些图像的心理反应。

0 人收藏 0 人点赞
#computer-vision

内核重启:突破神经场中神经切向核的边界

arXiv cs.LG ↗ · 2026-09-04 缓存

本文开发了NTK-KIP、MetaQuill和MetaQuill-KIP算法,以改善从稀疏观测中重建神经场,使基于神经切向核(NTK)的神经场变得非线性和元可学习,从而实现高效的少样本适应。

0 人收藏 0 人点赞
#computer-vision

超越检索:渐进式潜在记忆演化用于流式视频理解

Hugging Face Daily Papers ↗ · 2026-09-03 缓存

LatentStream 引入了一个渐进式潜在工作记忆框架,该框架内化流式视觉证据以进行连续推理,在视频基准测试中实现了最先进的结果。

0 人收藏 0 人点赞
#computer-vision

@LinusEkenstam: 我们并不是在朝着一个生成式世界冲刺,我们正乘着一艘火箭飞船进入超空间。这极其强大,…

X AI KOLs Timeline ↗ · 2026-09-02 缓存

World Labs 推出了 Atlas,这是首个多模态世界模型,能够生成具有像素级完美相机控制的图像和视频,并在3D中重建它们。

0 人收藏 0 人点赞
#computer-vision

YOLO26-RGB:复用YOLO26的深度训练主干网络进行图像去雨 [P]

Reddit r/MachineLearning ↗ · 2026-09-01

本研究探讨了重新利用YOLO26深度估计模型的主干网络用于图像去雨,表明在受控实验中,深度训练初始化相比随机初始化提供了持续的改进。

0 人收藏 0 人点赞
#computer-vision

温度自适应 Transformed Teacher Matching

arXiv cs.LG ↗ · 2026-09-01 缓存

本文提出了一种用于知识蒸馏中Transformed Teacher Matching的样本级自适应温度缩放方法,通过局部最小化教师和学生分布之间的KL散度,在图像分类基准上提升性能。

0 人收藏 0 人点赞
#computer-vision

FoldingAgent:从演示视频中推断参数化折纸程序

Hugging Face Daily Papers ↗ · 2026-08-31 缓存

FoldingAgent是一个智能框架,它使用视觉语言模型和专用工具,通过顺序推理和物理验证,从演示视频中推断参数化折纸折叠程序。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈