标签
TRACE 提出了一种新的主动三维重建方法,通过优化完整的传感器轨迹来实现场景信息的遍历覆盖,相比 next-best-view 基线方法取得了 1.5 dB 的 PSNR 提升。
提出了UniWorld-View,一个用于从单目输入进行大基线新视图合成的统一框架,将遮挡感知的点云渲染与视频扩散模型相结合,以实现精确的相机控制和几何一致性。
MAGiSt3R是一个多代理前馈框架,能够以10 FPS的速度从单目RGB视频实现实时3D重建,使用合并模型(MAGMA)结合局部点地图和姿态图优化来减少漂移。
国内开源了一个模型,仅用单摄像头拍摄的视频即可实时重建3D场景,无需LiDAR,单卡运行达20fps,性能优于传统优化方法,并完全开源。
本文提出了一种四维数字观看系统,用于存档插花创作过程。该系统采用同步摄像头、眼动追踪和3D高斯泼溅(3D Gaussian Splatting)技术,支持从任意角度交互式观看。
用户使用Kimi K3模型重建了应县木塔的数字版,包含10611个组件和晨、午、暮、夜四个光照场景,展示了该模型的3D重建能力。
中国开源了一个实时3D场景重建模型,无需LiDAR,仅需普通单摄像头视频,在单GPU上实现20 FPS,并在10,000+帧中保持稳定。
介绍了PhiCalNet,一种用于单次条纹投影轮廓测量的神经网络,通过输出包裹相位并使用固定校准层来避免形状先验捷径,在合成基准测试中实现了比基线UNet低3.3倍的误差。
提出了一种模型,用于填补深度相机在遇到玻璃墙等透明表面时缺失的深度数据,解决了常见的传感器局限性。
PixWorld提出了一种统一的像素空间扩散方法,用于3D场景重建与生成,通过直接的图像级监督和几何感知特征对齐,克服了潜在空间方法的局限性。该方法优于先前的生成方法,并达到了与最先进的重建方法相当的性能。
有人将Blender连接到Fable 5,仅用20分钟就基于公开建筑数据重建了纽约市建筑群,模型等比例。发布者认为这种“先查数据再动手”的思路比Opus 4.8更智能,体现了AI开始具备“做功课”的能力。
PointDiT提出了一种极简的像素空间扩散变换器,使用纯ViT架构进行单目几何估计,在超越复杂基于潜空间模型的同时,在模糊区域保持简洁性和鲁棒性。
本文提出了一种前馈框架,能够从无位姿的多视图图像中将3D场景分解为实例结构的令牌组,从而在没有3D标注的情况下实现直接的对象级重建、分割和操控。
Lift4D是一个测试时优化框架,能够从单目野外视频中重建动态物体的完整4D几何、外观和形变,在具有遮挡和非刚性运动的挑战性序列上优于先前方法。
GeneralVLA-2 引入了 GeoFuse-MV3D 以改进 3D 重建,以及一个受控的 KnowledgeBank 以在机器人操作任务中实现更好的记忆管理,在多个基准测试上取得了性能提升。
SpatialAvatar-0 提出了一种基于共享 FLAME 网格绑定高斯表示的多阶段重建方法,用于高质量4D头部虚拟形象,在多个基准测试中实现了更优性能,且迭代次数更少。
World Tracing 引入了一种生成式像素对齐几何表示,它在预测与观测像素对齐的3D点的同时,补全被遮挡的表面。它使用一个经过像素空间流匹配训练的扩散Transformer,在物体、场景和动态基准测试中的可见表面重建和完整几何生成上取得了强劲性能。
Surflo是一种前馈3D重建模型,它将未定姿的RGB视图压缩成潜在标记,并通过流匹配解码出一致的3D表面点,支持可变分辨率输出,在速度上优于现有方法。
BA-T是一种用于两视图束调整的迭代Transformer架构,通过轻量设计仅使用传统解码器16%的参数,提升3D重建精度和跨视图一致性,性能与更大模型相当甚至更优。