Raster2Seq: 面向平面图重建的多边形序列生成

Hugging Face Daily Papers 论文

摘要

Raster2Seq 采用序列到序列的方法,借助可学习锚点引导的自回归解码,从光栅图像中重建平面图矢量图形,在多个基准数据集上取得了最先进的性能。

从光栅化的平面图图像中重建结构化的矢量图形表示,通常是涉及平面图的计算任务(如自动理解或 CAD 工作流程)的重要前提。然而,现有技术在忠实生成复杂平面图(描绘大型室内空间,包含多个房间和数量不一的多边形顶点)所传达的结构和语义方面存在困难。为此,我们提出 Raster2Seq,将平面图重建构建为一个序列到序列任务,其中平面图元素(如房间、窗户和门)表示为带标注的多边形序列,共同编码几何和语义信息。我们的方法引入了一个自回归解码器,该解码器学习基于图像特征和先前生成的顶点,利用可学习锚点的引导来预测下一个顶点。这些锚点代表图像空间中的空间坐标,从而能够有效引导注意力机制聚焦于信息丰富的图像区域。通过采用自回归机制,我们的方法在输出格式上提供灵活性,能够高效处理具有众多房间和多样多边形结构的复杂平面图。我们的方法在 Structure3D、CubiCasa5K 和 Raster2Graph 等标准基准上取得了最先进的性能,同时在更具挑战性的数据集(如 WAFFLE)上展现出强大的泛化能力,这些数据集包含多样的房间结构和复杂的几何变化。
查看原文
查看缓存全文

缓存时间: 2026/05/18 18:27

Paper page - Raster2Seq: Polygon Sequence Generation for Floorplan Reconstruction

来源:https://huggingface.co/papers/2602.09016

摘要

Raster2Seq 通过序列到序列建模,利用可学习锚点引导空间注意力,以自回归解码方式从栅格图像重建平面图矢量图形。

从栅格化的平面图图像重建结构化的矢量图形表示,通常是涉及平面图的计算任务(例如自动理解或 CAD 工作流)的重要前提。然而,现有技术难以忠实地生成复杂平面图所传达的结构和语义,这些平面图描绘了包含多个房间和不同数量多边形转角的大型室内空间。为此,我们提出 Raster2Seq,将平面图重建视为一个序列到序列任务,其中平面图元素(如房间、窗户和门)被表示为标记化的多边形序列,该序列同时编码几何和语义信息。我们的方法引入了一个自回归解码器,它学习根据图像特征和先前生成的转角来预测下一个转角,并利用可学习锚点的引导。这些锚点表示图像空间中的空间坐标,从而有效引导注意力机制聚焦于信息丰富的图像区域。通过采用自回归机制,我们的方法在输出格式上具有灵活性,能够高效处理包含大量房间和多样多边形结构的复杂平面图。我们的方法在 Structure3D、CubiCasa5K 和 Raster2Graph 等标准基准上取得了最先进的性能,同时在更具挑战性的数据集(如 WAFFLE,其中包含多样的房间结构和复杂的几何变化)上也表现出强大的泛化能力。

查看 arXiv 页面 (https://arxiv.org/abs/2602.09016) 查看 PDF (https://arxiv.org/pdf/2602.09016) 项目页面 (https://cornell-vailab.github.io/Raster2Seq/) GitHub4 (https://github.com/Cornell-VAILab/Raster2Seq) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2602.09016)

在你的 agent 中获取此论文:

hf papers read 2602.09016

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 (0)

暂无模型链接此论文

请在模型 README.md 中引用 arxiv.org/abs/2602.09016,以便从此页面链接。

引用此论文的数据集 (0)

暂无数据集链接此论文

请在数据集 README.md 中引用 arxiv.org/abs/2602.09016,以便从此页面链接。

引用此论文的 Spaces (0)

暂无 Space 链接此论文

请在 Space README.md 中引用 arxiv.org/abs/2602.09016,以便从此页面链接。

包含此论文的收藏集 (0)

暂无收藏集包含此论文

请将此论文添加到一个收藏集中,以便从此页面链接。

相似文章

TriSplat:面向仿真的前馈式三维场景重建

Hugging Face Daily Papers

TriSplat是一种前馈式三维重建网络,利用有向三角形图元直接从单张图像生成可直接用于仿真的网格,省去了昂贵的后处理步骤。该方法在保持竞争性的新视角渲染质量的同时,实现了几何保真的重建。

表征先于像素:语义引导的分层视频预测

Hugging Face Daily Papers

Re2Pix 是一个分层视频预测框架,通过首先使用冻结的视觉基础模型预测语义表征,然后将这些预测作为条件输入到潜在扩散模型中以生成逼真的帧,从而改进未来视频生成。该方法通过嵌套丢弃和混合监督策略解决了训练-测试不匹配问题,在自动驾驶基准测试中实现了更好的时间语义一致性和感知质量。

FLAT: 面向几何精确场景生成的前馈潜在三角形溅射

Hugging Face Daily Papers

FLAT提出了一种方法,直接从视频扩散潜在表示中解码显式三角形溅射,用于几何精确的3D场景生成。它引入了以射线为中心的旋转参数化和乘积窗口函数来改善梯度流,实现了比先前前馈方法更好的几何精度,同时支持实时渲染。