Attention-DP3:基于几何对齐注意力条件化的空间感知3D扩散策略
摘要
Attention-DP3通过注意力机制融入对象级几何线索,增强了3D扩散策略,在复杂环境中提高了稳定性,并在多个基准测试中实现了最先进的性能。
查看缓存全文
缓存时间: 2026/09/15 02:38
论文页面 - Attention-DP3:基于几何对齐注意力条件化的空间对象感知3D扩散策略
来源:https://huggingface.co/papers/2609.13318
摘要
Attention-DP3通过注意力机制注入对象级几何线索来改进3D扩散策略,以在高度杂乱环境中稳定性能。
在复杂、杂乱的操纵场景中,3D点云观测本质上具有模糊性,目标物体可能被部分遮挡,或与视觉相似的干扰物紧密交织。因此,随着场景复杂度增加,标准3D扩散策略往往难以定位和利用任务相关的几何信息。我们提出Attention-DP3——一种空间对象感知的3D扩散策略(https://huggingface.co/papers?q=3D%20diffusion%20policy),该策略通过注意力注入对象级几何线索,同时保持DP3扩散骨架不变。我们的流程首先在RGB图像上执行开放词汇2D分割(https://huggingface.co/papers?q=open-vocabulary%202D%20segmentation),然后利用校准的相机几何信息将预测的目标掩码提升到3D空间,从而获得以对象为中心的几何先验。我们通过三域注意力条件化(Tri-field Attentional Conditioning)(https://huggingface.co/papers?q=Tri-field%20Attentional%20Conditioning)整合这些线索,该机制构建三个互补场:(i) 目标性场(targetness field)(https://huggingface.co/papers?q=targetness%20field)用于锚定目标物体,(ii) 目标内显著性场(intra-target saliency field)(https://huggingface.co/papers?q=intra-target%20saliency%20field)用于强调目标内任务相关的几何结构,以及(iii) 背景性场(backgroundness field)(https://huggingface.co/papers?q=backgroundness%20field)用于抑制干扰物和杂乱元素。在Adroit、DexArt、MetaWorld和真实世界SO101平台上的实验表明,该方法相比DP3实现持续性能提升,在所有基准测试中达到最先进水平。值得注意的是,随着干扰物数量增加,DP3性能急剧下降,而Attention-DP3保持稳定,在高度杂乱环境下性能超越DP3高达31%。代码已开源:https://github.com/zhangzhongbo2213/Attention-DP3\。
查看arXiv页面 (https://arxiv.org/abs/2609.13318)查看PDF (https://arxiv.org/pdf/2609.13318)GitHub (https://github.com/zhangzhongbo2213/Attention-DP3)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.13318)
在您的智能体中获取此论文:
hf papers read 2609\.13318
未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
无模型链接此论文
在模型README.md中引用 arxiv.org/abs/2609.13318 即可从本页面建立链接。
引用本文的数据集0
无数据集链接此论文
在数据集README.md中引用 arxiv.org/abs/2609.13318 即可从本页面建立链接。
引用本文的Space0
无Space链接此论文
在Space README.md中引用 arxiv.org/abs/2609.13318 即可从本页面建立链接。
包含本文的收藏0
无收藏包含本文
将本文添加到收藏 (https://huggingface.co/new-collection) 即可从本页面建立链接。
相似文章
PreDiff-LM: 预训练离散掩码扩散语言建模与混合注意力
PreDiff-LM 提出了一种混合注意力机制,该机制对提示令牌保持因果注意力,对掩码目标令牌使用双向注意力,从而使得预训练自回归模型能够适应离散掩码扩散语言建模,在困惑度和下游任务上相较于先前的扩散基线取得了改进。
从噪声到控制:Parameterized Diffusion Policies
本文介绍了参数化扩散策略(Parameterized Diffusion Policy, PDP)框架,该框架通过以低维潜在参数为条件,使扩散策略变得可控,从而实现无需重新训练即可进行平滑的行为插值和自适应。在仿真和真实机器人实验中,该方法在复杂的多模态机器人任务上展现了更优的性能。
Geometry-Aware Tabular Diffusion
介绍了Geometry-Aware Tabular Diffusion(GATD),该方法通过显式的成对几何特征增强表格扩散去噪器。在十个基准测试上取得了最先进的性能,同时使用的参数显著更少。
Retrofitting Linear Attention into Diffusion Language Models
This paper introduces block-hybrid attention, which combines exact softmax attention within active denoising blocks and linear attention over previous blocks, to accelerate inference in pretrained diffusion language models. The authors retrofit this hybrid attention into LLaDA 2.1, achieving up to 1.7x higher decoding throughput with minimal post-training.
复杂拥挤多智能体路径规划中的离散扩散与稀疏社交注意力
本文介绍了 DiffLNS,一种将离散去噪扩散概率模型(D3PM)与 LNS2 相结合的混合框架,用于多智能体路径规划,利用稀疏社交注意力生成热启动计划。它在复杂拥挤场景下实现了高成功率,优于基线方法。