用于生成式机构综合的离散自回归Transformer

arXiv cs.LG 论文

摘要

本文提出了一种离散自回归Transformer,能够从目标连杆曲线生成平面机构,利用变分自编码器潜变量和标记化的关节坐标,在多种拓扑结构上实现多样且精确的设计。

arXiv:2606.17409v1 公告类型:新论文 摘要:平面路径综合需要机构连杆曲线匹配预设轨迹;从曲线到连杆机构的映射在四杆、六杆和八杆拓扑中天然具有一对多特性。我们通过基于仿真的评估来解决这一设计问题,该评估基于一个包含超过一百万个机构的精选语料库,在正向运动学和几何对齐后报告了Chamfer距离和动态时间规整。我们将综合问题建模为条件自回归序列建模:关节坐标被均匀量化为标记,并由一个解码器-only Transformer生成,该Transformer包含目标曲线的变分自编码器(VAE)潜变量和一个显式的机构类型标记。训练过程结合了标记交叉熵损失和一种高斯平滑的箱体辅助损失,该损失尊重箱体间的序数结构。在推理时,一个有界潜变量噪声调度在每个噪声级别解码所有机构类型;我们保留几何误差最小的前五个候选方案,从而在不依赖数据集查找的情况下获得多样且精确的机构族。在保留测试集上,平均Chamfer距离为$0.0132$,平均动态时间规整为$0.153$;一种在VAE空间中基于训练集邻居潜变量条件化的潜变量k近邻基线方法,使用相同的解码器在匹配拓扑下实现了平均Chamfer距离$0.0071$和平均动态时间规整$0.117$。
查看原文
查看缓存全文

缓存时间: 2026/06/17 05:37

# 用于生成式机构综合的离散自回归Transformer
Source: https://arxiv.org/html/2606.17409
Anurag Purwar计算机辅助设计与创新实验室,机械工程系,石溪大学,纽约石溪,NY 11794-2300,美国

###### 摘要

工程应用。平面轨迹综合需要设计能够使其连杆曲线匹配指定轨迹的机构;从曲线到连杆的映射本质上是一对多的,涉及四杆、六杆和八杆拓扑结构。我们通过在一个包含超过一百万个机构的精选语料库上进行基于仿真的评估来解决这个设计问题,报告了在正向运动学和几何对齐后的Chamfer距离和动态时间规整结果。

人工智能贡献。我们将综合问题形式化为条件自回归序列建模:关节坐标被均匀量化为标记,并由一个仅解码器的Transformer生成,该Transformer具有目标曲线的变分自编码器(VAE)潜在表示和一个显式的机构类型标记。训练结合了标记交叉熵损失和一个尊重分箱间序数结构的高斯平滑分箱辅助损失。在推理时,一个有界潜在噪声调度在每个噪声级别解码所有机构类型;我们通过几何误差保留前五个候选,从而在不进行数据集查找的情况下获得多样且准确的机构族。在保留测试集上,整体平均Chamfer距离为0.01320.0132,平均动态时间规整为0.1530.153;一个在VAE空间中基于训练集邻居潜在表示进行条件化的潜在kk最近邻基线方法,使用相同的解码器在匹配拓扑下实现了平均Chamfer距离0.00710.0071和平均动态时间规整0.1170.117。

###### 关键词:

机构综合,自回归Transformer,连杆曲线,变分自编码器,生成式设计,运动学仿真

††期刊: 工程应用与人工智能

## 1 引言

几十年来,用于轨迹、函数和运动生成的机构综合一直是机械工程领域的核心课题。在轨迹综合中,目标是设计一个机构,其连杆能描绘一条指定的轨迹,通常称为连杆曲线。图1 (https://arxiv.org/html/2606.17409#S1.F1)展示了一个轨迹生成问题的例子,其中给定一个用于行走运动的连杆曲线,目标是综合出多种腿式行走机构,以便集成到机器人系统中Tang2026。经典的表述方法将期望路径离散化为有限个精确定位点,这些点可以直接指定,也可以从连续路径中采样。例如,解析综合方法可以对平面四杆连杆机构的精确定位点(最多九个)得到精确解Wampler1992。通常,该问题是超定的,需要基于数值优化的近似解nocedal2006numerical。

参见图标题图1:四种不同类型的腿式行走机构虽然基于优化的方法已被广泛采用,但它们存在一些根本性的局限性Nurizada2025cBetaVAE。这些方法通常对初始条件敏感,计算成本高,并且不能保证收敛到高质量的解。此外,它们通常只确保在离散的精确定位点处进行插值,未能捕捉到所需连杆曲线的全局形状。诸如结构误差等目标函数,同时优化曲线形状、尺度、方向和位置Erdman2001MechanismDesign,常常错误地描述了综合问题,并导致不切实际的解。也许最关键的是,基于优化的方法通常每个设计任务只产生一个机构,尽管轨迹综合本质上是一对多的。然而,在概念机构设计中,工程师通常需要寻求一组多样化的可行解,以适应额外的约束,如关节位置、杆长比、工作空间限制或可制造性。

为了解决其中一些挑战,提出了替代的表述方法,这些方法能够综合出能够描绘连续路径而非插值有限点集的机构。这类方法明确地面对了连杆曲线综合的超定性问题,即曲线方程的系数超过了可用的设计参数Bai2015。虽然更复杂的连杆机构,如六杆和八杆机构,提供了更强的表达能力,可以实现复杂的运动,但由于设计空间扩大和计算复杂度增加,它们的综合仍然具有挑战性。在此背景下,已经应用了先进的优化策略,但可扩展性和鲁棒性仍然是开放性问题。

近年来,基于机器学习(ML)的方法已成为机构综合的一个有前景的范式。早期工作利用人工神经网络(ANNs)Hoskins1993;vasiliu2001;Xie2007;galan2009;khan2015;Ahmadi2016;Li2017;Mo2019;Yim2021;Kapsalyamov2023;Yim2023来学习连杆曲线表示与机构参数之间的逆映射,一旦训练完成,就能实现近乎即时的综合。这些研究探索了多种曲线表示,包括笛卡尔坐标、傅里叶描述符khan2015;Li2017、小波变换galan2009和基于图像的编码Nurizada2024InvariantCoupler。然而,大多数基于ANN的方法将综合视为一个确定性回归问题,并且对于给定的输入曲线只产生一个固定类型的机构。Nurizada和PurwarNurizada2024InvariantCoupler系统地证明了不同的连杆曲线表示在学习模型中并不会产生有意义的性能差异,这突显了表示选择本身并不能解决一对一预测的根本局限性。

后续工作越来越多地采用生成式表述来解决轨迹综合的一对多结构。Nurizada和PurwarNurizada2025cBetaVAE所做的一项全面综述调查了三十多年来的基于学习方法,包括回归模型、强化学习Vermeer2018;Fogelson2023、潜在变量生成模型kingma2014autoencoding以及混合优化流程nocedal2006numerical。代表性的近期系统包括CLIP风格的综合机制与曲线联合嵌入(配合基于优化的细化)nobari2024linklearningjointrepresentations;radford2021learning,以及基于Transformer的离散化关节坐标序列建模Bolanos2025。大规模数据集推动了这些方向的进展。Nurizada等人Nurizada2025Dataset的语料库包含了约三百万个跨越四杆、六杆和八杆族(包括滑动副变体)的平面运动链;Nobari等人的LINKS数据集Nobari2022LINKSDataset强调了更丰富的拓扑多样性,但代价是许多样本在结构上不适合制造。这些资源共同使得训练能够跨越多个连杆类别的条件模型变得现实,但也提出了如何在统一的、基于仿真的框架下评估和多样化综合的问题。

尽管取得了这些进展,实际差距依然存在。许多学习流程仍然强调每个查询只预测一个机构,依赖于多阶段架构,或者对生成时的拓扑控制有限。强化学习方法Vermeer2018;Fogelson2023可以探索大空间,但通常每个样本成本很高,这对于交互式或高通量设计来说很不方便。此外,还需要推理时的程序,能够针对同一目标连杆曲线呈现*多个*准确且不同的机构族,同时保持跨已发布方法的可比较分数。

受这些差距的启发,我们提出了一个单一的离散自回归Transformer,该Transformer建立在Nurizada2025Dataset的一个精选多拓扑子集上。该模型以目标连杆曲线的VAE潜在表示和一个显式的机构类型标记为条件,使用LLaMA风格的自回归解码器touvron2023llama生成量化的关节坐标,并采用标记交叉熵损失加上一个几何感知的平滑分箱辅助损失szegedy2016rethinking进行训练。图2 (https://arxiv.org/html/2606.17409#S1.F2)勾勒了该流程;第2节 (https://arxiv.org/html/2606.17409#S2)定义了符号和数据结构,第3节 (https://arxiv.org/html/2606.17409#S3)描述了架构和训练目标,第4节 (https://arxiv.org/html/2606.17409#S4)详细介绍了基于仿真的评估和推理时程序(贪心解码sutskever2014sequence、带有跨拓扑前KK选择的潜在噪声扫描,以及重复使用相同解码器的潜在KNN基线)。

参见图标题图2:离散Transformer架构vaswani2017attention;touvron2023llama概述。连续的关节坐标被离散化为分箱,并表示为整数标记Bolanos2025;oord2017neural。一个潜在的几何标记(来自输入连杆曲线的VAEkingma2014autoencoding嵌入)和一个机构类型标记被前置到序列中。一个LLaMA风格的解码器对这些标记进行因果掩码vaswani2017attention处理,并预测离散化的坐标标记。连同所选的机构类型,解码后的序列定义了一个连杆配置。先前的学习流程在评估连杆曲线一致性方面有所不同:数据集论文Nurizada2025Dataset展示了在对每个曲线独立归一化后,基于*非平方*欧几里得最近邻项的双向Chamfer距离的精度,以及一个返回存储候选项的VAE–kk-NN*检索*阶段;而条件β\\beta\-VAE综合Nurizada2025cBetaVAE和基于Transformer的机构生成Bolanos2025则在其他归一化和软件约定下报告了动态时间规整结果。因此,已发表的标量值不能直接与我们进行文字比较。在这项工作中,所有报告的机构均由自回归解码生成;我们不会通过查找数据集来输出机构参数。主要协议以目标曲线的VAE潜在表示及其噪声变体(即潜在空间中不一定与任何训练码向量重合的点)为条件。一个互补的KNN协议使用相同的解码器,但以从VAE空间中靠近查询的训练样例中获取的潜在表示为条件,因此这些条件向量在优化过程中被大量暴露。我们采用严格的基于仿真的协议——弧长重采样、居中、最小化平方对称Chamfer的离散旋转-反射搜索、以及带限DTWSakoeChiba1978DTW;BerndtClifford1994DTW——并报告相对于这些协议内评估,在该多拓扑基准上的最先进CD/DTW结果。

这项工作的主要贡献是:

- •多拓扑条件综合:一个单一的自回归解码器vaswani2017attention;radford2019language,基于Nurizada2025Dataset的一个精选33类型子集(超过1.2M1.2M个机构)进行训练,并显式地以四杆、六杆和八杆族的机构类型为条件。
- •双重条件化与架构:连杆曲线几何结构被注入为一个VAEkingma2014autoencoding潜在表示,投影为一个前缀标记Nurizada2025Dataset,与一个学习的机构类型嵌入一起,输入到LLaMA风格的自回归变压器touvron2023llama中。关节坐标按照Bolanos2025;oord2017neural的方法进行离散化和生成,如图2 (https://arxiv.org/html/2606.17409#S1.F2)所示。
- •混合离散训练目标:交叉熵损失加上一个高斯平滑分箱损失szegedy2016rethinking,以尊重量化坐标之间的序数结构。
- •基于仿真的基准测试:在对齐搜索之后进行贪心解码评估sutskever2014sequence,计算CDBarrow1977Chamfer和DTWSakoeChiba1978DTW,并结合一个潜在空间噪声扫描higgins2017beta,该扫描在每个噪声级别解码所有机构类型,并保留每个噪声级别下按(CD, DTW)排序的前五个候选。此过程提供了我们报告的最佳CD/DTW结果,并为同一目标轨迹生成一组在得分高的解中多样化的机构类型。
- •互补KNN基线:当以训练最近邻cover1967nearest的VAE潜在表示(而非目标或加噪的查询潜在表示)为条件时,评估相同的解码器,这突显了当条件点与训练期间反复出现的码相同时误差下降了多少,而不需要数据集机构查找。

本文的其余部分组织如下。第2节 (https://arxiv.org/html/2606.17409#S2)阐述了综合问题,并描述了所使用的数据集和表示。第3节 (https://arxiv.org/html/2606.17409#S3)详细介绍了Transformer架构和训练方法。第4节 (https://arxiv.org/html/2606.17409#S4)呈现了实验结果和讨论。第5节 (https://arxiv.org/html/2606.17409#S5)进行总结。

## 2 离散数据集表示

本工作中使用的机构取自先前工作中引入的大规模平面单自由度连杆机构数据集Nurizada2025Dataset。该完整数据集包含约三百万个四杆、六杆和八杆机构,具有开式和闭式连杆曲线,使用连续的关节坐标表示,并在统一的运动学框架内进行仿真。关于数据集生成过程、归一化程序、拓扑编码和仿真方法的详细描述见Nurizada2025Dataset。

在本工作中,使用了该数据集的一个精选子集。具体来说,样本数少于20,000的机构类型被排除,以减少类别不平衡,并避免训练期间主导拓扑的过度表示。经过此过滤后,所得数据集包含33种不同的机构类型,包括四个四杆机构族(包含回转副和滑动副变体)、十六个六杆机构和十三个八杆机构。此选择保留了实质性的拓扑多样性,同时产生了在机构族之间更平衡的分布,有助于有效的条件生成建模。数据集中共有1,260,121个机构。

除了关节坐标,数据集中的每个机构还与其相应的连杆曲线表示相关联。在本工作中,连杆曲线被表示为图像,并使用与数据集Nurizada2025Dataset一起引入的相同变分自编码器(VAE)kingma2014autoencoding框架进行编码。具体来说,每个归一化的连杆曲线图像被映射到一个50维的潜在表示,该表示捕捉了期望轨迹的全局几何结构。该潜在向量作为生成模型的几何条件信号,并在训练和推理期间作为输入提供。通过将连杆曲线编码与机构生成解耦,这种表示实现了紧凑且不变的条件化,同时保持了与原始数据集公式的兼容性。

每个平面机构都使用一个统一、固定长度的关节和轨迹点坐标向量表示,

J=\[\(x1,y1\),\(x2,y2\),...,\(xNmax,yNmax\)\],\\mathbf\{J\}=\\big\[\(x\_\{1\},y\_\{1\}\),\(x\_\{2\},y\_\{2\}\),\\dots,\(x\_\{N\_\{\\max\}\},y\_\{N\_\{\\max\}\}\)\\big\],\(1\)其中NmaxN\_\{\\max\}表示数据集中所有机构族之间关节/轨迹点的最大数量。具有较少点(例如,四杆或六杆连杆)的机构使用一致的填充方案填充到长度Nmax=12N\_\{\\max\}=12,从而使单一模型能够处理各种大小。

相似文章

扩展自回归Transformer以用于单细胞生成

arXiv cs.LG

本文研究了一项自监督任务,即使用带有量化VAE分词器的自回归Transformer生成单细胞基因表达向量。文中报告了单细胞基础模型的缩放定律和计算最优前沿,并讨论了针对扰动预测进行微调的潜力。