PackLab:一个用于开发、训练和评估机器人装箱中多模态大语言模型的综合框架
摘要
PackLab 引入了一个用于机器人装箱的综合框架,该框架利用多模态大语言模型,包括一个仿真平台、一个专用模型和一个基准测试,其性能优于传统方法。
查看缓存全文
缓存时间: 2026/09/24 07:38
论文页面 - PackLab:用于开发、训练和评估机器人装箱任务中多模态大语言模型的综合框架
来源:https://huggingface.co/papers/2609.23784
摘要
机器人装箱任务需要长期序列决策,因为每个物体的放置都会影响后续装箱的可用空间。现有方法主要依赖手工设计的几何启发式算法来优化预定义目标,或通过在预定义训练配置中反复试验学习的强化学习策略。尽管近期多模态大语言模型在该任务上有所进展,但其在异构装箱配置下进行闭环序列决策的潜力仍未被充分探索。为解决这一问题,我们引入了PackLab——一个用于开发、训练和评估闭环机器人装箱任务中多模态大语言模型的综合框架。PackLab-Suite提供了一个基于物理的仿真平台,可扩展生成多样化的训练装箱轨迹并评估其物理结果。PackLab-VLM是一个装箱专用的多模态大语言模型,它能理解不断变化的物体和容器状态,并以闭环方式联合选择物体并预测放置位置。PackLab-Bench提供了多个难度等级的标准化装箱场景,用于系统性评估。大量实验表明,平均而言,PackLab-VLM在各种物体集和容器配置中,性能均优于传统装箱启发式算法、传统强化学习方法和通用多模态大语言模型,这凸显了多模态大语言模型在长期机器人装箱任务中的潜力。代码、模型、数据集和基准测试可在 https://github.com/Correr-Zhou/PackLab 获取。
查看 arXiv 页面 (https://arxiv.org/abs/2609.23784) 查看 PDF (https://arxiv.org/pdf/2609.23784) GitHub (https://github.com/Correr-Zhou/PackLab) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.23784)
通过代理获取此论文:
hf papers read 2609.23784
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
无模型关联此论文 在模型的 README.md 中引用 arxiv.org/abs/2609.23784,可从此页面链接。
引用此论文的数据集 0
无数据集关联此论文 在数据集的 README.md 中引用 arxiv.org/abs/2609.23784,可从此页面链接。
引用此论文的 Space 0
无 Space 关联此论文 在 Space 的 README.md 中引用 arxiv.org/abs/2609.23784,可从此页面链接。
包含此论文的收藏 0
无收藏包含此论文 将此论文添加到收藏 (https://huggingface.co/new-collection) 可从此页面链接。
相似文章
超越API:探究MLLMs在物理工具使用中的极限
本文介绍了PhysTool-Bench,一个用于评估多模态大语言模型在真实世界场景中识别和规划物理工具使用能力的基准。作者发现,即使是最佳模型也只能识别58.7%的工具,并仅完成21.0%的端到端查询,揭示了感知和功能常识两个层面的缺陷。
MLUBench: 多模态大语言模型终身遗忘评估基准
MLUBench 是一个大规模的多模态大语言模型终身遗忘基准,包含9个类别的127个实体。论文指出现有遗忘方法存在累积退化问题,并提出 LUMoE 来缓解此问题,显示出显著改进。
P3D-Bench:参数化3D生成与结构推理的多模态大语言模型基准测试
本文提出P3D-Bench,一个用于评估多模态大语言模型在参数化3D生成任务上的基准测试,涵盖文本到3D、图像到3D和组装到3D,并采用几何精度、语义对齐和部件级结构等指标。
OmniPack:面向高效全模态大语言模型的统一令牌压缩
OmniPack提出了一种无需训练的全模态大语言模型令牌压缩框架,将LLM前结构化压缩与LLM内任务相关语义精炼相结合,在多个基准上实现了优异的性能-效率权衡。
BalCapRL:一种用于基于强化学习的 MLLM 图像描述生成的平衡框架
本文介绍了 BalCapRL,这是一种针对多模态大语言模型(MLLM)的平衡强化学习框架,旨在联合优化图像描述生成中的准确性、覆盖率和语言质量。通过奖励解耦和长度条件屏蔽来解决实用性与流畅性之间的权衡,该方法在性能上优于现有方法。