PackLab:一个用于开发、训练和评估机器人装箱中多模态大语言模型的综合框架

Hugging Face Daily Papers 论文

摘要

PackLab 引入了一个用于机器人装箱的综合框架,该框架利用多模态大语言模型,包括一个仿真平台、一个专用模型和一个基准测试,其性能优于传统方法。

机器人装箱需要长期的顺序决策,因为每个物体的放置都会影响后续包装的可用空间。现有方法主要依赖于手工设计的几何启发式方法,这些方法优化预定义的目标,或通过试错在预定义训练配置上学习的强化学习策略。尽管多模态大语言模型(MLLMs)在该任务上取得了近期进展,但它们在跨异构装箱配置的闭环顺序决策方面的潜力仍未得到充分探索。为了解决这一差距,我们介绍了PackLab,一个用于开发、训练和评估闭环机器人装箱中多模态大语言模型的综合框架。PackLab-Suite 提供了一个基于物理的仿真平台,用于可扩展地生成多样化的训练装箱轨迹并评估其物理结果。PackLab-VLM 是一个装箱专用的多模态大语言模型,它理解不断变化的物体和容器状态,以闭环方式联合选择物体并预测放置位置。PackLab-Bench 提供了多个难度级别的标准化装箱场景,用于系统性评估。大量实验表明,平均而言,PackLab-VLM 在不同物体集和容器配置上优于传统的装箱启发式方法、传统的强化学习方法和通用多模态大语言模型,突显了多模态大语言模型在长期机器人装箱中的潜力。代码、模型、数据集和基准测试可在 https://github.com/Correr-Zhou/PackLab 获取。
查看原文
查看缓存全文

缓存时间: 2026/09/24 07:38

论文页面 - PackLab:用于开发、训练和评估机器人装箱任务中多模态大语言模型的综合框架

来源:https://huggingface.co/papers/2609.23784

摘要

机器人装箱任务需要长期序列决策,因为每个物体的放置都会影响后续装箱的可用空间。现有方法主要依赖手工设计的几何启发式算法来优化预定义目标,或通过在预定义训练配置中反复试验学习的强化学习策略。尽管近期多模态大语言模型在该任务上有所进展,但其在异构装箱配置下进行闭环序列决策的潜力仍未被充分探索。为解决这一问题,我们引入了PackLab——一个用于开发、训练和评估闭环机器人装箱任务中多模态大语言模型的综合框架。PackLab-Suite提供了一个基于物理的仿真平台,可扩展生成多样化的训练装箱轨迹并评估其物理结果。PackLab-VLM是一个装箱专用的多模态大语言模型,它能理解不断变化的物体和容器状态,并以闭环方式联合选择物体并预测放置位置。PackLab-Bench提供了多个难度等级的标准化装箱场景,用于系统性评估。大量实验表明,平均而言,PackLab-VLM在各种物体集和容器配置中,性能均优于传统装箱启发式算法、传统强化学习方法和通用多模态大语言模型,这凸显了多模态大语言模型在长期机器人装箱任务中的潜力。代码、模型、数据集和基准测试可在 https://github.com/Correr-Zhou/PackLab 获取。

查看 arXiv 页面 (https://arxiv.org/abs/2609.23784) 查看 PDF (https://arxiv.org/pdf/2609.23784) GitHub (https://github.com/Correr-Zhou/PackLab) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.23784)

通过代理获取此论文:

hf papers read 2609.23784

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

无模型关联此论文 在模型的 README.md 中引用 arxiv.org/abs/2609.23784,可从此页面链接。

引用此论文的数据集 0

无数据集关联此论文 在数据集的 README.md 中引用 arxiv.org/abs/2609.23784,可从此页面链接。

引用此论文的 Space 0

无 Space 关联此论文 在 Space 的 README.md 中引用 arxiv.org/abs/2609.23784,可从此页面链接。

包含此论文的收藏 0

无收藏包含此论文 将此论文添加到收藏 (https://huggingface.co/new-collection) 可从此页面链接。

相似文章

超越API:探究MLLMs在物理工具使用中的极限

arXiv cs.CL

本文介绍了PhysTool-Bench,一个用于评估多模态大语言模型在真实世界场景中识别和规划物理工具使用能力的基准。作者发现,即使是最佳模型也只能识别58.7%的工具,并仅完成21.0%的端到端查询,揭示了感知和功能常识两个层面的缺陷。

MLUBench: 多模态大语言模型终身遗忘评估基准

arXiv cs.AI

MLUBench 是一个大规模的多模态大语言模型终身遗忘基准,包含9个类别的127个实体。论文指出现有遗忘方法存在累积退化问题,并提出 LUMoE 来缓解此问题,显示出显著改进。

BalCapRL:一种用于基于强化学习的 MLLM 图像描述生成的平衡框架

Hugging Face Daily Papers

本文介绍了 BalCapRL,这是一种针对多模态大语言模型(MLLM)的平衡强化学习框架,旨在联合优化图像描述生成中的准确性、覆盖率和语言质量。通过奖励解耦和长度条件屏蔽来解决实用性与流畅性之间的权衡,该方法在性能上优于现有方法。