Skill-3D:面向智能体3D空间推理的进化式场景感知技能

Hugging Face Daily Papers 论文

摘要

Skill-3D是一个框架,通过自我进化的记忆与技能库使AI智能体学习场景感知技能,在3D空间推理任务中显著提升工具使用能力(例如,在VSI-Bench上从39%提升至78%)。

本文探索了智能体3D空间理解,即多模态大语言模型智能体通过工具使用进行3D推理。现有方法往往误用工具,并在3D场景下表现出有偏好的工具使用倾向,导致智能体范式相对于非智能体策略仅有微小提升。我们发现3D空间推理任务因场景而异,而这些智能体对所有场景采用统一的工具使用策略,而非根据具体场景和任务选择工具。为解决此问题,我们提出Skill-3D,一个学习自我进化场景感知技能的框架。具体而言,Skill-3D识别任务场景,并将智能体的工具使用轨迹记录到场景记忆中,其中来自相似场景的成功轨迹被聚合、提炼为可重用的场景感知技能,失败轨迹则作为经验教训附加到该技能。训练时,一旦再次出现相似场景,对应技能即被注入以指导智能体,产生新的轨迹,而这些轨迹的成功与失败又会进一步改进该技能,形成记忆与技能库共同进化的循环。实验表明,Skill-3D显著提升了3D空间推理中的工具使用能力(在VSI-Bench上从39%提升至78%),驱动智能体迈向正确且充分的工具使用。例如,在MMSI-Bench上使Gemini-3-Flash提升67%。此外,我们对技能引导的轨迹进行智能体后训练,使Qwen3-VL-8B在VSI-Bench上提升43%。
查看原文
查看缓存全文

缓存时间: 2026/06/10 00:13

论文页面 - Skill-3D:面向智能体3D空间推理的自演化场景感知技能

来源: https://huggingface.co/papers/2606.07436

摘要

Skill-3D框架使智能体能够通过自演化的记忆与技能库学习场景感知技能,从而提升3D空间推理任务中的工具使用能力。

本文探索了智能体3D空间理解(https://huggingface.co/papers?q=agentic%203D%20spatial%20understanding),即多模态大语言模型智能体(https://huggingface.co/papers?q=MLLM%20agents)通过工具使用(https://huggingface.co/papers?q=tool%20use)进行3D推理。现有方法在3D场景下常常误用工具并表现出有偏好的工具倾向,使得智能体范式相对于非智能体策略仅获得微弱的提升。我们发现3D空间推理(https://huggingface.co/papers?q=3D%20spatial%20reasoning)任务在不同场景间具有异质性,而这些智能体对所有场景采用统一的工具使用策略,而非根据具体场景和任务来选择工具。为解决这一问题,我们提出了Skill-3D框架,该框架通过学习自演化(https://huggingface.co/papers?q=self-evolving)的场景感知技能(https://huggingface.co/papers?q=scene-aware%20skills)。具体而言,Skill-3D识别任务场景,将智能体的工具使用轨迹记录到场景记忆(https://huggingface.co/papers?q=Scene%20Memory)中;来自相似场景的成功轨迹被聚合和提炼成可复用的场景感知技能,而失败的轨迹则作为经验教训附加到技能上。在训练过程中,当类似场景再次出现时,注入相应的技能来指导智能体,产生新的轨迹;这些轨迹的成功与失败进一步优化技能,形成记忆与技能库(https://huggingface.co/papers?q=skill%20library)共同演化的闭环。实验表明,Skill-3D显著提升了3D空间推理(https://huggingface.co/papers?q=3D%20spatial%20reasoning)中的工具利用率(在VSI-Bench上从39%提升至78%),推动智能体实现正确且充分的工具使用(https://huggingface.co/papers?q=tool%20use)。例如,在MMSI-Bench上,它使Gemini-3-Flash提升了67%。此外,我们在技能引导的轨迹上进行智能体后训练(https://huggingface.co/papers?q=agentic%20post-training),使Qwen3-VL-8B在VSI-Bench上提升了43%。

查看arXiv页面(https://arxiv.org/abs/2606.07436)查看PDF(https://arxiv.org/pdf/2606.07436)项目页面(https://skill-3d.github.io/)GitHub(https://github.com/skill-3d/Skill-3D)添加至收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.07436)

在您的智能体中获取此论文:

hf papers read 2606\.07436

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型链接此论文

在模型的README.md中引用arxiv.org/abs/2606.07436即可从此页面链接。

引用此论文的数据集0

无数据集链接此论文

在数据集的README.md中引用arxiv.org/abs/2606.07436即可从此页面链接。

引用此论文的Space0

无Space链接此论文

在Space的README.md中引用arxiv.org/abs/2606.07436即可从此页面链接。

包含此论文的收藏集0

无收藏集包含此论文

将此论文添加至收藏集(https://huggingface.co/new-collection)即可从此页面链接。

相似文章

SkillFlow:自主智能体终身技能发现与演化基准测试

Hugging Face Daily Papers

SkillFlow 推出了一个涵盖20个任务家族共166项任务的基准测试,用于评估自主智能体在终身学习协议下,随时间推移发现、修复并维护技能的能力。实验揭示了主流模型之间存在显著的能力差距:Claude Opus 4.6 通过技能演化获得了显著提升,而其他模型的收益有限甚至为负。

SkillOpt:自我进化智能体技能的执行策略

Hugging Face Daily Papers

SkillOpt 引入了一种系统化的文本空间优化器,用于智能体技能。该优化器将技能训练为智能体的外部状态,具有稳定的更新和零部署推理开销,在多个基准测试和执行环境中实现了卓越性能。

SkillSight: 透过共享描述实现准确技能检索

arXiv cs.AI

SkillSight 是一个无需训练的检索框架,它校准技能描述中的共享背景,以提高 LLM 代理的技能检索准确性,相比于密集检索器,Recall@10 最多提升 20.21 个百分点。