Skill-3D:面向智能体3D空间推理的进化式场景感知技能
摘要
Skill-3D是一个框架,通过自我进化的记忆与技能库使AI智能体学习场景感知技能,在3D空间推理任务中显著提升工具使用能力(例如,在VSI-Bench上从39%提升至78%)。
查看缓存全文
缓存时间: 2026/06/10 00:13
论文页面 - Skill-3D:面向智能体3D空间推理的自演化场景感知技能
来源: https://huggingface.co/papers/2606.07436
摘要
Skill-3D框架使智能体能够通过自演化的记忆与技能库学习场景感知技能,从而提升3D空间推理任务中的工具使用能力。
本文探索了智能体3D空间理解(https://huggingface.co/papers?q=agentic%203D%20spatial%20understanding),即多模态大语言模型智能体(https://huggingface.co/papers?q=MLLM%20agents)通过工具使用(https://huggingface.co/papers?q=tool%20use)进行3D推理。现有方法在3D场景下常常误用工具并表现出有偏好的工具倾向,使得智能体范式相对于非智能体策略仅获得微弱的提升。我们发现3D空间推理(https://huggingface.co/papers?q=3D%20spatial%20reasoning)任务在不同场景间具有异质性,而这些智能体对所有场景采用统一的工具使用策略,而非根据具体场景和任务来选择工具。为解决这一问题,我们提出了Skill-3D框架,该框架通过学习自演化(https://huggingface.co/papers?q=self-evolving)的场景感知技能(https://huggingface.co/papers?q=scene-aware%20skills)。具体而言,Skill-3D识别任务场景,将智能体的工具使用轨迹记录到场景记忆(https://huggingface.co/papers?q=Scene%20Memory)中;来自相似场景的成功轨迹被聚合和提炼成可复用的场景感知技能,而失败的轨迹则作为经验教训附加到技能上。在训练过程中,当类似场景再次出现时,注入相应的技能来指导智能体,产生新的轨迹;这些轨迹的成功与失败进一步优化技能,形成记忆与技能库(https://huggingface.co/papers?q=skill%20library)共同演化的闭环。实验表明,Skill-3D显著提升了3D空间推理(https://huggingface.co/papers?q=3D%20spatial%20reasoning)中的工具利用率(在VSI-Bench上从39%提升至78%),推动智能体实现正确且充分的工具使用(https://huggingface.co/papers?q=tool%20use)。例如,在MMSI-Bench上,它使Gemini-3-Flash提升了67%。此外,我们在技能引导的轨迹上进行智能体后训练(https://huggingface.co/papers?q=agentic%20post-training),使Qwen3-VL-8B在VSI-Bench上提升了43%。
查看arXiv页面(https://arxiv.org/abs/2606.07436)查看PDF(https://arxiv.org/pdf/2606.07436)项目页面(https://skill-3d.github.io/)GitHub(https://github.com/skill-3d/Skill-3D)添加至收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.07436)
在您的智能体中获取此论文:
hf papers read 2606\.07436
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型链接此论文
在模型的README.md中引用arxiv.org/abs/2606.07436即可从此页面链接。
引用此论文的数据集0
无数据集链接此论文
在数据集的README.md中引用arxiv.org/abs/2606.07436即可从此页面链接。
引用此论文的Space0
无Space链接此论文
在Space的README.md中引用arxiv.org/abs/2606.07436即可从此页面链接。
包含此论文的收藏集0
无收藏集包含此论文
将此论文添加至收藏集(https://huggingface.co/new-collection)即可从此页面链接。
相似文章
SkillDAG:大规模LLM技能选择中的自进化类型化技能图
介绍了SkillDAG,一种用于大规模LLM技能选择的自进化类型化有向图,它建模了技能间关系,并允许智能体在执行过程中查询和演化该图,在ALFWorld和SkillsBench上优于基线。
SkillFlow:自主智能体终身技能发现与演化基准测试
SkillFlow 推出了一个涵盖20个任务家族共166项任务的基准测试,用于评估自主智能体在终身学习协议下,随时间推移发现、修复并维护技能的能力。实验揭示了主流模型之间存在显著的能力差距:Claude Opus 4.6 通过技能演化获得了显著提升,而其他模型的收益有限甚至为负。
SkillOpt:自我进化智能体技能的执行策略
SkillOpt 引入了一种系统化的文本空间优化器,用于智能体技能。该优化器将技能训练为智能体的外部状态,具有稳定的更新和零部署推理开销,在多个基准测试和执行环境中实现了卓越性能。
工具增强空间推理中的自进化神经符号技能
提出了NeSy-Spatial,一种神经符号框架,通过组合工具使用技能和几何技能来自我进化空间推理技能,提高了空间推理基准的准确性。
SkillSight: 透过共享描述实现准确技能检索
SkillSight 是一个无需训练的检索框架,它校准技能描述中的共享背景,以提高 LLM 代理的技能检索准确性,相比于密集检索器,Recall@10 最多提升 20.21 个百分点。