超越单纯的环境扩展:为多模态智能体学习设计有效的环境分布
摘要
本文认为简单地扩展多模态环境并不总能改善智能体训练,并提出了能力感知环境选择(AES)和分层难度课程(HDC),以在多样性和难度维度上更好地构建环境分布。
查看缓存全文
缓存时间: 2026/08/10 10:14
论文页面 - 超越简单的环境扩展:为多模态智能体学习设计有效的环境分布
来源:https://huggingface.co/papers/2608.03571
摘要
近期的工作通过构建大规模多模态环境池来训练智能体。然而,我们发现仅仅增加多模态环境的数量并不总是有益的。我们进一步通过一系列实验分析了当前多模态环境分布中存在的局限性。基于这些发现,我们从两个维度研究如何构建更有效的训练环境分布:多样性和难度结构。在多样性方面,我们提出了能力感知环境选择(Ability-aware Environment Selection, AES),以获得多样化的环境集合。在难度结构方面,我们提出了层级难度课程(Hierarchical Difficulty Curriculum, HDC),通过两个难度级别组织课程学习:约束减弱和状态规模递进。实验表明,AES 和 HDC 能有效改善多模态智能体的训练。
查看 arXiv 页面 (https://arxiv.org/abs/2608.03571) 查看 PDF (https://arxiv.org/pdf/2608.03571) GitHub3 (https://github.com/GaryStack/Beyond-MMEnv-Scaling) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.03571)
让您的智能体获取这篇论文:
hf papers read 2608\.03571
还没有最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2608.03571,即可从本页面链接到该模型。
引用此论文的数据集 0
没有数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2608.03571,即可从本页面链接到该数据集。
引用此论文的 Space 0
没有 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2608.03571,即可从本页面链接到该 Space。
收录此论文的收藏集 0
没有收藏集收录此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection),即可从本页面链接到该收藏集。
相似文章
EnvScaler:通过程序综合为LLM智能体扩展工具交互环境
EnvScaler是一个自动化框架,通过程序综合为LLM智能体扩展工具交互环境,创建了191个多样化环境和7K个场景,以提升智能体在多轮、多工具交互任务上的性能。
@cwolferesearch: 智能体强化学习中最困难的方面之一是管理/扩展环境... [1/6]
一条讨论智能体强化学习中最困难的方面之一的推文串:管理和扩展环境。
EnvFactory:通过可执行环境合成与鲁棒强化学习扩展工具使用智能体
EnvFactory 自动化创建可执行工具环境和自然的多轮轨迹,用于训练具有智能体强化学习能力的大语言模型,在使用比先前工作更少的环境下,在 BFCLv3 和 MCP-Atlas 等基准测试上取得了优异性能。
Agent-World:面向演进式通用智能体的现实世界环境合成扩展
# 论文页面 - Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence 来源:[https://huggingface.co/papers/2604.18292](https://huggingface.co/papers/2604.18292) 发布于 4 月 20 日 · 提交者[https://huggingface.co/dongguanting](https://huggingface.co/dongguanting) [](https://huggingface.co/dongguanting) [KABI](https://huggingface.co/donggua
面向进化环境中具身智能体的多尺度世界模型混合
本文介绍了MuSix,一个面向具身智能体的框架,通过尺度感知的世界模型混合与进化机制,处理进化环境中的多尺度推理与动态适应,在EmbodiedBench和HAZARD上相比基线方法取得了改进。