Qwen-Planner-Agent:一个用于真实世界移动规划智能体的AI-for-AI闭环框架
摘要
本文介绍了Qwen-Planner-Agent,一个用于移动规划智能体可扩展开发的AI-for-AI闭环框架,整合了数据生成、训练和部署,以提升在真实世界任务和基准测试中的性能。
查看缓存全文
缓存时间: 2026/09/25 03:46
论文页面 - Qwen-Planner-Agent:面向现实世界移动规划智能体的闭环“AI-for-AI“框架
来源:https://huggingface.co/papers/2609.29892 作者: , , , , , , , , , , , , , , , , , ,
摘要
大型语言模型的快速发展正将人工智能从被动内容生成扩展到工程与科学发现的主动工作流中。这一转变提出了一个引人入胜的问题:AI能否既是开发的对象,又是构建下一代AI系统的积极参与者?我们通过在一个可扩展开发和迭代改进的闭环“AI-for-AI“框架内构建Qwen-Planner-Agent来探索这个问题。移动规划为这一方法提供了一个严苛的测试场景:复杂、长周期的任务挑战智能体的可靠性,而昂贵的实体设备交互限制了开发的可扩展性。该框架通过一个共享的“动作-反馈-验证“契约连接数据生产、模型训练与部署。 (i) AI用于数据:构建了一个带有“人在回路“的智能体数据飞轮,其中专用智能体负责构建任务、收集交互轨迹、策划与平衡训练数据,并利用训练反馈来指导后续数据生成。 (ii) AI用于训练:结合了监督规划冷启动与混合环境的在线智能体强化学习,我们引入了“能力感知奖励与优势工程“(CARE),在保持任务性能的同时降低推理与工具使用成本。 (iii) AI驱动的模型-测试工具协同进化:通过一个执行证据驱动的循环,在运行时协调内存、技能与工具,并将结构化的动作反馈及保存的失败记录反馈,用于协调模型与测试工具的适应性调整。 Qwen-Planner-Agent在MobilePA-Bench上所有评估模型与系统中取得了最佳的整体性能,在工具使用、记忆、技能与子智能体协调方面相较于其基座模型均有提升。对我们模型的进一步评估显示,其在非移动智能体基准测试中也取得了性能提升,同时基本保留了通用能力。
查看 arXiv 页面 (https://arxiv.org/abs/2609.29892)查看 PDF (https://arxiv.org/pdf/2609.29892)项目页面 (https://tongyi-mai.github.io/Qwen-Planner-Agent/)添加至合集 (https://huggingface.co/login?next=%2Fpapers%2F2609.29892)
在你的智能体中获取此论文:
hf papers read 2609\.29892
没有最新的 CLI?运行:curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
暂无模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2609.29892 以从本页面链接。
引用此论文的数据集0
暂无数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2609.29892 以从本页面链接。
引用此论文的 Spaces 0
暂无 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2609.29892 以从本页面链接。
包含此论文的合集0
暂无合集包含此论文
将此论文添加至合集 (https://huggingface.co/new-collection)以从本页面链接。
相似文章
Qwen Intelligence 发布三款移动AI智能体(1分钟阅读)
Qwen Intelligence 推出三款最先进的移动AI智能体:用于任务分解的Mobile Planner Agent、具有高端到端成功率的Mobile-Use Agent,以及用于快速内容生成的Mobile Creative Agent,同时开放一个用于评估的基准测试套件。
Qwen-Image-Agent:弥合真实图像生成中的上下文差距
Qwen-Image-Agent 提出了一种统一的代理框架,通过整合规划、推理、搜索和记忆机制,解决了文本到图像生成中的上下文差距问题。该框架引入了 IA-Bench 进行评估,并取得了最先进的性能。
Qwen3.7-Max:智能体前沿
Qwen3.7-Max 是一个专注于智能体能力的新 AI 模型发布,推动了自主 AI 智能体的边界。
Qwen-UI-Agent 技术报告:迈向新一代以真实世界为中心的基座 GUI 智能体
Qwen-UI-Agent 是阿里巴巴 Qwen 团队推出的新基座 GUI 智能体,可处理移动、电脑、网页和 DeepSearch 任务,在移动端使用基准测试上达到最先进性能,在电脑/浏览器任务上取得有竞争力的结果,并在统一动作空间内结合 GUI 与 CLI 动作。
Qwen-RobotNav 技术报告:为自主导航系统设计的可扩展导航模型
Qwen-RobotNav 是一种可扩展的导航模型,通过参数化接口实现动态任务模式和观测参数,在多任务训练和零样本泛化到真实机器人领域达到了最先进水平。