ParaVT: 在智能体视频强化学习中驯服工具先验悖论以实现并行工具使用
摘要
ParaVT 提出了第一个用于并行视频工具调用的多智能体端到端强化学习框架,通过 PARA-GRPO 解决了工具先验悖论,并完全开源了论文、代码、权重和数据。
查看缓存全文
缓存时间: 2026/05/26 06:43
论文页面 - ParaVT:驯服工具先验悖论——面向智能体视频强化学习中的并行工具使用
来源:https://huggingface.co/papers/2605.20342
长视频理解正变得具有智能体能力:大型多模态模型(LMM)通过强化学习进行后训练,以原生方式调用视频工具(例如时间裁剪)。但现有的每一个原生RL方案(包括我们自己在CVPR 2026上发表的LongVT)都是顺序调度工具调用,每轮一次:糟糕的裁剪没有同伴纠正,多轮调用会导致上下文漂移,且推理成本随轮次线性增长。
ParaVT是首个面向并行视频工具调用的多智能体端到端RL训练框架。一个主智能体在单轮中发出多个时间窗口裁剪,共享权重的子智能体并发处理它们,然后通过汇集与推理步骤生成最终答案。然而,在具备工具原生能力的LMM上应用标准GRPO,会暴露出两种耦合的失败模式,它们都源于同一个预训练工具先验。我们将此称为工具先验悖论:
- 格式脆弱性——SFT学习的
</tool_call>闭合会在温度采样下崩溃。 - 工具必要性缺口——在64帧概览下,“跳过工具”成为捷径,GRPO中调用工具与跳过工具的收益差距趋近于零。
我们提出PARA-GRPO(可解析性锚定与比率门控GRPO),为每种失败模式配备一个针对性修复:(i)一个仅在最易崩溃的结构性Token位置施加的格式奖励,以及(ii)每个提示的概览帧随机化K ∼ Uniform{4, 8, 16, 32, 64},以保持工具调用的优势非退化。
完全开源:论文、代码、权重、数据
📄 arxiv.org/abs/2605.20342 · 💻 github.com/EvolvingLMMs-Lab/ParaVT · 🤖 https://huggingface.co/ParaVT · 🌐 evolvinglmms-lab.github.io/ParaVT
相似文章
超越下一个词元预测:面向Atlassian工作流程中工具使用智能体的RLVR概念验证
本文提出了一项概念验证,使用基于可验证奖励的强化学习(RLVR)来训练小型语言模型,使其能够在Jira和Confluence等企业SaaS工作流程中使用工具。该方法利用合成环境和GRPO训练来提高工具调用准确率,相较于基线取得了显著的奖励增益。
ToolVerse: 解锁大规模环境与长程任务,用于智能体强化学习
ToolVerse是一个框架,可从422个真实世界MCP环境(包含4438个工具)自动构建大规模可执行智能体训练环境,并提出了一种基于动态解锁采样算法的任务设计策略以生成长程任务,以及一种用于智能体强化学习中信用分配的轮次感知相对优势算法。
@TheTuringPost: 用于 Agent RL 栈的 10 个开源工具 ↓ OpenPipe ART verl-agent Agent Lightning Unsloth OpenRLHF SkyRL NVIDIA’s P…
精心整理的 10 个用于通过强化学习训练 AI Agent 的开源工具,涵盖 OpenPipe ART、verl-agent、Agent Lightning 和 Unsloth 等框架,并介绍了各工具的使用场景和优势。
通过工具监督强化学习实现视觉推理
提出 ToolsRL,一个两阶段强化学习框架,教多模态大模型使用简单视觉工具完成复杂视觉推理任务。
PARALLEL:一种受前额叶对齐强化启发的语言模型学习范式,在显式约束下进行自适应
本文介绍了PARALLEL,一种受前额叶对齐强化启发、用于语言模型学习的方法。该方法决定对每个样本进行适配的时机和强度,使用独立的控制器信号来提高适配效率,同时保持高性能。