Trace:基于分类指导的多领域视觉推理环境

Hugging Face Daily Papers 论文

摘要

TRACE是一个基于分类指导的环境,包含跨11个领域的1000个视觉推理任务。在64,000个TRACE实例上训练Qwen2.5-VL-3B和Qwen2.5-VL-7B,使其在24个外部基准上的宏平均性能分别提升了3.51和4.06个百分点。

带可验证奖励的强化学习(RLVR)显著提升了语言模型的推理能力,但其向视觉语言模型的扩展仍受限于缺乏同时具备广泛性、精确可验证性和可复现性的训练数据。我们提出了Trace——一个基于分类指导的多领域视觉推理环境。Trace将任务构建分解为场景语法和可执行任务程序,将视觉实现与答案计算相分离。共享语义状态决定了渲染图像、提示、类型化答案、验证器状态和可重放的实例轨迹。该环境包含跨277个场景语法和11个视觉领域的1000个任务,并实现了可控的语义与视觉变化。在64,000个Trace实例上进行RLVR训练后,Qwen2.5-VL-3B在24个外部基准上的宏平均性能提升3.51个百分点,Qwen2.5-VL-7B提升4.06个百分点,这为广泛的程序化训练能够迁移到生成任务分布之外提供了证据。项目页面:https://maveryn.github.io/trace/。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:08

论文页面 - Trace:基于分类学引导的多领域视觉推理环境

来源:https://huggingface.co/papers/2607.19790 我们提出 TRACE,一个基于分类学引导的环境,包含跨11个领域的1000个确定性视觉推理任务。

在64,000个TRACE实例上训练 Qwen2.5-VL-3B 和 Qwen2.5-VL-7B,使得它们在24个外部基准上的宏平均性能分别提升了3.51和4.06个百分点。

我们发布了完整的研究工具链,包括任务生成器、数据集、训练完成的检查点、训练与评估代码以及运行产物。

💻 代码:https://github.com/maveryn/trace 📄 论文:https://huggingface.co/papers/2607.19790 🌐 项目页面:https://maveryn.github.io/trace/ 🤗 Hugging Face 收藏集:https://huggingface.co/collections/maveryn/trace

欢迎贡献——请随时提交 Issue 或 Pull Request!

相似文章

WILDTRACE: 对长上下文推理中自然证据轨迹的基准测试

arXiv cs.CL

WildTrace 是一个包含 481 个任务的基准测试,利用来自技术报告和叙事等长文档中的自然出现的证据轨迹。它评估了 18 个前沿系统,并表明即使是最好的系统(75.3%)在反事实分支和因果归因等推理密集型几何结构中仍存在困难。

DocTrace:通过分层证据图推理实现可追踪的长文档VQA

arXiv cs.AI

本文介绍了DocTrace,一个用于长文档视觉问答的分层框架,将该任务建模为显式证据图推理。它在三个基准上取得了最先进的结果,同时实现了可追踪的证据来源,比Qwen3-VL-8B-Instruct高出11-14个百分点。