Trace:基于分类指导的多领域视觉推理环境
摘要
TRACE是一个基于分类指导的环境,包含跨11个领域的1000个视觉推理任务。在64,000个TRACE实例上训练Qwen2.5-VL-3B和Qwen2.5-VL-7B,使其在24个外部基准上的宏平均性能分别提升了3.51和4.06个百分点。
查看缓存全文
缓存时间: 2026/07/24 05:08
论文页面 - Trace:基于分类学引导的多领域视觉推理环境
来源:https://huggingface.co/papers/2607.19790 我们提出 TRACE,一个基于分类学引导的环境,包含跨11个领域的1000个确定性视觉推理任务。
在64,000个TRACE实例上训练 Qwen2.5-VL-3B 和 Qwen2.5-VL-7B,使得它们在24个外部基准上的宏平均性能分别提升了3.51和4.06个百分点。
我们发布了完整的研究工具链,包括任务生成器、数据集、训练完成的检查点、训练与评估代码以及运行产物。
💻 代码:https://github.com/maveryn/trace 📄 论文:https://huggingface.co/papers/2607.19790 🌐 项目页面:https://maveryn.github.io/trace/ 🤗 Hugging Face 收藏集:https://huggingface.co/collections/maveryn/trace
欢迎贡献——请随时提交 Issue 或 Pull Request!
相似文章
WILDTRACE: 对长上下文推理中自然证据轨迹的基准测试
WildTrace 是一个包含 481 个任务的基准测试,利用来自技术报告和叙事等长文档中的自然出现的证据轨迹。它评估了 18 个前沿系统,并表明即使是最好的系统(75.3%)在反事实分支和因果归因等推理密集型几何结构中仍存在困难。
DocTrace:通过分层证据图推理实现可追踪的长文档VQA
本文介绍了DocTrace,一个用于长文档视觉问答的分层框架,将该任务建模为显式证据图推理。它在三个基准上取得了最先进的结果,同时实现了可追踪的证据来源,比Qwen3-VL-8B-Instruct高出11-14个百分点。
TRON:面向视觉推理强化学习的目标化规则可验证在线环境
TRON 提出了一种可扩展的在线环境,用于视觉推理强化学习,可生成无限多样且答案可验证的训练实例,在多个多模态基准上展现出持续的性能提升。
@Azaliamirh: 看看TRACE,这是一种新的自我改进方法,代理识别自身失败背后缺少的能力并自我训练以解决这些问题……
TRACE是一种新的自我改进方法,AI代理识别自身失败背后缺少的能力,并自我训练以解决这些问题。经过TRACE训练的Qwen3.6-27B在SWE-bench Verified上达到73.2%,以更少的训练次数超越了更大的模型。
VBVR-Pro: 一个用于原生视觉推理的可扩展且可验证的套件
VBVR-Pro 引入了一个闭环测试平台,用于通过生成实现可扩展且可验证的原生视觉推理,其特点包括任务扩展、可验证奖励以及跨多样视觉基底的机制研究。