TAPe+ML:一种用于多任务计算机视觉的紧凑结构化表示

Hugging Face Daily Papers 论文

摘要

本文介绍了TAPe+MLv3,一种紧凑的计算机视觉系统,它使用结构化表示进行多任务学习,在COCO等基准测试上取得了具有竞争力的性能,且参数少于100,000。

我们介绍了TAPe+ML v3,这是一个基于TAPe(主动感知理论)的紧凑计算机视觉系统,TAPe是一种结构化表示,在识别前编码感知元素之间的关系。系统不直接操作像素张量,而是使用共享的TAPe表示和模块化识别架构,用于图像分类、目标检测和实例分割。 TAPe+ML v3结合了背景和轮廓处理、局部对象定位、基于原型的分类,以及用于专门子模型的协调器。在所有报告的实验中,它使用的参数少于100,000。在COCO目标检测上,它获得了84.7 mAP50和65.3 mAP50-95。在COCO实例分割上,它获得了80.7 mask mAP50和58.4 mask mAP50-95。在分类实验中,在与原始像素基线的相同训练设置下,它在Imagenette上达到了92%的验证准确率,并在ImageNet-Real上达到了89.9%的Top-1准确率。我们还在工业试点中评估了视频场景检测和分布偏移下的适应性的紧凑性。结果表明,将部分建模负担从网络参数转移到结构化输入表示,可以支持紧凑的多任务视觉系统,减少数据、内存和计算需求。
查看原文
查看缓存全文

缓存时间: 2026/09/22 15:27

论文页面 - TAPe+ML:用于多任务计算机视觉的紧凑结构化表示

来源:https://huggingface.co/papers/2609.20869

摘要

我们提出TAPe+MLv3,一个基于TAPe(主动感知理论)的紧凑计算机视觉系统。TAPe是一种在识别前编码感知元素间关系的结构化表示。该系统不直接处理像素张量,而是使用共享的TAPe表示和模块化识别架构,用于图像分类、目标检测和实例分割。TAPe+MLv3结合了背景与轮廓处理、局部目标定位、基于原型的分类,以及用于协调专门子模型的协调器。在报告的实验中,该系统使用的参数少于10万。在COCO目标检测任务上,它取得了84.7 mAP50和65.3 mAP50-95的成绩。在COCO实例分割任务上,它取得了80.7 mask mAP50和58.4 mask mAP50-95的成绩。在分类实验中,在与原始像素基线相同的训练条件下,它在Imagenette上达到了92%的验证准确率,并在ImageNet-Real上达到了89.9%的Top-1准确率。我们还在视频场景检测和工业试点中分布偏移下的适应性方面评估了其紧凑性。结果表明,将部分建模负担从网络参数转移到结构化输入表示上,可以支持数据、内存和计算需求更低的紧凑型多任务视觉系统。

查看arXiv页面 (https://arxiv.org/abs/2609.20869) 查看PDF (https://arxiv.org/pdf/2609.20869) 项目页面 (https://ml.comexp.net/) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.20869)

引用本文的模型 0

无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2609.20869 以从此页面链接到该模型。

引用本文的数据集 0

无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2609.20869 以从此页面链接到该数据集。

引用本文的Spaces 0

无Space链接此论文

在Space README.md 中引用 arxiv.org/abs/2609.20869 以从此页面链接到该Space。

包含本文的集合 0

无集合包含此论文

将本文添加到集合中 (https://huggingface.co/new-collection) 以从此页面链接到该集合。

相似文章

VideoChat3: 完全开源的高效且通用的视频理解MLLM

Papers with Code Trending

VideoChat3是一个完全开源、高效且通用的以视频为中心的多模态大语言模型,引入了膨胀3D视觉Transformer (I3D-ViT)和自适应帧分辨率用于流式视频感知,以及可扩展的视频数据合成管道,仅用4B参数就实现了卓越性能。

Attention-based representations for multi-task computation

arXiv cs.LG

This paper establishes theoretical bounds on the number of attention heads needed to produce vector representations that support multiple tasks, such as computing min/max and XOR, showing trade-offs between head count, embedding dimension, and precision.