TAPe+ML:一种用于多任务计算机视觉的紧凑结构化表示
摘要
本文介绍了TAPe+MLv3,一种紧凑的计算机视觉系统,它使用结构化表示进行多任务学习,在COCO等基准测试上取得了具有竞争力的性能,且参数少于100,000。
查看缓存全文
缓存时间: 2026/09/22 15:27
论文页面 - TAPe+ML:用于多任务计算机视觉的紧凑结构化表示
来源:https://huggingface.co/papers/2609.20869
摘要
我们提出TAPe+MLv3,一个基于TAPe(主动感知理论)的紧凑计算机视觉系统。TAPe是一种在识别前编码感知元素间关系的结构化表示。该系统不直接处理像素张量,而是使用共享的TAPe表示和模块化识别架构,用于图像分类、目标检测和实例分割。TAPe+MLv3结合了背景与轮廓处理、局部目标定位、基于原型的分类,以及用于协调专门子模型的协调器。在报告的实验中,该系统使用的参数少于10万。在COCO目标检测任务上,它取得了84.7 mAP50和65.3 mAP50-95的成绩。在COCO实例分割任务上,它取得了80.7 mask mAP50和58.4 mask mAP50-95的成绩。在分类实验中,在与原始像素基线相同的训练条件下,它在Imagenette上达到了92%的验证准确率,并在ImageNet-Real上达到了89.9%的Top-1准确率。我们还在视频场景检测和工业试点中分布偏移下的适应性方面评估了其紧凑性。结果表明,将部分建模负担从网络参数转移到结构化输入表示上,可以支持数据、内存和计算需求更低的紧凑型多任务视觉系统。
查看arXiv页面 (https://arxiv.org/abs/2609.20869) 查看PDF (https://arxiv.org/pdf/2609.20869) 项目页面 (https://ml.comexp.net/) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.20869)
引用本文的模型 0
无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2609.20869 以从此页面链接到该模型。
引用本文的数据集 0
无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2609.20869 以从此页面链接到该数据集。
引用本文的Spaces 0
无Space链接此论文
在Space README.md 中引用 arxiv.org/abs/2609.20869 以从此页面链接到该Space。
包含本文的集合 0
无集合包含此论文
将本文添加到集合中 (https://huggingface.co/new-collection) 以从此页面链接到该集合。
相似文章
MoTE: 多任务视频理解中的任务专家混合
MoTE 在多任务视频理解中引入了任务特定的专家路由,以替代密集的解码器前馈网络,通过可解释的稀疏计算提高了准确性和效率。
VideoChat3: 完全开源的高效且通用的视频理解MLLM
VideoChat3是一个完全开源、高效且通用的以视频为中心的多模态大语言模型,引入了膨胀3D视觉Transformer (I3D-ViT)和自适应帧分辨率用于流式视频感知,以及可扩展的视频数据合成管道,仅用4B参数就实现了卓越性能。
MoE-ViE:高效图像与视频理解的混合专家视觉编码器
本文介绍了MoE-ViE,一种混合专家视觉编码器,能够高效扩展以支持图像和视频理解,并以更低的推理延迟超越更大的密集模型。
Attention-based representations for multi-task computation
This paper establishes theoretical bounds on the number of attention heads needed to produce vector representations that support multiple tasks, such as computing min/max and XOR, showing trade-offs between head count, embedding dimension, and precision.
SimpleMemVLA:一种简单但有效的视觉-语言-动作模型原生视频记忆
SimpleMemVLA为视觉-语言-动作模型引入了一种简单的记忆机制,通过将完整的时间戳视频历史馈送到预训练的VLM骨干网络中,在长期操作任务中实现了最先进的结果,无需专用记忆模块。