让RGB成为视觉的语言
摘要
本文介绍了RINO(RGB In and RGB Out),一个统一框架,将各种视觉信息(如掩码、深度图等)表示为RGB图像,并将视觉任务转换为RGB到RGB的图像编辑,从而让单一模型能够在任务间进行零样本迁移。
查看缓存全文
缓存时间: 2026/07/15 16:22
论文页面 - 让RGB成为视觉的语言
来源:https://huggingface.co/papers/2607.12450
作者:
,
,
,
,
,
,
,
,
,
,
,
,
摘要
本文提出了一种统一的视觉模型范式,其中除自然图像外的多种视觉信息形式——如掩码、深度图及其他结构化视觉信号——均被表示为RGB图像,同时通用视觉任务可转化为通用的RGB到RGB图像编辑问题。在此范式下,不同类型的视觉信息内部与自然图像共享相同的编码解码架构与参数,从而使得单一模型能够通过统一的视觉界面跨任务迁移,其方式类似于语言模型处理文本。我们将这一范式称为RGB输入与RGB输出(RINO)。基于通用图像编辑主干网络,无需针对特定任务进行微调,RINO在密集理解任务(如分割和深度估计,我们将输出统一为RGB)以及密集条件生成任务(如姿态到图像的生成,我们将输入统一为RGB)上展现出鲁棒且具有竞争力的零样本性能。我们希望这项研究能为通用统一视觉-语言系统提供有益启示——在该系统中,多样化的视觉任务能够通过共享的视觉语言被表达、解释并求解。代码见 https://github.com/yangtiming/RINO。
查看arXiv页面 (https://arxiv.org/abs/2607.12450)查看PDF (https://arxiv.org/pdf/2607.12450)GitHub7 (https://github.com/yangtiming/RINO)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.12450)
在你的智能体中获取此论文:
hf papers read 2607\.12450
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型 0
暂无模型链接此论文
请在模型的README.md中引用 arxiv.org/abs/2607.12450 以从此页面链接。
引用本文的数据集 0
暂无数据集链接此论文
请在数据集的README.md中引用 arxiv.org/abs/2607.12450 以从此页面链接。
引用本文的Space 0
暂无Space链接此论文
请在Space的README.md中引用 arxiv.org/abs/2607.12450 以从此页面链接。
包含本文的收藏集 0
无收藏集包含此论文
将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
迈向暗光环境下鲁棒且三维感知的RGB-NIR成像
本文提出了一种用于RGB-NIR低光成像的三维感知神经方法,该方法在三维空间中将极度含噪的RGB观测与NIR线索融合,无需干净RGB监督,并提高了跨不同噪声水平的鲁棒性。
检索、整合与综合:空间-语义接地潜层视觉推理
本文介绍了 RIS,这是一个用于多模态大语言模型的空间-语义接地潜层视觉推理框架,旨在克服信息瓶颈。该框架提出将潜在令牌(tokens)锚定于空间和语义证据之上,在 V* 和 HRBench 等基准测试中展现出性能提升。
EasyVideoR1:让视频理解的强化学习更简单
# 论文页面 - EasyVideoR1:让视频理解的强化学习更简单 来源:[https://huggingface.co/papers/2604.16893](https://huggingface.co/papers/2604.16893) ## 摘要 EasyVideoR1 提出了一个高效的视频理解强化学习框架,可提升训练吞吐量,支持多种视频任务,并实现图像-视频联合训练,在多个基准测试上进行全面评估。[可验证奖励强化学习](https://huggingface.co/papers
Robostral Navigate
Robostral Navigate 是一个仅使用单目 RGB 图像进行机器人导航的 80 亿参数视觉语言模型,在 R2R-CE 和 RxR-CE 基准测试中分别以 77.4% 和 75.1% 的成功率达到了最先进水平。
RxBrain:具有联合语言-视觉推理与想象力的具身认知基础模型
RxBrain是一个具身认知基础模型,它通过语言和视觉想象联合推理来表征具身规划,采用统一的多模态混合Transformer架构。无需大规模动作数据即可在真实机器人上取得良好表现。