vision-transformer

标签

Cards List
#vision-transformer

基于多导睡眠图脑电图信号的睡眠呼吸暂停分类深度学习方法

arXiv cs.LG · 2026-07-20 缓存

本文对多种深度学习架构进行了全面比较,包括视觉Transformer和图注意力网络,用于从多通道脑电图信号中自动检测睡眠呼吸暂停,使用在拓扑数据分析特征上训练的视觉Transformer获得了0.750的最佳测试AUC。

0 人收藏 0 人点赞
#vision-transformer

qZACH-ViT: 基于递归归因稳定优化的量化感知内在解释

arXiv cs.LG · 2026-07-20 缓存

介绍了qZACH-ViT,这是ZACH-ViT的量化感知扩展,具有递归内在解释,以及用于稳定归因梯度的递归归因稳定优化(RASO)。在INT8转换后的MedMNIST数据集上实现了高预测一致性和加速。

0 人收藏 0 人点赞
#vision-transformer

@Underfox3: 本文提出了一种面向N:M稀疏视觉Transformer推理的软硬件协同设计框架,能够实现...

X AI KOLs Timeline · 2026-07-15 缓存

本文提出了一种面向N:M稀疏视觉Transformer推理的软硬件协同设计框架,通过一种新颖的CUDA内核(MD-SpMM)和部署感知的稀疏性搜索,在保持准确性的同时,在GPU上实现了超过2.2倍的延迟加速。

0 人收藏 0 人点赞
#vision-transformer

更少的令牌,更好的预测:用于高效天气预测的稀疏残差路由

arXiv cs.LG · 2026-07-07 缓存

介绍了 Sparse-Reslim,一种即插即用的路由模块,仅通过昂贵的 Transformer 块处理 25% 的空间令牌,以实现高效的天气预测,最高可实现 3.18 倍的加速并提高预报准确性。

0 人收藏 0 人点赞
#vision-transformer

基于Token的双视角融合与大视觉模型在乳腺癌分类中的适配

Hugging Face Daily Papers · 2026-07-07 缓存

本文提出了一种以Token为中心的双视角学习框架,在冻结的视觉Transformer中统一了基于提示的适配和跨视角融合,以改善基于乳腺X线图像的乳腺癌分类,在VinDr-Mammo和CMMD数据集上取得了一致的性能提升。

0 人收藏 0 人点赞
#vision-transformer

LingBot-Vision: 基于掩码边界建模的自监督预训练 (在1.1B参数下NYUv2线性探测RMSE为0.296,对比DINOv3-7B的0.309,在ImageNet上稍逊一筹);提供四种尺寸的权重[R]

Reddit r/MachineLearning · 2026-07-06

LingBot-Vision引入了掩码边界建模用于自监督预训练,在1.1B参数下NYUv2线性探测上达到0.296 RMSE,而DINOv3-7B为0.309,虽然在ImageNet上表现稍逊;已发布四种尺寸的权重。

0 人收藏 0 人点赞
#vision-transformer

Patch-PODiff-ViT: 基于分块POD的结构化潜在扩散模型,用于超分辨率和不确定性量化

arXiv cs.LG · 2026-07-01 缓存

Patch-PODiff-ViT 引入了一种结构化潜在扩散框架,利用分块本征正交分解 (POD) 实现超分辨率和不确定性量化,通过固定的线性正交基和预测方差的解析传播实现高效扩散。

0 人收藏 0 人点赞
#vision-transformer

MuSViT:面向乐谱表示的基础视觉模型

Hugging Face Daily Papers · 2026-06-30 缓存

MuSViT是首个面向乐谱的基础视觉模型,通过掩码自编码器在数百万页乐谱上预训练,在乐谱识别和符号检测任务中取得卓越性能。

0 人收藏 0 人点赞
#vision-transformer

我用自对弈强化学习制作了一个超人类水平的 Generals.io 智能体 [P]

Reddit r/MachineLearning · 2026-06-24

使用基于 JAX 的流水线和 Vision Transformer,通过自对弈强化学习训练了一个超人类水平的 Generals.io 智能体。在人类 1v1 排行榜上排名第一;所有代码和一个快速的 JAX 模拟器均已开源。

0 人收藏 0 人点赞
#vision-transformer

HYDRA-X: 原生统一多模态模型与整体视觉分词器

Hugging Face Daily Papers · 2026-06-11 缓存

HYDRA-X 提出了一种统一的多模态模型,将图像和视频分词集成到单个视觉变换器中,在理解和生成任务上均取得了强劲性能。

0 人收藏 0 人点赞
#vision-transformer

利用测试时训练线性化视觉Transformer

Hugging Face Daily Papers · 2026-05-28 缓存

本文提出了一种方法,将预训练的Softmax注意力模型转换为线性复杂度的测试时训练(TTT)架构,在显著加速推理的同时,实现了与微调Softmax模型相当的文生图质量。该方法通过对Stable Diffusion 3.5进行线性化得到SD3.5-T^5,在1K分辨率下实现1.32倍加速。

0 人收藏 0 人点赞
#vision-transformer

视觉变换器模型的Rust实现

Reddit r/ArtificialInteligence · 2026-05-24

一个用于构建和实验视觉变换器(ViT)模型的Rust crate,提供类型化配置、可重用结构体以及可运行的示例,适用于研究和生产环境。

0 人收藏 0 人点赞
#vision-transformer

用于守恒律的稳健基础模型:通过循环视觉转换器将上下文注入通量神经算子

arXiv cs.LG · 2026-05-08 缓存

本文提出了一种新架构,将 Flux 神经算子与循环视觉转换器相结合,作为求解守恒律的基础模型。该模型在无需显式获取控制方程的情况下,在多种保守系统中展示了稳健的泛化能力和长期预测能力。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈