cross-attention

标签

Cards List
#cross-attention

用于分块视觉-语言-动作模型的时频几何交叉注意力

arXiv cs.AI · 昨天 缓存

本文提出时频几何交叉注意力(TFGCA),这是一种即插即用模块,用于分块视觉-语言-动作模型,通过将分块分解为时频表示并捕捉几何关系来改进动作轨迹预测,从而在基准测试和真实机器人任务中实现显著性能提升。

0 人收藏 0 人点赞
#cross-attention

RelightFormer: 用于多视图物体重光照的前馈生成Transformer

Hugging Face Daily Papers · 6天前 缓存

RelightFormer 引入了一种前馈生成Transformer,用于直接单视图和多视图图像重光照,使用交叉注意力进行光照注入和排列不变编码以处理无序视图,通过在大量合成数据集上训练实现最先进的视觉质量。

0 人收藏 0 人点赞
#cross-attention

音频-视频模型中的注意力三角形

arXiv cs.AI · 2026-09-04 缓存

本文通过跨注意力机制中的‘注意力三角形’研究音频-视频扩散模型中的语义泄漏,并提出了在生成过程中增强语义锚定的方法。

0 人收藏 0 人点赞
#cross-attention

Designing a Good Virtual Node: Addressable and Cardinality-Preserving Global Memory for Message Passing Architectures

arXiv cs.LG · 2026-08-05 缓存

This paper introduces addressable and cardinality-preserving global memory for message-passing neural networks via cross-attention slots, addressing the finite-capacity bottleneck of virtual nodes and improving performance on multiplicity-aware tasks.

0 人收藏 0 人点赞
#cross-attention

通用视觉与交叉注意力用于反应产率预测

arXiv cs.LG · 2026-08-04 缓存

本文提出了一种用于反应产率预测的双模态视觉交叉注意力架构,将表格化物理有机数据与二维分子拓扑结构相融合,并展示了通用计算机视觉骨干网络能够超越纯基于量子计算的基线模型。

0 人收藏 0 人点赞
#cross-attention

SyRuP:在大语言模型解码中通过奖励引导预测增强系统提示遵从

arXiv cs.CL · 2026-07-28 缓存

介绍SyRuP,一种解码时框架,它训练一个交叉注意力奖励头来为系统提示生成令牌级别的遵从分数,无需模型调优即可提高大语言模型对复杂提示的遵从性。

0 人收藏 0 人点赞
#cross-attention

TokenMem: 面向冻结大语言模型的忠实知识注入

arXiv cs.AI · 2026-07-28 缓存

TokenMem通过专用的交叉注意力通道向冻结的大语言模型注入知识,训练一个轻量的门控适配器(两阶段课程),以提升在反事实知识下的知识合规性,在反事实基准上实现了69-70%的知识合规率(KC),而传统RAG仅为20-52%。

0 人收藏 0 人点赞
#cross-attention

OpenMOSS-Team/MOSS-VL-Realtime

Hugging Face Models Trending · 2026-07-14 缓存

MOSS-VL-Realtime 是一个实时流式视觉语言模型,能够处理连续视频帧,支持可中断交互、主动静默和动态修正,具备时间戳感知编码和256K上下文窗口。

0 人收藏 0 人点赞
#cross-attention

RaysUp:通过几何感知射线表示的超轻量通用特征上采样

Hugging Face Daily Papers · 2026-06-22 缓存

RaysUp 是一个超轻量、任务无关的特征上采样框架,利用几何感知射线域技术从低分辨率VFM输出重建高分辨率特征,以比先前工作减少84%的参数和7倍更快的推理速度实现了最先进的性能。

0 人收藏 0 人点赞
#cross-attention

KaLM-Reranker-V1:快速而非延迟交互的压缩文档重排序

Hugging Face Daily Papers · 2026-06-22 缓存

KaLM-Reranker-V1 是一种快速重排序模型,通过采用编码器-解码器架构,结合 Matryoshka 嵌入池化和交叉注意力机制,将查询与段落计算解耦,在 BEIR 上实现了最先进的重排序性能,并在多语言基准测试中取得了具有竞争力的结果。

0 人收藏 0 人点赞
#cross-attention

通过可操控模型合并增强多语言推理

arXiv cs.CL · 2026-06-18 缓存

本文提出ST-Merge,一种可操控的模型合并框架,利用门控交叉注意力机制自适应地调节多语言模型和推理模型的贡献,在涵盖21种语言的多语言推理基准测试中优于固定合并方法。

0 人收藏 0 人点赞
#cross-attention

多适配器PPO:一种基于交叉注意力增强的波长选择框架用于LIBS定量分析

arXiv cs.LG · 2026-06-17 缓存

本文介绍了多适配器PPO(Multi-Adapter PPO),一种结合交叉注意力机制的强化学习框架,用于LIBS定量分析中的波长选择,在钢铁和煤数据集上相比传统方法实现了28.4%的综合评分提升和45.2%的预测精度改进。

0 人收藏 0 人点赞
#cross-attention

面向NMT与抽象式摘要中幻觉检测的逐层最优传输

arXiv cs.CL · 2026-06-12 缓存

本文将对基于最优传输的幻觉检测扩展到NMT和抽象式摘要中的所有解码器层,发现检测主要集中在早期层,并且由于忠实性失败无法通过注意力集中检测到,几何信号在摘要任务中迁移效果不佳。

0 人收藏 0 人点赞
#cross-attention

SCALE:面向智能体工作流调度的可扩展交叉注意力学习与外推方法

arXiv cs.LG · 2026-06-08 缓存

本文提出SCALE,一种面向智能体LLM工作流DAG的深度强化学习调度器,通过交叉注意力与结构化表示正则化,泛化至未见过的集群规模,无需重新训练即可降低响应时间。

0 人收藏 0 人点赞
#cross-attention

基于查询的跨模态投影器增强 Mamba 多模态大语言模型

arXiv cs.CL · 2026-06-04 缓存

本文提出了一种基于查询的跨模态投影器,通过交叉注意力机制对视觉标记进行压缩,以提升基于 Mamba 的多模态大语言模型的性能。该方法在视觉语言基准测试中同时提高了模型性能和吞吐量,并消除了手动设计二维扫描顺序的需求。

0 人收藏 0 人点赞
#cross-attention

ERP-XTTN:面向跨被试ERP分类的可解释原型引导交叉注意力

arXiv cs.LG · 2026-06-03 缓存

介绍了ERP-XTTN,一种无需校准即可跨被试进行可解释ERP分类的交叉注意力架构。在多个数据集上评估,它取得了与黑盒模型相媲美的性能,同时提供了透明的路由洞察。

0 人收藏 0 人点赞
#cross-attention

ReactiveGWM:在反应式游戏世界模型中引导NPC

Hugging Face Daily Papers · 2026-05-14 缓存

ReactiveGWM是一种反应式游戏世界模型,通过扩散模型和交叉注意力模块将玩家控制与NPC行为解耦,实现动态的玩家-NPC互动,并能在不同游戏间实现零样本策略迁移。

0 人收藏 0 人点赞
#cross-attention

@AdinaYakup: @Open_MOSS 发布 MOSS-VL 视觉模型:https://huggingface.co/collections/OpenMOSS-Team/moss-vl… 演示:https://hug…

X AI KOLs Following · 2026-04-20

Open_MOSS 开源 110 亿参数 Apache 2.0 视觉-语言模型 MOSS-VL,采用交叉注意力与 XRoPE,在 VSI-bench 上比 Qwen3-VL-8B 高 8.3 分。

0 人收藏 0 人点赞
#cross-attention

Motif-Video 2B:技术报告

Hugging Face Daily Papers · 2026-04-14 缓存

# 论文页面 - Motif-Video 2B:技术报告 来源:[https://huggingface.co/papers/2604.16503](https://huggingface.co/papers/2604.16503) 作者:、、、、、、、、、、、、、、、、、、、、、 ## 摘要 Motif-Video 2B 采用共享交叉注意力与三段式主干的专用架构,以及高效训练方法,在显著降低参数量和训练数据用量的同时,实现了高质量文本到视频生成。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈