标签
SMILESGNN引入了一种多模态架构,该架构结合了SMILES转换器和图神经网络,并采用交叉注意力机制,用于可解释的药物毒性预测。它在ClinTox和Tox21等基准测试上以最少的参数取得了有竞争力的性能。
ROOSTER是一个共享模块,它学习条件序列与目标序列之间的对齐,适用于时间序列预测和PPG到生命体征重建,在多个基准测试中表现出色。
本文介绍了RecCAR,一种正则化方法,用于解决联合多模态扩散变换器中的互惠对应差距,从而提高视频生成任务的性能。
EnSol是一种环境感知图神经网络,它通过将溶质和溶剂表示为图,并使用交叉注意力来建模相互作用,同时利用概率输出来捕捉温度效应和实验不确定性,从而预测分子溶解度。该模型在基准数据集上取得了最先进的性能,并经过实验验证。
比较AI模型中自注意力和交叉注意力机制的交互式图解,作为注意力教育库的一部分发布。
QueryFormer 是一种统一的 Transformer 架构,它赢得了 KDD Cup 2026 腾讯 UniRec 挑战赛,专注于点击后转化率预测,重点在查询生成和高效扩展。
本文提出时频几何交叉注意力(TFGCA),这是一种即插即用模块,用于分块视觉-语言-动作模型,通过将分块分解为时频表示并捕捉几何关系来改进动作轨迹预测,从而在基准测试和真实机器人任务中实现显著性能提升。
RelightFormer 引入了一种前馈生成Transformer,用于直接单视图和多视图图像重光照,使用交叉注意力进行光照注入和排列不变编码以处理无序视图,通过在大量合成数据集上训练实现最先进的视觉质量。
本文通过跨注意力机制中的‘注意力三角形’研究音频-视频扩散模型中的语义泄漏,并提出了在生成过程中增强语义锚定的方法。
This paper introduces addressable and cardinality-preserving global memory for message-passing neural networks via cross-attention slots, addressing the finite-capacity bottleneck of virtual nodes and improving performance on multiplicity-aware tasks.
本文提出了一种用于反应产率预测的双模态视觉交叉注意力架构,将表格化物理有机数据与二维分子拓扑结构相融合,并展示了通用计算机视觉骨干网络能够超越纯基于量子计算的基线模型。
介绍SyRuP,一种解码时框架,它训练一个交叉注意力奖励头来为系统提示生成令牌级别的遵从分数,无需模型调优即可提高大语言模型对复杂提示的遵从性。
TokenMem通过专用的交叉注意力通道向冻结的大语言模型注入知识,训练一个轻量的门控适配器(两阶段课程),以提升在反事实知识下的知识合规性,在反事实基准上实现了69-70%的知识合规率(KC),而传统RAG仅为20-52%。
MOSS-VL-Realtime 是一个实时流式视觉语言模型,能够处理连续视频帧,支持可中断交互、主动静默和动态修正,具备时间戳感知编码和256K上下文窗口。
RaysUp 是一个超轻量、任务无关的特征上采样框架,利用几何感知射线域技术从低分辨率VFM输出重建高分辨率特征,以比先前工作减少84%的参数和7倍更快的推理速度实现了最先进的性能。
KaLM-Reranker-V1 是一种快速重排序模型,通过采用编码器-解码器架构,结合 Matryoshka 嵌入池化和交叉注意力机制,将查询与段落计算解耦,在 BEIR 上实现了最先进的重排序性能,并在多语言基准测试中取得了具有竞争力的结果。
本文提出ST-Merge,一种可操控的模型合并框架,利用门控交叉注意力机制自适应地调节多语言模型和推理模型的贡献,在涵盖21种语言的多语言推理基准测试中优于固定合并方法。
本文介绍了多适配器PPO(Multi-Adapter PPO),一种结合交叉注意力机制的强化学习框架,用于LIBS定量分析中的波长选择,在钢铁和煤数据集上相比传统方法实现了28.4%的综合评分提升和45.2%的预测精度改进。
本文将对基于最优传输的幻觉检测扩展到NMT和抽象式摘要中的所有解码器层,发现检测主要集中在早期层,并且由于忠实性失败无法通过注意力集中检测到,几何信号在摘要任务中迁移效果不佳。
本文提出SCALE,一种面向智能体LLM工作流DAG的深度强化学习调度器,通过交叉注意力与结构化表示正则化,泛化至未见过的集群规模,无需重新训练即可降低响应时间。