RIBOSPAN: 用于多样化RNA建模的长上下文RNA基础模型

Hugging Face Daily Papers 论文

摘要

RIBOSPAN是一个在多达10,240个核苷酸上预训练的大型双向RNA基础模型,通过离散扩散实现高分辨率全长转录本建模和mRNA生成。

全长RNA,尤其是信使RNA,往往超出用于预训练现有RNA基础模型的上下文长度,限制了在单核苷酸分辨率下的完整转录本建模。我们提出了RIBOSPAN,这是一个拥有16.1亿参数的双向RNA基础模型,原生预训练上下文长度可达10,240 nt。RIBOSPAN结合了密集双向自注意力、单核苷酸标记化和注意力隔离的序列打包,以实现对完整长RNA的高分辨率建模。我们通过核苷酸重建、一个受控的长上下文表示基准以及冻结的RNA类型表示分析来评估该模型。原生10K预训练在10,240个标记上保持了强大的重建能力,而使用40%掩码的继续预训练在严重破坏下提高了恢复能力,同时保持了表示质量。长上下文基准进一步表明,原生10K模型保持了强大的上下文响应性和特定上下文的表示分离,同时使扰动引起的表示变化高度局部化。推理时的YaRN缩放恢复了短上下文模型直接外推丢失的大量上下文组织,但引发了显著更大的远端表示扩散。冻结表示评估进一步展示了最先进的RNA表示质量,RIBOSPAN在不同类型的RNA中实现了最强的整体性能,并在长RNA上保持了明显优势。基于相同的主干,我们开发了一个多维条件离散扩散框架,用于全长mRNA的生成和重设计,包括用于保持蛋白质的CDS优化的同义密码子扩散。总之,RIBOSPAN为可转移的RNA表示学习和全长mRNA设计建立了一个强大的长上下文基础。
查看原文
查看缓存全文

缓存时间: 2026/08/25 08:34

论文页面 - RIBOSPAN:用于多样化RNA建模的长上下文RNA基础模型

来源:https://huggingface.co/papers/2608.22849

摘要

RIBOSPAN是一个大型双向RNA基础模型,在最多10,240个核苷酸上进行预训练,支持高分辨率全长转录组建模、强大的长上下文表示能力,以及基于离散扩散的mRNA生成与重设计。

全长RNA,特别是信使RNA,其长度通常超过现有RNA基础模型(https://huggingface.co/papers?q=RNA%20foundation%20model)的预训练上下文长度,这限制了在单核苷酸分辨率下进行完整转录组建模的能力。我们提出RIBOSPAN,一个拥有16.1亿参数的双向RNA基础模型(https://huggingface.co/papers?q=RNA%20foundation%20model),原生预训练的上下文长度可达10,240个核苷酸。RIBOSPAN结合了密集的双向自注意力机制(https://huggingface.co/papers?q=bidirectional%20self-attention)、单核苷酸分词(https://huggingface.co/papers?q=single-nucleotide%20tokenization)以及注意力隔离的序列打包(https://huggingface.co/papers?q=sequence%20packing),实现了对完整长链RNA的高分辨率建模。我们通过核苷酸重建任务、一个受控的长上下文表示(https://huggingface.co/papers?q=long-context%20representation)基准测试,以及冻结的RNA类型表示分析来评估该模型。原生的10K预训练在10,240个token上仍能保持强大的重建能力,而采用40%掩码比例的持续预训练则能在严重破坏条件下提高恢复率,同时保持表示质量。长上下文基准测试进一步表明,原生10K模型在保持强上下文响应性和特定上下文表示分离能力的同时,还能使扰动引起的表示变化高度局部化。推理时的YaRN缩放(https://huggingface.co/papers?q=YaRN%20scaling)恢复了短上下文模型直接外推所丢失的大量上下文组织信息,但会导致更显著的远距离表示扩散。冻结表示的评估进一步证明了SOTA级的RNA表示质量,RIBOSPAN在多种RNA类型上取得了最强的综合性能,并在长链RNA上保持明显优势。基于同一主干,我们开发了一个多条件控制的离散扩散(https://huggingface.co/papers?q=discrete-diffusion)框架,用于全长mRNA的生成与重设计,包括用于蛋白质保持的CDS优化的同义密码子扩散(https://huggingface.co/papers?q=synonymous-codon%20diffusion)。综上,RIBOSPAN为可迁移的RNA表示学习和全长mRNA设计奠定了一个强大的长上下文基础。

查看arXiv页面 (https://arxiv.org/abs/2608.22849)查看PDF (https://arxiv.org/pdf/2608.22849)GitHub (https://github.com/GAIR-NLP/RIBOSPAN-FM)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.22849)

在您的代理中获取此论文:

hf papers read 2608.22849

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型4个

SII-GAIR-NLP/RIBOSPAN-10K-15 填空遮蔽• 约4小时前更新 • 3 (https://huggingface.co/SII-GAIR-NLP/RIBOSPAN-10K-15)

SII-GAIR-NLP/RIBOSPAN-FM 填空遮蔽• 约5小时前更新 • 2 (https://huggingface.co/SII-GAIR-NLP/RIBOSPAN-FM)

SII-GAIR-NLP/RIBOSPAN-1K-15 填空遮蔽• 约5小时前更新 (https://huggingface.co/SII-GAIR-NLP/RIBOSPAN-1K-15)

SII-GAIR-NLP/RIBOSPAN-1K-40 填空遮蔽• 约5小时前更新 (https://huggingface.co/SII-GAIR-NLP/RIBOSPAN-1K-40)

引用本文的数据集1个

SII-GAIR-NLP/RIBOSPAN-FM-Corpus 查看器• 约3小时前更新 • 180k • 1 (https://huggingface.co/datasets/SII-GAIR-NLP/RIBOSPAN-FM-Corpus)

引用本文的Space 0个

没有关联此论文的Space

在Space的README.md中引用arxiv.org/abs/2608.22849以将其从此页面链接。

包含本文的收藏夹2个

相似文章

以165美元在25个物种间训练mRNA语言模型

Hugging Face Blog

本文介绍了CodonRoBERTa的开发过程,这是一种在25个物种间进行训练的mRNA密码子优化语言模型,重点展示了一个包含蛋白质折叠和序列设计的经济高效流程。

LDARNet:用于基因组建模的具有可学习分词的DNA自适应表示网络

arXiv cs.CL

LDARNet 是一个拥有1.2亿参数的层次化基因组基础模型,引入了可学习的自适应分词机制(灵感来源于 H-Net 的动态分块),用于DNA序列的掩码语言建模。该模型在5项组蛋白修饰任务上取得了最先进的结果,并在多项基因组基准测试中超越了参数量多达其20倍的模型。其学习到的分词边界与启动子motif和剪接位点等生物学特征高度吻合。

ProtSent:蛋白质句子转换器

arXiv cs.LG

本文介绍了 ProtSent,这是一个用于蛋白质语言模型的对比微调框架,能够提升嵌入质量,从而优化远程同源性检测和结构检索等下游任务。