RIBOSPAN: 用于多样化RNA建模的长上下文RNA基础模型
摘要
RIBOSPAN是一个在多达10,240个核苷酸上预训练的大型双向RNA基础模型,通过离散扩散实现高分辨率全长转录本建模和mRNA生成。
查看缓存全文
缓存时间: 2026/08/25 08:34
论文页面 - RIBOSPAN:用于多样化RNA建模的长上下文RNA基础模型
来源:https://huggingface.co/papers/2608.22849
摘要
RIBOSPAN是一个大型双向RNA基础模型,在最多10,240个核苷酸上进行预训练,支持高分辨率全长转录组建模、强大的长上下文表示能力,以及基于离散扩散的mRNA生成与重设计。
全长RNA,特别是信使RNA,其长度通常超过现有RNA基础模型(https://huggingface.co/papers?q=RNA%20foundation%20model)的预训练上下文长度,这限制了在单核苷酸分辨率下进行完整转录组建模的能力。我们提出RIBOSPAN,一个拥有16.1亿参数的双向RNA基础模型(https://huggingface.co/papers?q=RNA%20foundation%20model),原生预训练的上下文长度可达10,240个核苷酸。RIBOSPAN结合了密集的双向自注意力机制(https://huggingface.co/papers?q=bidirectional%20self-attention)、单核苷酸分词(https://huggingface.co/papers?q=single-nucleotide%20tokenization)以及注意力隔离的序列打包(https://huggingface.co/papers?q=sequence%20packing),实现了对完整长链RNA的高分辨率建模。我们通过核苷酸重建任务、一个受控的长上下文表示(https://huggingface.co/papers?q=long-context%20representation)基准测试,以及冻结的RNA类型表示分析来评估该模型。原生的10K预训练在10,240个token上仍能保持强大的重建能力,而采用40%掩码比例的持续预训练则能在严重破坏条件下提高恢复率,同时保持表示质量。长上下文基准测试进一步表明,原生10K模型在保持强上下文响应性和特定上下文表示分离能力的同时,还能使扰动引起的表示变化高度局部化。推理时的YaRN缩放(https://huggingface.co/papers?q=YaRN%20scaling)恢复了短上下文模型直接外推所丢失的大量上下文组织信息,但会导致更显著的远距离表示扩散。冻结表示的评估进一步证明了SOTA级的RNA表示质量,RIBOSPAN在多种RNA类型上取得了最强的综合性能,并在长链RNA上保持明显优势。基于同一主干,我们开发了一个多条件控制的离散扩散(https://huggingface.co/papers?q=discrete-diffusion)框架,用于全长mRNA的生成与重设计,包括用于蛋白质保持的CDS优化的同义密码子扩散(https://huggingface.co/papers?q=synonymous-codon%20diffusion)。综上,RIBOSPAN为可迁移的RNA表示学习和全长mRNA设计奠定了一个强大的长上下文基础。
查看arXiv页面 (https://arxiv.org/abs/2608.22849)查看PDF (https://arxiv.org/pdf/2608.22849)GitHub (https://github.com/GAIR-NLP/RIBOSPAN-FM)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.22849)
在您的代理中获取此论文:
hf papers read 2608.22849
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型4个
SII-GAIR-NLP/RIBOSPAN-10K-15 填空遮蔽• 约4小时前更新 • 3 (https://huggingface.co/SII-GAIR-NLP/RIBOSPAN-10K-15)
SII-GAIR-NLP/RIBOSPAN-FM 填空遮蔽• 约5小时前更新 • 2 (https://huggingface.co/SII-GAIR-NLP/RIBOSPAN-FM)
SII-GAIR-NLP/RIBOSPAN-1K-15 填空遮蔽• 约5小时前更新 (https://huggingface.co/SII-GAIR-NLP/RIBOSPAN-1K-15)
SII-GAIR-NLP/RIBOSPAN-1K-40 填空遮蔽• 约5小时前更新 (https://huggingface.co/SII-GAIR-NLP/RIBOSPAN-1K-40)
引用本文的数据集1个
SII-GAIR-NLP/RIBOSPAN-FM-Corpus 查看器• 约3小时前更新 • 180k • 1 (https://huggingface.co/datasets/SII-GAIR-NLP/RIBOSPAN-FM-Corpus)
引用本文的Space 0个
没有关联此论文的Space
在Space的README.md中引用arxiv.org/abs/2608.22849以将其从此页面链接。
包含本文的收藏夹2个
相似文章
以165美元在25个物种间训练mRNA语言模型
本文介绍了CodonRoBERTa的开发过程,这是一种在25个物种间进行训练的mRNA密码子优化语言模型,重点展示了一个包含蛋白质折叠和序列设计的经济高效流程。
@EmmaScharfmann: 一个能够读取和生成DNA序列的新基础模型刚刚在Hugging Face上发布:https://huggingfac…
一个新的1.1B参数DNA基础模型MarinDNA v0.5 scaling ladder在Hugging Face上发布;它可以读取和生成DNA序列,据称在变异效应预测方面可与Evo 2 40B相媲美。
LDARNet:用于基因组建模的具有可学习分词的DNA自适应表示网络
LDARNet 是一个拥有1.2亿参数的层次化基因组基础模型,引入了可学习的自适应分词机制(灵感来源于 H-Net 的动态分块),用于DNA序列的掩码语言建模。该模型在5项组蛋白修饰任务上取得了最先进的结果,并在多项基因组基准测试中超越了参数量多达其20倍的模型。其学习到的分词边界与启动子motif和剪接位点等生物学特征高度吻合。
RPAM:一种评估语言模型关联的原则性度量方法,在下游输出中具有高预测有效性
介绍RPAM,一种评估语言模型关联的原则性度量方法,该方法在下游输出中展现出高预测有效性,并在Mistral-7B-Instruct、Mistral-7B和GPT-2上进行了测试。
ProtSent:蛋白质句子转换器
本文介绍了 ProtSent,这是一个用于蛋白质语言模型的对比微调框架,能够提升嵌入质量,从而优化远程同源性检测和结构检索等下游任务。