@EmmaScharfmann: 一个能够读取和生成DNA序列的新基础模型刚刚在Hugging Face上发布:https://huggingfac…

X AI KOLs Following 模型

摘要

一个新的1.1B参数DNA基础模型MarinDNA v0.5 scaling ladder在Hugging Face上发布;它可以读取和生成DNA序列,据称在变异效应预测方面可与Evo 2 40B相媲美。

一个能够读取和生成DNA序列的新基础模型刚刚在Hugging Face上发布:https://huggingface.co/marin-dna/marin-dna-scaling-v0.5-h1920-p1B… 欢迎在下面的演示空间中测试该模型的能力。
查看原文
查看缓存全文

缓存时间: 2026/08/09 19:27

一个能够读取和生成DNA序列的新基础模型刚刚在Hugging Face上发布:https://huggingface.co/marin-dna/marin-dna-scaling-v0.5-h1920-p1B … 欢迎在下面的演示空间中测试模型的能力


marin-dna/marin-dna-scaling-v0.5-h1920-p1B · Hugging Face

来源:https://huggingface.co/marin-dna/marin-dna-scaling-v0.5-h1920-p1B

https://huggingface.co/marin-dna/marin-dna-scaling-v0.5-h1920-p1B#marindna-v05-scaling-ladder–1bMarinDNA v0.5 缩放阶梯 — 1B

这是一个拥有1,120,772,224个参数的核苷酸级因果语言模型,是使用Marin(https://github.com/marin-community/marin)开发的八个模型MarinDNA v0.5参数缩放阶梯(scaling ladder)的成员之一。本仓库仅包含运行dna-bolinas-scaling-v0.5-h1920-p1B-0dc6f4(https://wandb.ai/eric-czech/marin/runs/dna-bolinas-scaling-v0.5-h1920-p1B-0dc6f4)的最终step-215573检查点,并附带了其分词器。相关博客文章:一个1B标准Transformer在变异效应预测上媲美Evo 2 40B(https://openathena.ai/blog/marin-dna/)。

https://huggingface.co/marin-dna/marin-dna-scaling-v0.5-h1920-p1B#model-details模型详情

字段值
架构Qwen3兼容的仅解码器Transformer
参数量1,120,772,224
层数19
隐藏层 / 中间层大小1,920 / 7,680
注意力头 / KV头15 / 15
上下文256个token:一个BOS token后跟最多255个DNA碱基
检查点最终检查点,step 215573(经过215,574个零索引训练步骤后)
Token暴露量约84.77B个核苷酸token
存储权重dtypefloat32
许可证Apache-2.0

规范源检查点为gs://marin-us-east5/checkpoints/dna-bolinas-scaling-v0.5-h1920-p1B-0dc6f4/hf/step-215573;字节完全一致的evals_v2传输缓存位于s3://oa-bolinas/snakemake/analysis/evals_v2/results/checkpoints/scaling-v0.5-h1920-p1B-step-215573。提交固定的训练脚本(https://github.com/marin-community/marin/blob/69c4793e1608775ec66b37d6f3f373598c246ba3/experiments/dna/exp109_bolinas_scaling_sweep.py#L1186-L1349)定义了生产环境缩放阶梯。

https://huggingface.co/marin-dna/marin-dna-scaling-v0.5-h1920-p1B#loading加载

`` from transformers import AutoModelForCausalLM, AutoTokenizer

repo_id = “marin-dna/marin-dna-scaling-v0.5-h1920-p1B” tokenizer = AutoTokenizer.from_pretrained(repo_id) model = AutoModelForCausalLM.from_pretrained(repo_id) ``

https://huggingface.co/marin-dna/marin-dna-scaling-v0.5-h1920-p1B#tokenizer-and-input-format分词器与输入格式

附带的分词器不区分大小写,每个token表示一个核苷酸。其词表为[PAD]=0、[UNK]=1、[BOS]=2、a=3、c=4、g=5、t=6。请直接传入包含A、C、G和T且不含空格的原始DNA字符串。分词器会将输入转为小写并前置[BOS];它没有EOS token。其他符号映射为[UNK]。由于BOS占据256个位置中的一个,输入最多为255个DNA碱基。

https://huggingface.co/marin-dna/marin-dna-scaling-v0.5-h1920-p1B#training-data-and-protocol训练数据与协议

缩放阶梯中的每个模型都使用相同的批大小、token预算、优化器超参数、分词器以及三路训练混合比例:73.19% CDS、20.62%上游序列和6.19%下游序列。以小写软掩码(soft-masked)标记的位置的损失权重为0.01,而大写位置的损失权重为1.0。该阶梯改变的是模型规模,而非训练数据配比。

训练数据集:CDS(https://huggingface.co/datasets/marin-dna/genomes-v5-genome_set-animals-intervals-v5_255_128/tree/ffe3e78c99868077c65ad6568e1445d80e480794)、上游序列(https://huggingface.co/datasets/marin-dna/genomes-v5-genome_set-animals-intervals-v1_255_128/tree/d93209847b02a0c9be5c03591a0a5e56ee09c35d)和下游序列(https://huggingface.co/datasets/marin-dna/genomes-v5-genome_set-animals-intervals-v15_255_128/tree/b009afaab756937d75b8da3b1271ad8f0cec0b4d)。匹配的CDS(https://huggingface.co/datasets/marin-dna/genomes-v5-validation-intervals-v5_255_255/tree/daff592f213aaa1cab1711d477a79ff6b1bc4ef4)、上游序列(https://huggingface.co/datasets/marin-dna/genomes-v5-validation-intervals-v1_255_255/tree/a761bc0b663a9827303f3112e4667d53d5326fac)和下游序列(https://huggingface.co/datasets/marin-dna/genomes-v5-validation-intervals-v15_255_255/tree/d7b27eecd68453934ebb3e7e6e78d5401789faa5)数据集仅用于验证探测,而非训练数据。确切的分词器、数据和混合定义已提交固定于此(https://github.com/marin-community/marin/blob/69c4793e1608775ec66b37d6f3f373598c246ba3/experiments/dna/exp109_bolinas_scaling_sweep.py#L62-L76)。

Gonzalo Benegas(@gsbenegas): 很高兴分享MarinDNA,一个1B的基因组语言模型(gLM),在变异效应预测上媲美Evo 2 40B,同时速度快2,330倍。 我和@eczech0围绕标准Transformer构建了它,以便能够复用LLM基础设施和方法,同时专注于数据整理和缩放。 https://t.co/TVChdjJyMP 🧵

相似文章

Carbon:解码生命语言

Reddit r/LocalLLaMA

Hugging Face 发布了 Carbon,一个开放的 DNA 基础模型系列,在匹配 Evo2-7B 最先进性能的同时,速度快 275 倍,采用 6-mer 分词、分解损失和精选的基因组数据。

AlphaGenome:用于更好地理解基因组的人工智能

Google DeepMind Blog

DeepMind 推出 AlphaGenome,这是一个能够预测 DNA 序列变异如何影响基因调控和生物过程的 AI 模型,可应用于多种细胞类型和组织。该模型可处理多达 100 万个碱基对,通过 API 向非商业研究提供,完整论文已在《自然》杂志上发表。