@EmmaScharfmann: 一个能够读取和生成DNA序列的新基础模型刚刚在Hugging Face上发布:https://huggingfac…
摘要
一个新的1.1B参数DNA基础模型MarinDNA v0.5 scaling ladder在Hugging Face上发布;它可以读取和生成DNA序列,据称在变异效应预测方面可与Evo 2 40B相媲美。
查看缓存全文
缓存时间: 2026/08/09 19:27
一个能够读取和生成DNA序列的新基础模型刚刚在Hugging Face上发布:https://huggingface.co/marin-dna/marin-dna-scaling-v0.5-h1920-p1B … 欢迎在下面的演示空间中测试模型的能力
marin-dna/marin-dna-scaling-v0.5-h1920-p1B · Hugging Face
来源:https://huggingface.co/marin-dna/marin-dna-scaling-v0.5-h1920-p1B
https://huggingface.co/marin-dna/marin-dna-scaling-v0.5-h1920-p1B#marindna-v05-scaling-ladder–1bMarinDNA v0.5 缩放阶梯 — 1B
这是一个拥有1,120,772,224个参数的核苷酸级因果语言模型,是使用Marin(https://github.com/marin-community/marin)开发的八个模型MarinDNA v0.5参数缩放阶梯(scaling ladder)的成员之一。本仓库仅包含运行dna-bolinas-scaling-v0.5-h1920-p1B-0dc6f4(https://wandb.ai/eric-czech/marin/runs/dna-bolinas-scaling-v0.5-h1920-p1B-0dc6f4)的最终step-215573检查点,并附带了其分词器。相关博客文章:一个1B标准Transformer在变异效应预测上媲美Evo 2 40B(https://openathena.ai/blog/marin-dna/)。
https://huggingface.co/marin-dna/marin-dna-scaling-v0.5-h1920-p1B#model-details模型详情
| 字段 | 值 |
|---|---|
| 架构 | Qwen3兼容的仅解码器Transformer |
| 参数量 | 1,120,772,224 |
| 层数 | 19 |
| 隐藏层 / 中间层大小 | 1,920 / 7,680 |
| 注意力头 / KV头 | 15 / 15 |
| 上下文 | 256个token:一个BOS token后跟最多255个DNA碱基 |
| 检查点 | 最终检查点,step 215573(经过215,574个零索引训练步骤后) |
| Token暴露量 | 约84.77B个核苷酸token |
| 存储权重dtype | float32 |
| 许可证 | Apache-2.0 |
规范源检查点为gs://marin-us-east5/checkpoints/dna-bolinas-scaling-v0.5-h1920-p1B-0dc6f4/hf/step-215573;字节完全一致的evals_v2传输缓存位于s3://oa-bolinas/snakemake/analysis/evals_v2/results/checkpoints/scaling-v0.5-h1920-p1B-step-215573。提交固定的训练脚本(https://github.com/marin-community/marin/blob/69c4793e1608775ec66b37d6f3f373598c246ba3/experiments/dna/exp109_bolinas_scaling_sweep.py#L1186-L1349)定义了生产环境缩放阶梯。
https://huggingface.co/marin-dna/marin-dna-scaling-v0.5-h1920-p1B#loading加载
`` from transformers import AutoModelForCausalLM, AutoTokenizer
repo_id = “marin-dna/marin-dna-scaling-v0.5-h1920-p1B” tokenizer = AutoTokenizer.from_pretrained(repo_id) model = AutoModelForCausalLM.from_pretrained(repo_id) ``
https://huggingface.co/marin-dna/marin-dna-scaling-v0.5-h1920-p1B#tokenizer-and-input-format分词器与输入格式
附带的分词器不区分大小写,每个token表示一个核苷酸。其词表为[PAD]=0、[UNK]=1、[BOS]=2、a=3、c=4、g=5、t=6。请直接传入包含A、C、G和T且不含空格的原始DNA字符串。分词器会将输入转为小写并前置[BOS];它没有EOS token。其他符号映射为[UNK]。由于BOS占据256个位置中的一个,输入最多为255个DNA碱基。
https://huggingface.co/marin-dna/marin-dna-scaling-v0.5-h1920-p1B#training-data-and-protocol训练数据与协议
缩放阶梯中的每个模型都使用相同的批大小、token预算、优化器超参数、分词器以及三路训练混合比例:73.19% CDS、20.62%上游序列和6.19%下游序列。以小写软掩码(soft-masked)标记的位置的损失权重为0.01,而大写位置的损失权重为1.0。该阶梯改变的是模型规模,而非训练数据配比。
训练数据集:CDS(https://huggingface.co/datasets/marin-dna/genomes-v5-genome_set-animals-intervals-v5_255_128/tree/ffe3e78c99868077c65ad6568e1445d80e480794)、上游序列(https://huggingface.co/datasets/marin-dna/genomes-v5-genome_set-animals-intervals-v1_255_128/tree/d93209847b02a0c9be5c03591a0a5e56ee09c35d)和下游序列(https://huggingface.co/datasets/marin-dna/genomes-v5-genome_set-animals-intervals-v15_255_128/tree/b009afaab756937d75b8da3b1271ad8f0cec0b4d)。匹配的CDS(https://huggingface.co/datasets/marin-dna/genomes-v5-validation-intervals-v5_255_255/tree/daff592f213aaa1cab1711d477a79ff6b1bc4ef4)、上游序列(https://huggingface.co/datasets/marin-dna/genomes-v5-validation-intervals-v1_255_255/tree/a761bc0b663a9827303f3112e4667d53d5326fac)和下游序列(https://huggingface.co/datasets/marin-dna/genomes-v5-validation-intervals-v15_255_255/tree/d7b27eecd68453934ebb3e7e6e78d5401789faa5)数据集仅用于验证探测,而非训练数据。确切的分词器、数据和混合定义已提交固定于此(https://github.com/marin-community/marin/blob/69c4793e1608775ec66b37d6f3f373598c246ba3/experiments/dna/exp109_bolinas_scaling_sweep.py#L62-L76)。
Gonzalo Benegas(@gsbenegas): 很高兴分享MarinDNA,一个1B的基因组语言模型(gLM),在变异效应预测上媲美Evo 2 40B,同时速度快2,330倍。 我和@eczech0围绕标准Transformer构建了它,以便能够复用LLM基础设施和方法,同时专注于数据整理和缩放。 https://t.co/TVChdjJyMP 🧵
相似文章
@lvwerra:我们正在发布Carbon:一个快得离谱的DNA模型。Carbon比第二好的模型快275倍。快到你可以处理……
HuggingFace发布了Carbon,一个DNA模型,比之前的最先进模型(Evo2)快275倍,使得在单个GPU上不到两天就能处理整个人类基因组。该模型使用了独特的tokenizer,将序列分割成6碱基的块,同时保持单碱基分辨率,并附带一个交互式演示。
Carbon:解码生命语言
Hugging Face 发布了 Carbon,一个开放的 DNA 基础模型系列,在匹配 Evo2-7B 最先进性能的同时,速度快 275 倍,采用 6-mer 分词、分解损失和精选的基因组数据。
@adithya_s_k: 醒醒吧大家 Huggingface 刚刚开源了基因组基础模型
Huggingface 开源了基因组基础模型,包括 Carbon,一个 DNA 模型,其速度比次优模型快 275 倍,并且可以在单个 GPU 上不到两天内处理整个人类基因组。
@ClementDelangue: 生物学的未来不应被黑盒API所束缚,尤其是当涉及个人健康时。无论你是……
Hugging Face 发布 Carbon,一个开源DNA基础模型,比同类模型快275倍,可在单个GPU上本地处理整个基因组。
AlphaGenome:用于更好地理解基因组的人工智能
DeepMind 推出 AlphaGenome,这是一个能够预测 DNA 序列变异如何影响基因调控和生物过程的 AI 模型,可应用于多种细胞类型和组织。该模型可处理多达 100 万个碱基对,通过 API 向非商业研究提供,完整论文已在《自然》杂志上发表。