ByteDance-Seed/Cola-DLM · Hugging Face
摘要
字节跳动发布Cola-DLM,一种层次化连续潜在空间扩散语言模型,结合了文本VAE和块因果扩散Transformer,在Hugging Face上提供模型权重、代码和论文。
查看缓存全文
缓存时间: 2026/05/15 13:01
ByteDance-Seed/Cola-DLM · Hugging Face
来源:https://huggingface.co/ByteDance-Seed/Cola-DLM English (https://huggingface.co/ByteDance-Seed/Cola-DLM/blob/main/README.md)·中文 (https://huggingface.co/ByteDance-Seed/Cola-DLM/blob/main/README_zh.md)
Cola DLM(ContinuousLatentDiffusionLanguageModel)是一种层次化的连续潜在空间扩散语言模型。它将文本VAE与块因果扩散Transformer(DiT)先验相结合:VAE将文本映射为连续潜在序列,并将潜在变量解码回token,而DiT通过Flow Matching执行潜在先验的传输。
此模型仓库包含论文Continuous Latent Diffusion Language Model的HuggingFace格式检查点。
https://huggingface.co/ByteDance-Seed/Cola-DLM#links链接
- **模型仓库:**https://huggingface.co/ByteDance-Seed/Cola-DLM
- **GitHub仓库:**https://github.com/ByteDance-Seed/Cola-DLM
- **论文:**https://arxiv.org/abs/2605.06548
- **HuggingFace每日论文:**https://huggingface.co/papers/2605.06548
- **项目页面:**https://hongcanguo.github.io/Cola-DLM/
- **博客文章:**https://hongcanguo.github.io/posts/2026-cola-dlm.html
- **知乎文章:**https://zhuanlan.zhihu.com/p/2038324180920313704
https://huggingface.co/ByteDance-Seed/Cola-DLM#model-files模型文件
预期的仓库目录结构如下:
. ├── cola_dlm/ │ ├── cola_dit/ │ │ ├── config.json │ │ └── model.safetensors* │ └── cola_vae/ │ ├── config.json │ └── model.safetensors* ├── tokenizer.json ├── README.md └── README_zh.md
该检查点包含两个协作模块:
ColaDiTModel:一种在连续文本潜在变量之上运行的块因果一维扩散Transformer先验。ColaTextVAEModel:一个文本VAE编码器和条件解码器,用于文本到潜在变量以及潜在变量到文本的映射。
https://huggingface.co/ByteDance-Seed/Cola-DLM#quickstart快速开始
从GitHub仓库 (https://github.com/ByteDance-Seed/Cola-DLM) 安装Cola DLM代码包,然后安装下载辅助工具:
git clone https://github.com/ByteDance-Seed/Cola-DLM.git cd Cola-DLM pip install -e . pip install huggingface_hub
下载模型文件:
huggingface-cli download ByteDance-Seed/Cola-DLM --local-dir hf_models
运行一个最小的Python示例:
`` import torch from tokenizers import Tokenizer
from cola_dlm import ( ColaDiTModel, ColaTextVAEModel, generate_task_repaint_inference, )
device = torch.device(“cuda” if torch.cuda.is_available() else “cpu”)
dit = ColaDiTModel.from_pretrained(“hf_models/cola_dlm/cola_dit”).to(device) vae = ColaTextVAEModel.from_pretrained(“hf_models/cola_dlm/cola_vae”).to(device) tokenizer = Tokenizer.from_file(“hf_models/tokenizer.json”)
prompts = [{“question”: “Question: What is the capital of France? Answer:”}] results = generate_task_repaint_inference( dit=dit, vae=vae, tokenizer=tokenizer, prompts=prompts, task_name=“lambada”, device=device, max_new_tokens=32, temperature=0.0, guidance_scale=7.0, timestep_num=16, pad_token_id=100277, )
print(results[0][“generate”]) ``
https://huggingface.co/ByteDance-Seed/Cola-DLM#openai-compatible-servingOpenAI兼容的服务
Cola DLM代码发布中的配套openai_adapter/服务通过一个兼容OpenAI的聊天补全端点暴露此模型:
POST /v1/chat/completions
从代码仓库根目录安装适配器依赖:
pip install -e . pip install -r openai_adapter/requirements.txt
启动服务:
`` export COLA_DIT_PATH=hf_models/cola_dlm/cola_dit export COLA_VAE_PATH=hf_models/cola_dlm/cola_vae export COLA_TOKENIZER_PATH=hf_models/tokenizer.json export COLA_MODEL_NAME=cola-dlm export COLA_API_KEY=change-me
uvicorn openai_adapter.server:app –host 0.0.0.0 –port 8000 ``
然后发送请求:
curl http://127.0.0.1:8000/v1/chat/completions \ -H "Content-Type: application/json" \ -H "Authorization: Bearer change-me" \ -d '{ "model": "cola-dlm", "messages": [ { "role": "user", "content": "Question: What is the capital of France? Answer:" } ], "temperature": 0, "max_tokens": 32, "stream": false }'
该适配器目前支持非流式补全。
https://huggingface.co/ByteDance-Seed/Cola-DLM#model-details模型详情
- **架构:**文本VAE + 块因果DiT潜在先验。
- **训练目标:**两阶段训练:先进行文本VAE预训练,然后使用Flow Matching联合训练文本VAE和DiT。
- **训练计算检查点:**发布的权重对应论文RQ4扩展曲线中报告的2000 EFLOPs检查点。
- **分词器:**OLMo 2分词器,词汇表大小为100,278。
- 特殊token ID:
pad_token_id=100277,eos_token_id=100257,im_end_token_id=100265。 - **框架:**PyTorch 2.1+ 和 HuggingFace Transformers 4.40+。
- **许可证:**Apache License 2.0。
https://huggingface.co/ByteDance-Seed/Cola-DLM#evaluation评估
来自开源推理实现的零样本基准测试参考结果:
任务准确率(%)LAMBADA50.80MMLU19.30OBQA23.00HellaSwag10.70RACE19.60SIQA28.90SQuAD30.90Story Cloze30.77任务平均****26.75 开源的HuggingFace Transformers实现可能与论文中使用的内部实现略有不同,因此每个任务的数字可能会有小幅波动。整体趋势与论文一致。
https://huggingface.co/ByteDance-Seed/Cola-DLM#intended-use预期用途
Cola DLM主要用于层次化潜在变量语言模型、文本连续潜在扩散、Flow Matching先验以及基准风格文本生成的研究。
此检查点未经过指令微调,也未经过RLHF。不应将其视为生产级聊天机器人或用于安全关键的决策。
https://huggingface.co/ByteDance-Seed/Cola-DLM#limitations局限性
- 该模型主要基于英文文本进行训练;其他语言的评估效果不佳。
- 输出可能包含事实错误、冒犯性内容、偏见或幻觉。
- 生成质量可能对提示格式和提示长度敏感。建议使用类似
"Question: ... Answer:"的问答风格提示进行快速评估。 - 该模型在生成过程中使用可变的KV缓存;服务实现应将生成序列化在一个进程内,除非明确隔离了缓存处理。
https://huggingface.co/ByteDance-Seed/Cola-DLM#safety-statement-and-use-restrictions安全声明与使用限制
Cola DLM是一个面向研究的连续潜在扩散语言建模检查点。发布的模型相对较小,未经过指令微调、RLHF对齐或系统性的安全对齐。因此,它无法提供可靠的拒绝行为、内容审核或风险检测。其输出可能包含不准确、冒犯性、偏见、违法、不当或误导性的内容。
此模型仅用于学术研究和技术实验。我们不鼓励、支持或授权使用Cola DLM生成、分发或协助以下类型的内容:
- 色情、性暴露、剥削性或其他不当内容;
- 与赌博相关的内容,包括赌博推广、投注建议或非法赌博服务;
- 与非法药物或管制物质相关的内容,包括制造、购买、销售、使用或规避监管的说明;
- 仇恨、骚扰、歧视、暴力威胁、极端主义或煽动性内容;
- 政治操纵、针对性政治宣传活动、政治虚假信息、煽动国际或群体间冲突,或可能加剧社会、国家或地缘政治紧张局势的敏感政治内容;
- 非法活动、监管规避、网络滥用、侵犯隐私或其他可能造成现实世界危害的内容;
- 在医疗、法律、金融、安全关键或安保敏感等高风险领域的自动化建议或决策。
下载、部署、微调、重新分发或基于此模型构建应用程序的用户,有责任实施适当的安全与合规措施。这些措施可能包括但不限于:输入和输出审核、访问控制、日志记录与审计、人工审查、红队测试,以及根据适用法律法规进行合规检查。
Cola DLM不应被视为生产级别的聊天机器人或安全可靠的通用助手。此模型生成的任何内容不代表作者、所属机构或贡献者的观点、立场或认可。
https://huggingface.co/ByteDance-Seed/Cola-DLM#citation引用
如果您在工作中使用了Cola DLM,请引用:
@article{guo2026cola, title = {Continuous Latent Diffusion Language Model}, author = {Guo, Hongcan and Zhao, Qinyu and Zhao, Yian and Nie, Shen and Zhu, Rui and Guo, Qiushan and Wang, Feng and Yang, Tao and Zhao, Hengshuang and Wei, Guoqiang and Zeng, Yan}, journal = {arXiv preprint arXiv:2605.06548}, year = {2026}, url = {https://arxiv.org/abs/2605.06548}, }
相似文章
连续潜在扩散语言模型
Cola DLM 是一种分层潜在扩散语言模型,它通过文本到潜空间的映射以及条件解码,实现高效且非自回归的文本生成。
扩散语言模型的动态分块
本文介绍了扩散语言模型的动态分块(DCDM),该方法使用可微分的Chunking Attention机制,用内容定义的语义块替换块离散扩散中的固定位置块,在高达1.5B参数规模上实现了一致的改进。
TextLDM:利用连续潜在扩散进行语言建模
本文介绍了 TextLDM,这是一种通过将离散标记映射到连续潜在空间,从而将视觉潜在扩散Transformer适配于语言建模的方法。研究表明,该方法在表示对齐的增强下,达到了与 GPT-2 相当的性能,并统一了视觉与文本生成的架构。
ByteDance SeedRealtime(4分钟阅读)
ByteDance发布了SeedRealtime,这是一个原生音视频模型,能够处理连续的视频、音频和文本,同时进行实时语音输出。
多块扩散语言模型
本文提出多块扩散语言模型(MBD-LMs),将单块扩散扩展为并发多块解码,并采用优化训练策略如多块教师强制(Multi-block Teacher Forcing)和优化的块缓冲区解码算法。实验表明,每次前向传递的令牌数增加,基准测试准确率提升。