DeepSeek LLM:以长期主义扩展开源语言模型
摘要
DeepSeek LLM是一个开源语言模型项目,它开发了一个大规模数据集,并采用SFT和DPO,在各种基准测试和开放式评估中实现了超越LLaMA-2 70B和GPT-3.5的性能。
查看缓存全文
缓存时间: 2026/07/10 12:10
论文页面 - DeepSeek LLM: 基于长期主义扩展开源语言模型
来源: https://huggingface.co/papers/2401.02954 发布于 2024年1月5日
·
提交者 https://huggingface.co/akhaliq
AK (https://huggingface.co/akhaliq) 于 2024年1月8日
#1 当日论文 (https://huggingface.co/papers/date/2024-01-08) 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
DeepSeek LLM 是一个开源语言模型项目,通过构建大规模数据集并采用 SFT 和 DPO 方法,在多项基准测试和开放式评估中实现了超越 LLaMA-2 70B 和 GPT-3.5 的性能。
开源大语言模型 (https://huggingface.co/papers?q=open-source%20large%20language%models) (LLMs) 的快速发展确实令人瞩目。然而,以往文献中描述的缩放定律呈现出不同的结论,这给大模型的扩展蒙上了一层阴影。我们深入研究了缩放定律 (https://huggingface.co/papers?q=scaling%20laws),并提出了独特的发现,有助于在两种常用的开源配置(7B 和 67B)下扩展大规模模型。在缩放定律的指导下,我们推出了 DeepSeek LLM 项目,致力于以长期视角推进开源语言模型的发展。为支持预训练阶段,我们构建了一个目前包含 2 万亿 token 且持续扩展的数据集 (https://huggingface.co/papers?q=dataset)。我们进一步在 DeepSeek LLM (https://huggingface.co/papers?q=DeepSeek%20LLM) 基础模型上进行了监督微调 (https://huggingface.co/papers?q=supervised%20fine-tuning) (SFT) 和直接偏好优化 (DPO),从而创建了 DeepSeek Chat 模型。评估结果显示,DeepSeek LLM 67B 在多项基准测试 (https://huggingface.co/papers?q=benchmarks) 中超越了 LLaMA-2 70B,尤其在代码 (https://huggingface.co/papers?q=code)、数学 (https://huggingface.co/papers?q=mathematics) 和推理 (https://huggingface.co/papers?q=reasoning) 领域表现出色。此外,开放式评估表明 DeepSeek LLM 67B Chat 的性能优于 GPT-3.5。
查看 arXiv 页面 (https://arxiv.org/abs/2401.02954)查看 PDF (https://arxiv.org/pdf/2401.02954)GitHub7.19kauto (https://github.com/deepseek-ai/deepseek-llm)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2401.02954)
在您的 agent 中获取此论文:
hf papers read 2401\.02954
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型3
Clinical-Reasoning-Hub/Diagnostic-Medicine-R1 文本生成·8B·更新于2月18日·1 (https://huggingface.co/Clinical-Reasoning-Hub/Diagnostic-Medicine-R1)
Feargal/nvyra-x-reasoning-please (https://huggingface.co/Feargal/nvyra-x-reasoning-please)
Clinical-Reasoning-Hub/Diagnostic-Reasoning-RL1 文本生成·8B·更新于2月17日 (https://huggingface.co/Clinical-Reasoning-Hub/Diagnostic-Reasoning-RL1)
引用该论文的数据集0
没有引用该论文的数据集
在数据集 README.md 中引用 arxiv.org/abs/2401.02954,即可在此页面中链接。
引用该论文的 Space3
包含该论文的集合38
浏览包含该论文的 38 个集合 (https://huggingface.co/collections?paper=2401.02954)
相似文章
DeepSeek开源DSpark,一个可将LLM推理速度提升高达85%的新框架(阅读时间18分钟)
DeepSeek开源了DSpark,这是一个采用MIT许可证的框架,利用推测解码技术将LLM推理速度提升高达85%,支持包括自家DeepSeek-V4、阿里巴巴Qwen和谷歌Gemma在内的多个模型系列。
从零开始开发开源大语言模型:从预训练到RLHF(PPO/GRPO)
一位开发者分享了从零开始训练一个70亿参数开源大语言模型的进展,该模型基于DeepSeek架构并针对低显存进行了优化,目标是推动AI开发的民主化,并最终超越大型专有模型。
deepseek-ai/DeepSeek-V4-Flash-DSpark
DeepSeek 发布 V4 系列混合专家语言模型(Pro 1.6T/49B 激活参数,Flash 284B/13B 激活参数),支持百万 token 上下文,采用混合注意力和推测解码,声称具有最佳开源模型性能。
@DeRonin_: DeepSeek 刚发布了一篇5页论文和免费GitHub仓库,能让任何LLM响应速度提升80%,这项技术叫推测性解码...
DeepSeek 发布了一篇论文以及采用MIT许可证的开源实现(DSpark),通过使用小型“猜测”模型和大型“检查”模型,将LLM响应速度提升高达80%,同时兼顾速度与准确率,无需权衡取舍。
deepseek-ai/DeepSeek-V4-Flash
DeepSeek 发布 DeepSeek-V4-Flash 和 DeepSeek-V4-Pro,新一代 MoE 语言模型,支持 100 万 token 上下文,效率和性能均有提升。