DeepSeek LLM:以长期主义扩展开源语言模型

Papers with Code Trending 论文

摘要

DeepSeek LLM是一个开源语言模型项目,它开发了一个大规模数据集,并采用SFT和DPO,在各种基准测试和开放式评估中实现了超越LLaMA-2 70B和GPT-3.5的性能。

开源大语言模型(LLM)的快速发展确实令人瞩目。然而,以往文献中描述的扩展定律得出了不同的结论,这给LLM的扩展蒙上了一层阴影。我们深入研究了扩展定律,并提出了我们独特的发现,这些发现有助于在两种常用的开源配置(7B和67B)中扩展大规模模型。在扩展定律的指导下,我们推出了DeepSeek LLM项目,该项目致力于以长期视角推进开源语言模型。为了支持预训练阶段,我们开发了一个数据集,目前包含2万亿个token,并且还在持续扩展。我们进一步在DeepSeek LLM基础模型上进行了监督微调(SFT)和直接偏好优化(DPO),从而创建了DeepSeek Chat模型。我们的评估结果表明,DeepSeek LLM 67B在各种基准测试中超越了LLaMA-2 70B,尤其是在代码、数学和推理领域。此外,开放式评估显示,DeepSeek LLM 67B Chat相比GPT-3.5表现出更优越的性能。
查看原文
查看缓存全文

缓存时间: 2026/07/10 12:10

论文页面 - DeepSeek LLM: 基于长期主义扩展开源语言模型

来源: https://huggingface.co/papers/2401.02954 发布于 2024年1月5日

·

提交者 https://huggingface.co/akhaliq

AK (https://huggingface.co/akhaliq) 于 2024年1月8日

#1 当日论文 (https://huggingface.co/papers/date/2024-01-08) 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

DeepSeek LLM 是一个开源语言模型项目,通过构建大规模数据集并采用 SFT 和 DPO 方法,在多项基准测试和开放式评估中实现了超越 LLaMA-2 70B 和 GPT-3.5 的性能。

开源大语言模型 (https://huggingface.co/papers?q=open-source%20large%20language%models) (LLMs) 的快速发展确实令人瞩目。然而,以往文献中描述的缩放定律呈现出不同的结论,这给大模型的扩展蒙上了一层阴影。我们深入研究了缩放定律 (https://huggingface.co/papers?q=scaling%20laws),并提出了独特的发现,有助于在两种常用的开源配置(7B 和 67B)下扩展大规模模型。在缩放定律的指导下,我们推出了 DeepSeek LLM 项目,致力于以长期视角推进开源语言模型的发展。为支持预训练阶段,我们构建了一个目前包含 2 万亿 token 且持续扩展的数据集 (https://huggingface.co/papers?q=dataset)。我们进一步在 DeepSeek LLM (https://huggingface.co/papers?q=DeepSeek%20LLM) 基础模型上进行了监督微调 (https://huggingface.co/papers?q=supervised%20fine-tuning) (SFT) 和直接偏好优化 (DPO),从而创建了 DeepSeek Chat 模型。评估结果显示,DeepSeek LLM 67B 在多项基准测试 (https://huggingface.co/papers?q=benchmarks) 中超越了 LLaMA-2 70B,尤其在代码 (https://huggingface.co/papers?q=code)、数学 (https://huggingface.co/papers?q=mathematics) 和推理 (https://huggingface.co/papers?q=reasoning) 领域表现出色。此外,开放式评估表明 DeepSeek LLM 67B Chat 的性能优于 GPT-3.5。

查看 arXiv 页面 (https://arxiv.org/abs/2401.02954)查看 PDF (https://arxiv.org/pdf/2401.02954)GitHub7.19kauto (https://github.com/deepseek-ai/deepseek-llm)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2401.02954)

在您的 agent 中获取此论文:

hf papers read 2401\.02954

没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用该论文的模型3

Clinical-Reasoning-Hub/Diagnostic-Medicine-R1 文本生成·8B·更新于2月18日·1 (https://huggingface.co/Clinical-Reasoning-Hub/Diagnostic-Medicine-R1)

Feargal/nvyra-x-reasoning-please (https://huggingface.co/Feargal/nvyra-x-reasoning-please)

Clinical-Reasoning-Hub/Diagnostic-Reasoning-RL1 文本生成·8B·更新于2月17日 (https://huggingface.co/Clinical-Reasoning-Hub/Diagnostic-Reasoning-RL1)

引用该论文的数据集0

没有引用该论文的数据集

在数据集 README.md 中引用 arxiv.org/abs/2401.02954,即可在此页面中链接。

引用该论文的 Space3

包含该论文的集合38

浏览包含该论文的 38 个集合 (https://huggingface.co/collections?paper=2401.02954)

相似文章

deepseek-ai/DeepSeek-V4-Flash-DSpark

Hugging Face Models Trending

DeepSeek 发布 V4 系列混合专家语言模型(Pro 1.6T/49B 激活参数,Flash 284B/13B 激活参数),支持百万 token 上下文,采用混合注意力和推测解码,声称具有最佳开源模型性能。

deepseek-ai/DeepSeek-V4-Flash

Hugging Face Models Trending

DeepSeek 发布 DeepSeek-V4-Flash 和 DeepSeek-V4-Pro,新一代 MoE 语言模型,支持 100 万 token 上下文,效率和性能均有提升。