deepseek-r1

标签

Cards List
#deepseek-r1

@TheAhmadOsman: 开源AI的五大高光时刻 - Llama 3 - Qwen 2.5 - DeepSeek R1 - GLM 4.5 - Kimi K3 这些改变…

X AI KOLs Following · 2026-08-07 缓存

一条推文,重点介绍了开源AI的五大高光时刻,将Llama 3、Qwen 2.5、DeepSeek R1、GLM 4.5和Kimi K3列为具有变革意义的发布。

0 人收藏 0 人点赞
#deepseek-r1

@Ryrenz: 炸裂,Hugging Face 把 DeepSeek-R1 的训练全流程完整开源复现了一遍。 GitHub 26.4k star,出自 Hugging Face 官方团队,最权威的一集。 DeepSeek-R1 惊艳全场,但真正的训练配方…

X AI KOLs Timeline · 2026-07-03 缓存

Hugging Face 官方团队完整开源复现了 DeepSeek-R1 的训练全流程(Open-R1 项目),包括数据、训练和评测,在 GitHub 上获得 26.4k star,为行业提供了可复现的推理模型训练教科书。

1 人收藏 1 人点赞
#deepseek-r1

从大型推理模型到紧凑型学生模型的知识蒸馏:以John O Bryan数学竞赛为例

arXiv cs.LG · 2026-07-01 缓存

本文研究了从DeepSeek-R1推理模型到紧凑型Qwen2.5-7B学生模型的知识蒸馏,使用了基于John O'Bryan数学竞赛问题构建的思维链(CoT)语料库。微调后的学生模型在竞赛数据集上取得了4.76个百分点的提升,并泛化到MATH-500,同时还分析了回答长度对推理质量的影响。

0 人收藏 0 人点赞
#deepseek-r1

DeepSeek-R1的开放复现

Hacker News Top · 2026-06-11 缓存

Hugging Face的Open R1项目为DeepSeek-R1提供了完全开放的复现流程,包括蒸馏数据集、训练脚本和评估工具,旨在让任何人都能基于R1的推理能力进行复现和进一步开发。

0 人收藏 0 人点赞
#deepseek-r1

N-GRPO:嵌入级邻居混合以增强策略优化

Hugging Face Daily Papers · 2026-06-09 缓存

N-GRPO 在 GRPO 框架中引入语义邻居混合,以增强数学推理多样性并保持语义一致性,在数学基准和分布外任务上均取得了提升。

0 人收藏 0 人点赞
#deepseek-r1

思考越多,偏见越大:推理模型中由长度驱动的位置偏见

arXiv cs.AI · 2026-05-11 缓存

本研究论文探讨了推理模型中的位置偏见,发现偏见并非随着“更多思考”而消除,而是与推理轨迹的长度成正比。该研究提供了因果证据,并提供了一套诊断工具包,用于审核多选问答评估中这种由长度驱动的偏见。

0 人收藏 0 人点赞
#deepseek-r1

蒸馏有多难?

Reddit r/LocalLLaMA · 2026-05-08

该文章探讨了模型蒸馏的难度和成本,以DeepSeek R1蒸馏到Llama 3 8b和Qwen 2.5 7b为例,询问为何蒸馏模型不常见。

0 人收藏 0 人点赞
#deepseek-r1

[Full Workshop] Reinforcement Learning, Kernels, Reasoning, Quantization & Agents — Daniel Han

YouTube AI Channels · 2026-06-25 缓存

Daniel Han 在 AI 工程师世界大会上深入讲解了强化学习、模型微调、量化与智能体的实战经验,回顾了从 Llama 到 DeepSeek R1 的开源模型演进,并剖析了现代模型训练的五个关键阶段。

1 人收藏 1 人点赞
← 返回首页

提交意见反馈