[大数据集发布] - SupraLabs/reasoning-corpus-4K-5M-v1 - 训练你的小型 SLM 学会思考!
摘要
SupraLabs 发布了 reasoning-corpus-4K-5M-v1,一个包含 500 万样本的推理数据集,用于训练小型语言模型 (SLM),包含思维链追踪和 ChatML 格式,托管在 Hugging Face 上。
https://preview.redd.it/b7ybs7nqx5fh1.png?width=3440&format=png&auto=webp&s=e6aaaa15cbe59debaae1ebb7fcd708167e86dc35 嘿,r/LocalLLaMA 的朋友们!我们回来了,今天带来了真正令人兴奋的东西。我们的大型 500 万样本推理语料库数据集。这个数据集包含 500 万行数据,每行包括: - repo_id --> 数据来源 - tok_len --> 总 token 数 - user --> 用户提示 - thought_trace --> 模型的精确思维链 - assistant --> 最终 AI 模型的回答 - ChatML --> 包含 user、thought_trace 和 assistant 的 ChatML 格式 所有样本的序列长度都在 5k 以内,非常适合对小模型进行 SFT/微调。数据集在 Hugging Face 上的链接 🤗:https://huggingface.co/datasets/SupraLabs/reasoning-corpus-4K-5M-v1 SupraLabs 的 Hugging Face 组织链接 🤗:https://huggingface.co/SupraLabs 另外,如果你想支持我们的工作,请在 Hugging Face 上关注我们,分享和评价我们的工作,并随时给我们提出反馈 ❤️🔥🤗 已经有超过 250 人信任我们和我们的工作!我们希望这个数据集对大家有用,并期待看到基于此的创作。该数据集已有超过 1k 次下载和 80 多个赞——下一个使用它的就是你 🔥🎉
相似文章
@AdinaYakup: OpenBMB 刚刚发布了一个令人印象深刻的有监督微调数据集 UltraData-SFT-2605,包含 1500 万以上高质量样本,覆盖深度思考与非思考等类型……
OpenBMB 发布了 UltraData-SFT-2605,这是一个大规模数据集,包含超过 1500 万高质量样本,用于推理型大语言模型的监督微调(SFT),涵盖深度思考、非思考、数学、代码、知识、指令遵循和多语言数据。
多语言轻量级(3.7B)推理MoE模型在消费级GPU上从零开始预训练
一个多语言3.7B参数的推理MoE模型在消费级GPU上从零开始预训练了数月,支持13种语言,并已在Hugging Face上提供。
超大视频推理套件
本文介绍了超大视频推理(VBVR)数据集和基准,这是一个大规模资源,包含超过一百万个视频片段,涵盖200个推理任务,能够系统研究时空推理,并展示了早期出现的涌现泛化迹象。
GigaChat-3.5-Reasoning
本文介绍了Hugging Face上的一个集合,其中包含GigaChat 3.5 Reasoning模型,这些模型是针对各种格式推理任务优化的大型AI模型。
Domyn-Small:一款欧洲10B参数推理语言模型
Domyn-Small是一个100亿参数的开源推理语言模型,采用MIT许可证发布,基于9万亿个token训练,针对推理、指令遵循和工具使用进行了优化。在与Qwen3.5-9B和OLMo-3-7B-Think等同类模型的对比中,它实现了强大的准确性与效率平衡。