@AdinaYakup: OpenBMB 刚刚发布了一个令人印象深刻的有监督微调数据集 UltraData-SFT-2605,包含 1500 万以上高质量样本,覆盖深度思考与非思考等类型……
摘要
OpenBMB 发布了 UltraData-SFT-2605,这是一个大规模数据集,包含超过 1500 万高质量样本,用于推理型大语言模型的监督微调(SFT),涵盖深度思考、非思考、数学、代码、知识、指令遵循和多语言数据。
查看缓存全文
缓存时间: 2026/05/30 04:05
OpenBMB 刚刚发布了一个令人印象深刻的 SFT 数据集
UltraData-SFT-2605 📊
✨ 超过1500万高质量样本 ✨ 深度思考 + 非思考数据 ✨ 数学/代码/知识/IF/多语言覆盖 ✨ 专为推理大模型后训练而构建 ✨ 完整的数据管道:过滤/ https://t.co/RUYIwqTGiQ
相似文章
@AtriaASI:我们感谢OpenBMB通过UltraData-SFT-Agent-2609支持Atria Dawn Preview。该数据集的高质量…
OpenBMB发布了UltraData-SFT-Agent-2609,这是一个包含50万个样本的数据集,用于代理指令调优,并在MiniCPM5-2B模型的后训练中使用。
[大数据集发布] - SupraLabs/reasoning-corpus-4K-5M-v1 - 训练你的小型 SLM 学会思考!
SupraLabs 发布了 reasoning-corpus-4K-5M-v1,一个包含 500 万样本的推理数据集,用于训练小型语言模型 (SLM),包含思维链追踪和 ChatML 格式,托管在 Hugging Face 上。
@cjzafir: 今天微调你的第一个AI模型。运行GPT4o级别的模型,并在你的手机或笔记本电脑上运行。@OpenBMB发布了15M样本…
OpenBMB发布了UltraData-SFT-2605,一个包含1500万样本的高质量SFT数据集,用于微调如MiniCPM5-1B等AI模型,使其能在手机或笔记本电脑上运行。
@AdinaYakup: Ultra-FineWeb-L1 开放英文网络语料库,用于LLM预训练,来自@OpenBMB https://huggingface.co/datasets/openbmb/Ult…
OpenBMB 发布了 Ultra-FineWeb-L1,一个开放英文网络语料库,包含超过1万亿个token,用于LLM预训练,源自Common Crawl,并采用Trafilatura 2.0进行高级清理。
学习通过洞察进行非形式化定理证明的推理
本论文提出了DeepInsightTheorem,一个分层数据集和渐进式多阶段有监督微调训练策略,通过教导大语言模型识别和应用核心技术来改进其非形式化定理证明能力。