100万亿+的预训练数据???这是我见过模型训练中最大的数据量。
摘要
一个新的人工智能模型正在使用超过100万亿个令牌进行训练,是其他模型如Kimi、Mimo和DeepSeek通常使用的27-50万亿令牌预训练数据规模的两倍。
https://preview.redd.it/oss7g2gnll4h1.png?width=894&format=png&auto=webp&s=5d4295707a700ed7541c274b8be8ad75bbd0903d 通常我们在大多数模型中看到27-50万亿个令牌,如Kimi、Mimo、DeepSeek。他们似乎将预训练数据量翻倍了。Minimax-m2.5大约是27万亿个令牌。如果看Mimo,他们做了:
- 27万亿个令牌用于Mimo-v2.5-Pro 1万亿参数
- 48万亿个令牌用于较小的Mimo-v2.5模型(多模态)。
- 32万亿个令牌用于Deepseek V4 Flash和Pro。
我很难相信这个模型会比之前的M2系列模型大很多。训练数据规模太大,需要更多资源来训练更大的模型。M3似乎可能低于5000亿参数。
相似文章
Gemma 4 仍然偷懒
用户报告称,Gemma 4 在多轮代理任务中表现懒散且不佳,相比 Qwen、DeepSeek 和 GPT-OSS 等其他模型,尽管它是一款优秀的聊天机器人。
本地LLM vs AI API:值得吗?值得。
一篇观点文章,权衡了运行本地大语言模型与使用云端AI API的利弊,结论是本地模型是值得的。
Anthropic 如何借助 Claude Code 进行大规模代码迁移(11 分钟阅读)
Anthropic 概述了使用 Claude Code 进行大规模代码迁移的六步流程,重点包括创建规则手册、依赖关系映射以及通过强大的评审模型进行迭代验证。
Retell 对比 Vapi 对比 Plura AI:用于生产环境语音代理,哪个更胜一筹?
对三个语音 AI 代理——Retell、Vapi 和 Plura AI——进行比较,评估它们在生产用例中的表现。
统计优势是否值得付出成本?KAN与MLP在结构化数据分类上的实证比较
本研究对Kolmogorov-Arnold网络(KANs)和多层感知器(MLPs)在结构化表格分类任务上进行了实证比较,发现KANs在统计上优于MLPs,但计算成本更高。