@__tinygrad__: 我们已凭借AMD MI350X训练Llama 8B登上MLPerf榜单。这基于我们自己的驱动、运行时、内核及训练循环…

X AI KOLs Timeline 新闻

摘要

tinygrad宣布,其凭借AMD MI350X硬件训练Llama 8B,在MLPerf基准测试榜单上占据一席之地,采用了自研驱动、运行时、内核及训练循环,并计划进一步优化时间并挑战405B模型。

我们已凭借AMD MI350X训练Llama 8B登上MLPerf榜单。这基于我们自己的驱动、运行时、内核及训练循环。下一个MLPerf目标为405B,同时提升8B的训练时间(tinygrad目前用时170分钟)。https://t.co/syPwte872y
查看原文
查看缓存全文

缓存时间: 2026/06/16 21:41

我们正在用AMD MI350X训练Llama 8B,并登上了MLPerf榜单。这是基于我们自研的驱动、运行时、内核和训练循环。下一轮MLPerf将挑战405B模型,同时优化8B的训练时间(tinygrad目前为170分钟)。https://t.co/syPwte872y

相似文章

花了3天在搭载40GB显存笔记本+TB4外置显卡的独特组合上,对llama.cpp的各类标志参数进行基准测试。最终实现:生成速度提升70%、预填充速度提升40%、上下文容量增加6万token,并向llama项目提交了关于MTP的技术问题报告。以下是实践中的关键发现。

Reddit r/LocalLLaMA

作者在配备RTX 4090笔记本显卡和AMD XTX 7900外置显卡的混合GPU环境中对llama.cpp运行参数进行了基准测试,实现了生成速度提升70%、预填充速度提升40%,并在多GPU配置中发现了一个与MTP相关的错误。