@AnnmariaKAntony: LLMs 擅长 CUDA,因为互联网上充满了相关内容。但一个能提供高度优化 CUDA 的模型可能仍然……
摘要
一个结合 SFT 和 GRPO RL 后训练的多智能体合成数据流水线,为 14B 开源模型在 AMD MI350X GPU 上提升了 HIP 的编译和正确性。
LLMs 擅长 CUDA,因为互联网上充满了相关内容。但一个能提供高度优化 CUDA 的模型可能仍然难以编写可编译的 HIP。
我们构建了一个基于多智能体搜索的合成数据流水线,并通过 SFT + GRPO RL 对 14B 开源模型进行后训练,在 AMD MI350X GPU 上显著提升了 HIP 的编译和正确率。
查看缓存全文
缓存时间: 2026/07/03 22:42
LLMs擅长CUDA,因为互联网上充满了CUDA代码。但一个能给你高度优化CUDA的模型,在编写可编译的HIP代码时可能仍然很吃力。我们构建了一个包含多智能体搜索的合成数据流水线,并对一个14B开源模型进行SFT + GRPO RL的后训练,从而在AMD MI350X GPU上显著提升了HIP的编译成功率和正确率。
相似文章
面向AMD GPU的更好HIP内核生成:合成数据、多智能体搜索与强化学习
探讨了合成数据生成、多智能体优化和强化学习,以提高语言模型为AMD GPU生成高性能HIP内核的能力,并在MI350X上展示了编译率和正确率的提升。
@akshay_pachaar: https://x.com/akshay_pachaar/status/2084992645966016757
一份技术指南,演示如何使用开源工具在单个 GPU 上部署五个专用的小型模型(SLM、OCR、NER、重排序器、目标检测器),涵盖内存管理、批处理以及 Superlinked Inference Engine。
@TheAhmadOsman: 本地LLM与GPU
一条推文,分享了关于使用GPU部署本地大语言模型的信息或资源。
@akshay_pachaar:重大突破!自托管LLM的成本刚刚降低了约75%:大多数Agent流水线现在在底层运行4-5个小模型……
Superlinked发布了SIE,一个开源推理引擎,通过一个API提供85+个模型,支持按需加载和LRU逐出,为Agent流水线节省约75%的自托管GPU成本。
@TheAhmadOsman:你可以在家运行本地模型,并使用任何代理框架,如 Codex 或 Claude Code
Ahmad 构建了一个简单的工具,使 Claude Code 能与任何本地 LLM 配合使用,演示时使用了 vLLM 在 4 块 RTX 3090 上服务 GLM-4.5 Air。