@TheAhmadOsman: 推理工程简单来说就是 - 可加载的编码 - 由后端实现的针对这些编码的操作 -…

X AI KOLs Timeline 新闻

摘要

一条推文解释了推理工程的核心组成部分:可加载编码、后端操作和原生硬件算术,并讨论了内核和GPU效率。

推理工程简单来说就是 - 可加载的编码 - 由后端实现的针对这些编码的操作 - 通过上述操作由硬件原生执行的算术 顺便说一下,这三者结合起来现在能赚大钱
查看原文
查看缓存全文

缓存时间: 2026/09/19 23:08

推理工程本质上就是:

  • 可加载的编码表示
  • 由后端实现的对上述编码的操作
  • 通过上述操作由硬件原生执行的运算

顺便说一句,这三者的结合如今极其重要。

艾哈迈德(@TheAhmadOsman): 内核实现的是特定的张量程序,而非模型本身

模型语义 → 张量形状 → 内核 → 指令 → 运行时 → 硅芯片

如果不能妥善处理这些环节,你的GPU就会变成一个非常昂贵的取暖器

——来自我即将发布的关于内核、硬件和模型的文章

相似文章

AI推理工程指南(阅读时间约17分钟)

TLDR AI

本指南解释了AI推理工程这一学科,涵盖了预填充和解码阶段的划分、从封闭模型到开放模型的转变,以及针对延迟、吞吐量和成本的优化技术。