@TheAhmadOsman: 推理工程简单来说就是 - 可加载的编码 - 由后端实现的针对这些编码的操作 -…
摘要
一条推文解释了推理工程的核心组成部分:可加载编码、后端操作和原生硬件算术,并讨论了内核和GPU效率。
推理工程简单来说就是
- 可加载的编码
- 由后端实现的针对这些编码的操作
- 通过上述操作由硬件原生执行的算术
顺便说一下,这三者结合起来现在能赚大钱
查看缓存全文
缓存时间: 2026/09/19 23:08
推理工程本质上就是:
- 可加载的编码表示
- 由后端实现的对上述编码的操作
- 通过上述操作由硬件原生执行的运算
顺便说一句,这三者的结合如今极其重要。
艾哈迈德(@TheAhmadOsman): 内核实现的是特定的张量程序,而非模型本身
模型语义 → 张量形状 → 内核 → 指令 → 运行时 → 硅芯片
如果不能妥善处理这些环节,你的GPU就会变成一个非常昂贵的取暖器
——来自我即将发布的关于内核、硬件和模型的文章
相似文章
@asmah2107: 给所有询问推理工程应该构建什么的人:> 推理服务器(C++/Rust)> 分页KV缓存(如vLL…
一条推文列出了在推理工程中应构建的关键项目,以理解生产级LLM系统,包括推理服务器、分页KV缓存、推测解码、量化库和防护措施。
AI推理工程指南(阅读时间约17分钟)
本指南解释了AI推理工程这一学科,涵盖了预填充和解码阶段的划分、从封闭模型到开放模型的转变,以及针对延迟、吞吐量和成本的优化技术。
@TheAhmadOsman: 你并不是在“运行模型”,你运行的是内核。模型只是一个图,推理引擎是调度器/优化器/执行器…
这条推文解释了运行AI模型实际上是运行优化的内核,推理引擎及其内核实现对于性能至关重要,而不仅仅是模型或硬件。
@harshbhatt7585: 我看到每个人都在学习推理工程。推理工程可能是当前AI领域最重要的工作之一。
推理工程正成为AI领域最重要的工作之一,职位发布同比增长163%,平均年薪约25万美元。
@suraj_sharma14:如果你想精通推理工程,这个资源是一座金矿:https://github.com/elizabetht/10…
一个GitHub仓库,提供结构化的100天LLM推理工程学习计划,涵盖从CUDA内核到自动扩展的主题,并配有可运行的脚本。