@prateek_0041:顺便说一下,我正转向推理工程。花了不少时间学习架构、实现LLM……
摘要
用户宣布职业转向推理工程,并提到有LLM架构和注意力机制方面的经验。
顺便说一下,我正转向推理工程。已经花了不少时间学习架构、实现LLM、阅读关于不同注意力机制的书籍,以及了解著名模型的工作原理、优化方法等等。也做了一些vLLM和LLMD的工作。但现在,我要正式全面投入了。
6个月的时间线。
查看缓存全文
缓存时间: 2026/06/28 20:15
顺便说一下,我正在转向推理工程。我已经花了大量时间学习架构、实现大语言模型(LLM)、阅读关于不同注意力机制的书籍,以及了解著名模型如何工作/优化等。也接触了一些 vLLM 和 LLMD 相关的实践。但现在,我要全力以赴,正式开始了。
计划用 6 个月的时间。
相似文章
@pallavishekhar_: 学习LLM推理工程 - Prefill vs Decode - KV Cache - PagedAttention - Flash Attention - Continuous Batching…
LLM推理工程关键概念的教育概述,涵盖KV cache、PagedAttention、Flash Attention和连续批处理等技术,以优化推理性能。
@asmah2107: 给所有询问推理工程应该构建什么的人:> 推理服务器(C++/Rust)> 分页KV缓存(如vLL…
一条推文列出了在推理工程中应构建的关键项目,以理解生产级LLM系统,包括推理服务器、分页KV缓存、推测解码、量化库和防护措施。
@suraj_sharma14:如果你想精通推理工程,这个资源是一座金矿:https://github.com/elizabetht/10…
一个GitHub仓库,提供结构化的100天LLM推理工程学习计划,涵盖从CUDA内核到自动扩展的主题,并配有可运行的脚本。
@divaagurlxw: 我花了几个月时间学习 LLM 推理。以下是我遇到过的最佳资源。1. 基础……
一条推文串分享了一份精心挑选的 LLM 推理学习资源清单,涵盖分词、GPU 硬件、量化与推测解码等优化技术,以及 vLLM 和 SGLang 等推理引擎,并附有 NVIDIA 架构师演讲的总结。
@jino_rohit:在过去的6到8个月里,我一直尝试转向机器学习系统和AI基础设施领域。以下是我最喜欢的一些…
作者分享了他们在过去6-8个月里在ML系统和AI基础设施方面的工作,包括一个轻量级的Python LLM推理引擎(tachyon),在消费级硬件上通过连续批处理和前缀缓存实现了每秒600+ tokens,还有关于CUDA/CUTE DSL和集体通信的博客文章,以及对SGLang和vLLM的贡献。