标签
本文介绍了一种优化 DeepSeek-V4-Pro(一个1.6万亿参数的 MoE 模型)在 H20 GPU 上服务的方法,通过场景特定的配置和优化实现了显著的性能提升。
一条推文列出了在推理工程中应构建的关键项目,以理解生产级LLM系统,包括推理服务器、分页KV缓存、推测解码、量化库和防护措施。
GPT 5.6 Sol 可以将 arXiv 论文一次转换为交互式 Marimo 笔记本,有助于通过动手操作理解可解释性、推理工程等领域的论文。
一位开发者分享了他们在推理工程的第6天,编写了一个用于一维卷积的CUDA内核,解释了PagedAttention的内存效率,并概述了GPU内存层次结构(全局、寄存器、本地、常量、共享)。
用户宣布职业转向推理工程,并提到有LLM架构和注意力机制方面的经验。
对 Philip Kiely 所著《Inference Engineering》的评测,推荐阅读以避免在 AI 推理工程中常见的错误。
本指南解释了AI推理工程这一学科,涵盖了预填充和解码阶段的划分、从封闭模型到开放模型的转变,以及针对延迟、吞吐量和成本的优化技术。