inference-engineering

标签

Cards List
#inference-engineering

突破 DeepSeek-V4-Pro 服务极限(28分钟阅读时间)

TLDR AI · 23小时前 缓存

本文介绍了一种优化 DeepSeek-V4-Pro(一个1.6万亿参数的 MoE 模型)在 H20 GPU 上服务的方法,通过场景特定的配置和优化实现了显著的性能提升。

0 人收藏 0 人点赞
#inference-engineering

@asmah2107: 给所有询问推理工程应该构建什么的人:> 推理服务器(C++/Rust)> 分页KV缓存(如vLL…

X AI KOLs Timeline · 2026-07-20 缓存

一条推文列出了在推理工程中应构建的关键项目,以理解生产级LLM系统,包括推理服务器、分页KV缓存、推测解码、量化库和防护措施。

0 人收藏 0 人点赞
#inference-engineering

@askalphaxiv:GPT 5.6 Sol 可以将 arXiv 论文一次转换为交互式 Marimo 笔记本!非常适合通过动手操作来理解的论文…

X AI KOLs Timeline · 2026-07-14 缓存

GPT 5.6 Sol 可以将 arXiv 论文一次转换为交互式 Marimo 笔记本,有助于通过动手操作理解可解释性、推理工程等领域的论文。

0 人收藏 0 人点赞
#inference-engineering

@maxxfuu: 推理工程第6/90天 我写了一个用于一维卷积的CUDA内核,只是为了练习写未优化的……

X AI KOLs Timeline · 2026-07-12 缓存

一位开发者分享了他们在推理工程的第6天,编写了一个用于一维卷积的CUDA内核,解释了PagedAttention的内存效率,并概述了GPU内存层次结构(全局、寄存器、本地、常量、共享)。

0 人收藏 0 人点赞
#inference-engineering

@prateek_0041:顺便说一下,我正转向推理工程。花了不少时间学习架构、实现LLM……

X AI KOLs Timeline · 2026-06-28 缓存

用户宣布职业转向推理工程,并提到有LLM架构和注意力机制方面的经验。

0 人收藏 0 人点赞
#inference-engineering

@barrowjoseph: 我对 @philipkiely 的《Inference Engineering》的完整评测。TL;DR: 我非常希望我能把这本书寄回给过去的自己……

X AI KOLs Timeline · 2026-06-17 缓存

对 Philip Kiely 所著《Inference Engineering》的评测,推荐阅读以避免在 AI 推理工程中常见的错误。

0 人收藏 0 人点赞
#inference-engineering

AI推理工程指南(阅读时间约17分钟)

TLDR AI · 2026-06-16 缓存

本指南解释了AI推理工程这一学科,涵盖了预填充和解码阶段的划分、从封闭模型到开放模型的转变,以及针对延迟、吞吐量和成本的优化技术。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈