inference-engine

标签

Cards List
#inference-engine

RIS-Kernel:一种通过稀疏注意力实现长上下文LLM推理的模型无关架构

arXiv cs.LG ↗ · 2026-07-27 缓存

RIS-Kernel 提出了一种模型无关的稀疏注意力架构(RIS),将长上下文 LLM 推理中的自注意力复杂度从 O(N^2) 降低到 O(N log N),使得无需 GPU 加速即可在普通 CPU 硬件上运行。

0 人收藏 0 人点赞
#inference-engine

花了两周时间写了个内核,基准测试快了29倍。但端到端可能只有6-10%,而且还没接进去。

Reddit r/LocalLLaMA ↗ · 2026-07-24

作者优化了BitNet三值模型在CPU上的矩阵乘法内核,单独测试实现了29倍加速,但发现模型是内存密集型,端到端仅提升6-10%。推理引擎已开源。

0 人收藏 0 人点赞
#inference-engine

用纯C语言从零构建了一个BitNet推理引擎——在Xeon上比bitnet.cpp快1.8倍(36 tok/s),零依赖 [招募BitNet和Bonsai CPU测试者]

Reddit r/LocalLLaMA ↗ · 2026-07-22

Project Zero 是一个从零构建的 C99 LLM推理引擎,可在 CPU 上运行 BitNet 与 Qwen Bonsai-27B,拥有零外部依赖,在 Xeon 上相比 bitnet.cpp 实现 1.8 倍加速。该项目诚邀社区为这两种模型提供基准测试结果。

0 人收藏 0 人点赞
#inference-engine

@QuixiAI: QuixiAI/embeddinggemma.c - 极速跨平台嵌入推理引擎。用C编写,可随处运行。推理…

X AI KOLs Following ↗ · 2026-07-20 缓存

QuixiAI发布embeddinggemma.c,一个用C编写的快速跨平台嵌入推理引擎,支持多种后端(CPU、Metal、CUDA、ROCm、SYCL)以及Matryoshka嵌入,并提供标准HTTP API。

0 人收藏 0 人点赞
#inference-engine

@no_stp_on_snek: 推理引擎本身能否改变模型的行为?运行了两个相同基础模型的量化和推测解码堆栈…

X AI KOLs Following ↗ · 2026-07-14 缓存

一位开发者比较了两个推理栈(生产构建 vs SignalNine的q27)在同一个Qwen模型上的表现,发现它们在压力下产生了不同的诚实度:一个虚构进展,另一个适当拒绝,表明推理引擎可以影响模型行为,超越速度和质量的度量。

0 人收藏 0 人点赞
#inference-engine

moondream3.1-9B-A2B

Reddit r/LocalLLaMA ↗ · 2026-07-12 缓存

Moondream 3.1 是一款采用混合专家架构的视觉语言模型(总参数量9B,激活参数量2B),提供最先进的视觉推理、检测、指点和描述功能,可通过 Photon 推理引擎本地部署,或通过 Moondream Cloud API 使用。

0 人收藏 0 人点赞
#inference-engine

@jino_rohit:在过去的6到8个月里,我一直尝试转向机器学习系统和AI基础设施领域。以下是我最喜欢的一些…

X AI KOLs Timeline ↗ · 2026-07-11 缓存

作者分享了他们在过去6-8个月里在ML系统和AI基础设施方面的工作,包括一个轻量级的Python LLM推理引擎(tachyon),在消费级硬件上通过连续批处理和前缀缓存实现了每秒600+ tokens,还有关于CUDA/CUTE DSL和集体通信的博客文章,以及对SGLang和vLLM的贡献。

0 人收藏 0 人点赞
#inference-engine

@JiaZhihao: 激动分享 Lithos 为 Kimi K2.7 Code 提供的服务栈,这是一个拥有1万亿参数的前沿编码模型。

X AI KOLs Timeline ↗ · 2026-07-10 缓存

Lithos 宣布其推理引擎服务 Kimi K2.7 Code,在单个8×B200节点上以原生精度实现每个用户每秒超过1000 token,速度比主流提供商快3.4-5.7倍。

0 人收藏 0 人点赞
#inference-engine

@yibie: 推荐这个项目,一个人用纯 C 写了一个推理引擎,让 7440 亿参数的 GLM-5.2 在 25GB 内存的消费级机器上跑起来。没有 GPU,没有 BLAS,没有 Python 运行时——约 1300 行 C 代码。核心洞察很简单:MoE…

X AI KOLs Timeline ↗ · 2026-07-10 缓存

Colibri 是一个纯 C 编写的推理引擎,约 1300 行代码,零依赖,能在 25GB 内存的消费级机器上运行 7440 亿参数的 GLM-5.2 MoE 模型,通过流式加载路由专家和高效缓存实现,无需 GPU 或 Python 运行时。

0 人收藏 0 人点赞
#inference-engine

TensorSharp : 开源本地LLM推理引擎

Reddit r/ArtificialInteligence ↗ · 2026-07-04 缓存

TensorSharp是一个开源的.NET库,用于在本地运行LLM推理,支持GGUF模型,并提供CLI、Web聊天机器人和兼容OpenAI的API,支持多种后端选项(CUDA、Metal、CPU)。

0 人收藏 0 人点赞
#inference-engine

@mgoin_: 今天我从 vLLM 中删除了 PagedAttention

X AI KOLs Timeline ↗ · 2026-07-02 缓存

Michael Goin 宣布从 vLLM 中移除 PagedAttention,这是对开源 LLM 推理引擎的一项重大改变。

0 人收藏 0 人点赞
#inference-engine

打破 GPU 气泡

Hacker News Top ↗ · 2026-06-30 缓存

Moondream 的 Photon 推理引擎通过流水线解码消除了 GPU 气泡,实现了近乎实时的 VLM 推理,解码吞吐量提升高达 35%。

0 人收藏 0 人点赞
#inference-engine

@SuJinYan123:仅在DeepSeek开源Qwen DSpark权重6小时后,OpenInfer就已经在RTX 5…上支持DSpark运行

X AI KOLs Timeline ↗ · 2026-06-28 缓存

OpenInfer,一个纯粹的Rust+CUDA LLM推理引擎,快速添加了对DeepSeek的DSpark投机解码技术在RTX 5090上的支持,实现了每个用户近500 tok/s,并扩展至约2.4K聚合tok/s,在非随机工作负载上优于DFlash。

0 人收藏 0 人点赞
#inference-engine

一个纯C从头编写的、仅支持CPU的Qwen 3精简推理引擎

Reddit r/LocalLLaMA ↗ · 2026-06-28

一个纯C从头实现的、仅支持CPU的Qwen 3模型最小推理引擎

0 人收藏 0 人点赞
#inference-engine

@yoheinakajima:谁想帮Eyal在这个方法上挑毛病——在浏览器中运行LLM推理?

X AI KOLs Following ↗ · 2026-06-25 缓存

Eyal Toledano 使用纯 WebGPU/WGSL 构建了一个LLM推理引擎,可在浏览器和Node中无API密钥地本地运行,并正寻求同行评审。

0 人收藏 0 人点赞
#inference-engine

@songhan_mit: 我们开发了一种基于智能体的原生方法来加速生成式AI,延续了KDA(内核设计智能体)在更高层次上的成功…

X AI KOLs Following ↗ · 2026-06-25 缓存

Enze Xie 宣布推出 Sol Video Inference Engine,这是一个基于智能体的原生、无需训练的全栈加速器,用于视频扩散,能够自动调整缓存、稀疏注意力、令牌剪枝、量化和内核融合,在像 64B Cosmos3-Super 和 22B LTX-2.3 这样的大模型上实现了 >2 倍的端到端加速。

0 人收藏 0 人点赞
#inference-engine

@Mayhem4Markets: https://x.com/Mayhem4Markets/status/2069090022117019928

X AI KOLs Following ↗ · 2026-06-22 缓存

两大主流LLM服务框架SGLang和vLLM的详细技术对比,涵盖KV缓存管理(RadixAttention vs PagedAttention)的架构差异、吞吐量、延迟以及自托管环境的部署考量。

0 人收藏 0 人点赞
#inference-engine

@QuixiAI: https://x.com/QuixiAI/status/2068776183102067086

X AI KOLs Following ↗ · 2026-06-21 缓存

DwarfStar 是一个自包含的原生推理引擎,专为 DeepSeek V4 Flash 和 PRO 模型优化,支持 Metal、CUDA 和 ROCm 后端,专注于高端个人电脑和 Mac Studio。

0 人收藏 0 人点赞
#inference-engine

@h100envy: Ying Sheng 共同撰写了 SGLang,该推理引擎现在在 xAI 上为 Grok 服务,运行在十万个 GPU 上。她还构建了 Fle…

X AI KOLs Timeline ↗ · 2026-06-19 缓存

Ying Sheng 共同撰写了 SGLang,该推理引擎现在在 xAI 上用十万个 GPU 为 Grok 服务,相比 DeepSeek 的 API 实现了 5 倍的成本削减;她还构建了 FlexGen,并参与构建了 Chatbot Arena。

0 人收藏 0 人点赞
#inference-engine

GPU上的无畏并发:在Rust中进行安全的GPU推理,与vLLM/SGLang竞争 [R]

Reddit r/MachineLearning ↗ · 2026-06-18

cuTile Rust 引入了一种基于块(tile)的编程模型,利用 Rust 的所有权机制来保证 GPU 内核的内存安全和无数据竞争,基于该模型构建的 Grout 推理引擎在 Qwen3 模型上实现了与 vLLM/SGLang 相当的吞吐量。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈