inference-engine

标签

Cards List
#inference-engine

llama.cpp

Hacker News Top · 4小时前 缓存

本文介绍了 llama.cpp 的官方主页,这是一个开源的本地 LLM 推理引擎,重点介绍了通过 pi-llama 插件与 Pi 编码代理的集成以及广泛的硬件优化。

0 人收藏 0 人点赞
#inference-engine

Antirez/h3.c: 面向 Mac 电脑的 MiniMax H3 推理引擎

Hacker News Top · 昨天 缓存

Antirez 的 h3.c 是面向 Apple Silicon 的 MiniMax-H3 原生极简推理引擎,提供快速、端到端的提示词到视频/音频管线,并带有 Metal 优化和交互式会话。目前专注于 M3 Max 和 M5 Max 的性能和内存优化。

0 人收藏 0 人点赞
#inference-engine

@mohitwt_: 推理工程第20/30天:构建一个推测解码运行时,用较小的模型提前草拟多个token…

X AI KOLs Following · 4天前 缓存

一位开发者正在构建Octane,这是一个面向消费级硬件上的本地LLM推理的推测解码运行时,目标是实现2-3倍的加速,同时保持完全相同的输出质量。目前处于积极开发阶段,已实现分页KV缓存、连续批处理和批量注意力。

0 人收藏 0 人点赞
#inference-engine

@akshay_pachaar:重大突破!自托管LLM的成本刚刚降低了约75%:大多数Agent流水线现在在底层运行4-5个小模型……

X AI KOLs Timeline · 6天前 缓存

Superlinked发布了SIE,一个开源推理引擎,通过一个API提供85+个模型,支持按需加载和LRU逐出,为Agent流水线节省约75%的自托管GPU成本。

0 人收藏 0 人点赞
#inference-engine

构建一个媲美 Llama.cpp 的 Rust 推理引擎

Hacker News Top · 2026-08-05 缓存

Ferrox 是一个纯 Rust 推理引擎,可加载 GGUF 模型,并在 CPU、Metal 或 CUDA 上运行本地 LLM,提供 CLI 和兼容 OpenAI 的服务器。它的目标是在不使用任何绑定、从零编写的情况下,达到与 llama.cpp 相当的性能。

0 人收藏 0 人点赞
#inference-engine

@vikhyatk: 厌倦了手动调优GPU内核,所以我们构建了一个编译器。Photon 2.0 将 Moondream、Qwen 3.5 和 Gemma 4 编译成……

X AI KOLs Timeline · 2026-08-03 缓存

Photon 2.0 是一个新的推理引擎和编译器,可将 Moondream、Qwen 3.5 和 Gemma 4 等模型编译为巨型内核,声称在物理AI工作负载上比 vLLM 和 SGLang 的吞吐量高达 2.3 倍。

0 人收藏 0 人点赞
#inference-engine

为什么我们要编写自己的C和C++推理引擎

Lobsters Hottest · 2026-07-31 缓存

LocalAI 解释了为什么它要编写自己的 C/C++ 推理后端,并展示了其 vllm.cpp 移植版本在多个模型和硬件上的基准测试中,能够实现与 vLLM 相当或更高的吞吐量,同时占用空间远小于 vLLM。

0 人收藏 0 人点赞
#inference-engine

使用29 GB内存以0.50 tok/s运行Kimi K3

Hacker News Top · 2026-07-31 缓存

WASTE是一个新的开源C语言推理引擎,它从磁盘流式加载专家权重,在仅29 GB内存的消费级笔记本电脑上运行拥有2.78万亿参数的Kimi K3模型,实现了0.49–0.54 tokens/s的速度。

0 人收藏 0 人点赞
#inference-engine

Autoregressive Language Model on the 6502 Processor

Hacker News Top · 2026-07-31 缓存

A developer trained a tiny Mamba-based autoregressive language model and built an inference engine to run it on the 6502 processor inside a BBC Micro, demonstrating modern machine learning on 1975 hardware with only 25KB of user memory.

0 人收藏 0 人点赞
#inference-engine

WASTE 推理引擎(14 分钟阅读)

TLDR AI · 2026-07-31 缓存

WASTE 是一个开源推理引擎,通过将专家权重存储在 NVMe 上,运行比主机可用内存大得多的模型。它展示了在配备 64GB 统一内存的 MacBook Pro 上运行 Kimi K3(一个 2.78T 参数的 MoE 模型)的能力。

0 人收藏 0 人点赞
#inference-engine

K3 部署的推理引擎指南(10 分钟阅读)

TLDR AI · 2026-07-29 缓存

Kimi K3 是一个 2.8 万亿参数的多模态 MoE 模型,具有 100 万 token 的上下文窗口,现已获得 vLLM 的 day-0 支持。本指南详细介绍了 vLLM 如何服务于 K3 的新颖架构,包括 Kimi Delta Attention、Attention Residuals 以及推测解码,最高可达 370 tok/s。

0 人收藏 0 人点赞
#inference-engine

@akshay_pachaar: 无服务器 vs 本地部署 vs 边缘部署。(下次部署前必读)这三种方式是对同一个问题……

X AI KOLs Following · 2026-07-28 缓存

本文比较了无服务器、本地和边缘部署三种 AI 模型部署方式,指出了当前多模型服务中的低效问题。它介绍了 Superlinked Inference Engine (SIE),一个开源工具,通过动态加载和卸载权重,在单个 GPU 上服务多个模型,旨在降低成本和复杂性。

0 人收藏 0 人点赞
#inference-engine

RIS-Kernel:一种通过稀疏注意力实现长上下文LLM推理的模型无关架构

arXiv cs.LG · 2026-07-27 缓存

RIS-Kernel 提出了一种模型无关的稀疏注意力架构(RIS),将长上下文 LLM 推理中的自注意力复杂度从 O(N^2) 降低到 O(N log N),使得无需 GPU 加速即可在普通 CPU 硬件上运行。

0 人收藏 0 人点赞
#inference-engine

花了两周时间写了个内核,基准测试快了29倍。但端到端可能只有6-10%,而且还没接进去。

Reddit r/LocalLLaMA · 2026-07-24

作者优化了BitNet三值模型在CPU上的矩阵乘法内核,单独测试实现了29倍加速,但发现模型是内存密集型,端到端仅提升6-10%。推理引擎已开源。

0 人收藏 0 人点赞
#inference-engine

用纯C语言从零构建了一个BitNet推理引擎——在Xeon上比bitnet.cpp快1.8倍(36 tok/s),零依赖 [招募BitNet和Bonsai CPU测试者]

Reddit r/LocalLLaMA · 2026-07-22

Project Zero 是一个从零构建的 C99 LLM推理引擎,可在 CPU 上运行 BitNet 与 Qwen Bonsai-27B,拥有零外部依赖,在 Xeon 上相比 bitnet.cpp 实现 1.8 倍加速。该项目诚邀社区为这两种模型提供基准测试结果。

0 人收藏 0 人点赞
#inference-engine

@QuixiAI: QuixiAI/embeddinggemma.c - 极速跨平台嵌入推理引擎。用C编写,可随处运行。推理…

X AI KOLs Following · 2026-07-20 缓存

QuixiAI发布embeddinggemma.c,一个用C编写的快速跨平台嵌入推理引擎,支持多种后端(CPU、Metal、CUDA、ROCm、SYCL)以及Matryoshka嵌入,并提供标准HTTP API。

0 人收藏 0 人点赞
#inference-engine

@no_stp_on_snek: 推理引擎本身能否改变模型的行为?运行了两个相同基础模型的量化和推测解码堆栈…

X AI KOLs Following · 2026-07-14 缓存

一位开发者比较了两个推理栈(生产构建 vs SignalNine的q27)在同一个Qwen模型上的表现,发现它们在压力下产生了不同的诚实度:一个虚构进展,另一个适当拒绝,表明推理引擎可以影响模型行为,超越速度和质量的度量。

0 人收藏 0 人点赞
#inference-engine

moondream3.1-9B-A2B

Reddit r/LocalLLaMA · 2026-07-12 缓存

Moondream 3.1 是一款采用混合专家架构的视觉语言模型(总参数量9B,激活参数量2B),提供最先进的视觉推理、检测、指点和描述功能,可通过 Photon 推理引擎本地部署,或通过 Moondream Cloud API 使用。

0 人收藏 0 人点赞
#inference-engine

@jino_rohit:在过去的6到8个月里,我一直尝试转向机器学习系统和AI基础设施领域。以下是我最喜欢的一些…

X AI KOLs Timeline · 2026-07-11 缓存

作者分享了他们在过去6-8个月里在ML系统和AI基础设施方面的工作,包括一个轻量级的Python LLM推理引擎(tachyon),在消费级硬件上通过连续批处理和前缀缓存实现了每秒600+ tokens,还有关于CUDA/CUTE DSL和集体通信的博客文章,以及对SGLang和vLLM的贡献。

0 人收藏 0 人点赞
#inference-engine

@JiaZhihao: 激动分享 Lithos 为 Kimi K2.7 Code 提供的服务栈,这是一个拥有1万亿参数的前沿编码模型。

X AI KOLs Timeline · 2026-07-10 缓存

Lithos 宣布其推理引擎服务 Kimi K2.7 Code,在单个8×B200节点上以原生精度实现每个用户每秒超过1000 token,速度比主流提供商快3.4-5.7倍。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈