inference-engine

标签

Cards List
#inference-engine

GPU上的无畏并发:在Rust中进行安全的GPU推理,与vLLM/SGLang竞争 [R]

Reddit r/MachineLearning ↗ · 2026-06-18

cuTile Rust 引入了一种基于块(tile)的编程模型,利用 Rust 的所有权机制来保证 GPU 内核的内存安全和无数据竞争,基于该模型构建的 Grout 推理引擎在 Qwen3 模型上实现了与 vLLM/SGLang 相当的吞吐量。

0 人收藏 0 人点赞
#inference-engine

@ProfBuehlerMIT: 对于科学而言,AI主权和基于物理的推理是不可妥协的。但如何教像Ge…这样的小型LLM呢?

X AI KOLs Timeline ↗ · 2026-06-18 缓存

mistral.rs 现已原生支持 Agent Skills,使本地运行的小型LLM能够执行复杂的科学任务代理工作流,并完全控制模型、数据和执行。

0 人收藏 0 人点赞
#inference-engine

@no_stp_on_snek: 我的第二个且迟交的 Build Small 参赛作品。10天,1位开发者:从头构建的 Rust 引擎 + 自定义 GPU 内核 vs vLLM 在 N…

X AI KOLs Following ↗ · 2026-06-15 缓存

一位开发者从头构建了一个 Rust 推理引擎,带有自定义 GPU 内核,在 Nemotron-30B 解码上优于 vLLM,达到 75.7 vs 57 tok/s,提交至 Build Small 黑客马拉松。

0 人收藏 0 人点赞
#inference-engine

@frank_uid: 最近在学Infra的东西,vibe了一个Qwen3的推理引擎,纯c++/cuda实现,带hf模型解析和benchmark总共不到2000行,完全无外部依赖,编译出来二进制只有1.2MB(Claude写kernel太猛了

X AI KOLs Timeline ↗ · 2026-06-13 缓存

FlashQwen is a minimal from-scratch C++/CUDA inference engine for Qwen3-8B with no external dependencies, supporting multi-turn streaming chat and benchmark mode, with a binary size of only 1.2MB.

0 人收藏 0 人点赞
#inference-engine

@TheAhmadOsman: 你并不是在“运行模型”,你运行的是内核。模型只是一个图,推理引擎是调度器/优化器/执行器…

X AI KOLs Following ↗ · 2026-06-06 缓存

这条推文解释了运行AI模型实际上是运行优化的内核,推理引擎及其内核实现对于性能至关重要,而不仅仅是模型或硬件。

0 人收藏 0 人点赞
#inference-engine

Sage 发布!本地AI推理引擎

Reddit r/AI_Agents ↗ · 2026-06-02

Sage 是一款用Rust构建的本地AI推理引擎,完全在用户本机上运行,具备内核级沙箱安全,无遥测,无云依赖。

0 人收藏 0 人点赞
#inference-engine

TRINE:一种面向多模态AI的令牌感知、运行时自适应FPGA推理引擎

arXiv cs.AI ↗ · 2026-06-01 缓存

TRINE是一款单比特流FPGA加速器与编译器,用于端到端多模态推理,统一了多种层类型,并集成了运行时自适应计算模式、令牌剪枝和依赖感知的卸载功能,在20-21W功耗下相比RTX 4090实现最高22.57倍的延迟降低。

0 人收藏 0 人点赞
#inference-engine

@vllm_project: vLLM v0.22.0 发布了!来自 230 位贡献者(63 位新人)的 459 次提交。亮点:DeepSeek V4 加固(NVFP4 融合 MoE,fu…

X AI KOLs Timeline ↗ · 2026-05-30 缓存

vLLM v0.22.0 发布,包含 459 次提交,主要特点包括 DeepSeek V4 加固、实验性 Rust 前端、以及批次不变的 Cutlass FP8,端到端延迟降低 28.9%。

0 人收藏 0 人点赞
#inference-engine

Show HN: Tiny-vLLM – 使用C++和CUDA的高性能LLM推理引擎

Hacker News Top ↗ · 2026-05-29 缓存

Tiny-vLLM是一个高性能的LLM推理引擎,采用C++和CUDA实现,提供连续批处理和PagedAttention等特性,并作为教育资源。

1 人收藏 1 人点赞
#inference-engine

构建 Conifer:一款开源本地推理运行时(免费 + 开源)

Reddit r/artificial ↗ · 2026-05-25

Conifer 是由普林斯顿团队打造的全新开源本地推理运行时,针对 Apple Silicon 优化并采用自定义 Rust 内核。其目标是在小型模型上超越 llama.cpp 和 MLX,支持具有操作系统级权限执行的完全本地化智能体,目前进入限 100 人测试阶段。

0 人收藏 0 人点赞
#inference-engine

@zhyncs42: Qwen推理团队非常棒——他们在TokenSpeed上针对智能体工作负载实现了540 TPS,期待他们...

X AI KOLs Timeline ↗ · 2026-05-24 缓存

Qwen推理团队宣布了TokenSpeed,这是一个针对智能体工作负载的高性能LLM推理引擎,实现了540 TPS,并提供开源预览版。

0 人收藏 0 人点赞
#inference-engine

MLX引擎对比…oMLX是最佳选择。

Reddit r/LocalLLaMA ↗ · 2026-05-18

一篇博客文章,对比了MLX推理引擎,结论是oMLX是最佳选择,评测在M5 Max 64GB上使用Qwen3.6-35B-A3B-4bit。

0 人收藏 0 人点赞
#inference-engine

@augmind_fm: 交互模型给AI推理引擎带来了新的挑战。我们与@woosuk在节目中讨论了这一点…

X AI KOLs Following ↗ · 2026-05-14 缓存

本文讨论了交互模型如何给AI推理引擎带来新挑战,重点介绍了vLLM项目的解决方案,该方案在Woosuk Kwon参与的播客中有所涉及。

0 人收藏 0 人点赞
#inference-engine

@VincentLogic: 发现个炸裂的开源项目!Redis 之父 antirez 亲自下场搞了个大新闻! ds4 —— DeepSeek V4 Flash 本地推理引擎,专为 Mac Metal 优化,连续霸榜 GitHub 好几天! 最狠的地方来了: 128GB…

X AI KOLs Timeline ↗ · 2026-05-13

Redis 之父 antirez 发布了名为 ds4 的开源项目,是专为 Mac Metal 优化的 DeepSeek V4 Flash 本地推理引擎,支持磁盘 KV 缓存、超长上下文,性能优异。

0 人收藏 0 人点赞
#inference-engine

server, webui: 支持在推理模型上继续生成,由 ServeurpersoCom · 拉取请求 #22727 · ggml-org/llama.cpp

Reddit r/LocalLLaMA ↗ · 2026-05-13 缓存

此拉取请求在 llama.cpp 服务器和 WebUI 中添加了对推理模型继续生成的支持。

0 人收藏 0 人点赞
#inference-engine

@PandaTalk8: 这个测试效果太惊艳了。 原贴作者测试了 @antirez 刚刚用 C 写的 DS4 推理引擎,本地部署效果看起来非常快。 好消息时只需要128G内存就可以跑一个相当于gpt-4o 本地模型。 坏消息时需要128G 的Mac book pr…

X AI KOLs Timeline ↗ · 2026-05-10 缓存

该文章报道了对 @antirez 使用 C 语言编写的 DS4 推理引擎的测试,指出其在 128G 内存的 MacBook Pro 上运行等效于 GPT-4o 的模型时速度惊人。

0 人收藏 0 人点赞
#inference-engine

@QingQ77: 用纯 Rust 实现 LLM 推理引擎,针对每种硬件×模型×量化组合定制 CUDA 内核,跑出比 vLLM 和 TensorRT-LLM 更高的推理速度。 https://github.com/Avarok-Cybersecurity/a…

X AI KOLs Timeline ↗ · 2026-05-08 缓存

Atlas 是一个纯 Rust 实现的 LLM 推理引擎,通过为每种硬件×模型×量化组合定制 CUDA 内核,实现了比 vLLM 和 TensorRT-LLM 更快的推理速度。

0 人收藏 0 人点赞
#inference-engine

特性:AesSedai 为 llama.cpp 添加 Mimo v2.5 模型支持 · 拉取请求 #22493 · ggml-org/llama.cpp

Reddit r/LocalLLaMA ↗ · 2026-05-07 缓存

一个拉取请求已合并到 llama.cpp 中,用于添加对 Mimo v2.5 模型的支持,增强了该框架对此特定 AI 架构的兼容性。

0 人收藏 0 人点赞
#inference-engine

vLLM V0 到 V1:在 RL 中先保正确性,再谈修正

Hugging Face Blog ↗ · 2026-05-06 缓存

ServiceNow 工程师详细介绍了他们从 vLLM V0 迁移到 V1 的过程,重点解决了后端正确性问题,包括 logprob 语义和运行时默认值,以确保强化学习训练动态的稳定。

0 人收藏 0 人点赞
#inference-engine

antirez/deepseek-v4-gguf

Hugging Face Models Trending ↗ · 2026-04-26 缓存

Antirez发布了专门为DS4推理引擎优化的DeepSeek V4 Flash GGUF量化版本,针对不同内存大小提供了优化配置,使得这个大型MoE模型可以在本地运行。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈