inference-engine

标签

Cards List
#inference-engine

构建 Conifer:一款开源本地推理运行时(免费 + 开源)

Reddit r/artificial · 2026-05-25

Conifer 是由普林斯顿团队打造的全新开源本地推理运行时,针对 Apple Silicon 优化并采用自定义 Rust 内核。其目标是在小型模型上超越 llama.cpp 和 MLX,支持具有操作系统级权限执行的完全本地化智能体,目前进入限 100 人测试阶段。

0 人收藏 0 人点赞
#inference-engine

@zhyncs42: Qwen推理团队非常棒——他们在TokenSpeed上针对智能体工作负载实现了540 TPS,期待他们...

X AI KOLs Timeline · 2026-05-24 缓存

Qwen推理团队宣布了TokenSpeed,这是一个针对智能体工作负载的高性能LLM推理引擎,实现了540 TPS,并提供开源预览版。

0 人收藏 0 人点赞
#inference-engine

MLX引擎对比…oMLX是最佳选择。

Reddit r/LocalLLaMA · 2026-05-18

一篇博客文章,对比了MLX推理引擎,结论是oMLX是最佳选择,评测在M5 Max 64GB上使用Qwen3.6-35B-A3B-4bit。

0 人收藏 0 人点赞
#inference-engine

@augmind_fm: 交互模型给AI推理引擎带来了新的挑战。我们与@woosuk在节目中讨论了这一点…

X AI KOLs Following · 2026-05-14 缓存

本文讨论了交互模型如何给AI推理引擎带来新挑战,重点介绍了vLLM项目的解决方案,该方案在Woosuk Kwon参与的播客中有所涉及。

0 人收藏 0 人点赞
#inference-engine

@VincentLogic: 发现个炸裂的开源项目!Redis 之父 antirez 亲自下场搞了个大新闻! ds4 —— DeepSeek V4 Flash 本地推理引擎,专为 Mac Metal 优化,连续霸榜 GitHub 好几天! 最狠的地方来了: 128GB…

X AI KOLs Timeline · 2026-05-13

Redis 之父 antirez 发布了名为 ds4 的开源项目,是专为 Mac Metal 优化的 DeepSeek V4 Flash 本地推理引擎,支持磁盘 KV 缓存、超长上下文,性能优异。

0 人收藏 0 人点赞
#inference-engine

server, webui: 支持在推理模型上继续生成,由 ServeurpersoCom · 拉取请求 #22727 · ggml-org/llama.cpp

Reddit r/LocalLLaMA · 2026-05-13 缓存

此拉取请求在 llama.cpp 服务器和 WebUI 中添加了对推理模型继续生成的支持。

0 人收藏 0 人点赞
#inference-engine

@PandaTalk8: 这个测试效果太惊艳了。 原贴作者测试了 @antirez 刚刚用 C 写的 DS4 推理引擎,本地部署效果看起来非常快。 好消息时只需要128G内存就可以跑一个相当于gpt-4o 本地模型。 坏消息时需要128G 的Mac book pr…

X AI KOLs Timeline · 2026-05-10 缓存

该文章报道了对 @antirez 使用 C 语言编写的 DS4 推理引擎的测试,指出其在 128G 内存的 MacBook Pro 上运行等效于 GPT-4o 的模型时速度惊人。

0 人收藏 0 人点赞
#inference-engine

@QingQ77: 用纯 Rust 实现 LLM 推理引擎,针对每种硬件×模型×量化组合定制 CUDA 内核,跑出比 vLLM 和 TensorRT-LLM 更高的推理速度。 https://github.com/Avarok-Cybersecurity/a…

X AI KOLs Timeline · 2026-05-08 缓存

Atlas 是一个纯 Rust 实现的 LLM 推理引擎,通过为每种硬件×模型×量化组合定制 CUDA 内核,实现了比 vLLM 和 TensorRT-LLM 更快的推理速度。

0 人收藏 0 人点赞
#inference-engine

特性:AesSedai 为 llama.cpp 添加 Mimo v2.5 模型支持 · 拉取请求 #22493 · ggml-org/llama.cpp

Reddit r/LocalLLaMA · 2026-05-07 缓存

一个拉取请求已合并到 llama.cpp 中,用于添加对 Mimo v2.5 模型的支持,增强了该框架对此特定 AI 架构的兼容性。

0 人收藏 0 人点赞
#inference-engine

vLLM V0 到 V1:在 RL 中先保正确性,再谈修正

Hugging Face Blog · 2026-05-06 缓存

ServiceNow 工程师详细介绍了他们从 vLLM V0 迁移到 V1 的过程,重点解决了后端正确性问题,包括 logprob 语义和运行时默认值,以确保强化学习训练动态的稳定。

0 人收藏 0 人点赞
#inference-engine

antirez/deepseek-v4-gguf

Hugging Face Models Trending · 2026-04-26 缓存

Antirez发布了专门为DS4推理引擎优化的DeepSeek V4 Flash GGUF量化版本,针对不同内存大小提供了优化配置,使得这个大型MoE模型可以在本地运行。

0 人收藏 0 人点赞
#inference-engine

@linexjlin: K2.6 花了 12 个小时, 在 Mac 上用 zig 语言 从 0 写了一个 LLM 推理引擎并,并将 qwen 3.5 0.8B 推理速度由 15 tok/s 优化到了 193.1 tok/s

X AI KOLs Timeline · 2026-04-20 缓存

Developer built a Zig-based LLM inference engine from scratch on Mac in 12h, boosting Qwen 3.5 0.8B speed from 15 to 193 tok/s.

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈