inference-server

标签

Cards List
#inference-server

Show HN: Reame – 一个随着运行而变快的CPU推理服务器

Hacker News Top · 2026-07-11 缓存

Reame 是一个基于 llama.cpp 构建的 LLM 推理服务器,通过缓存提示前缀和生成的 n-gram 来优化 CPU 硬件,随着重复使用变得越来越快。它专为廉价硬件设计,如共享 vCPU 和免费套餐,适用于重复性的 AI 工作负载,例如文档提取和批量处理管道。

0 人收藏 0 人点赞
#inference-server

@MiaAI_lab:如果你在寻找一个简单的启动/停止脚本来运行你的 Qwen3.6 27B/35B,可以看看这个。它针对速度进行了优化……

X AI KOLs Timeline · 2026-06-28 缓存

MiaAI-Lab 提供了一个简单的 Bash 启动/停止脚本,用于通过 llama-server 运行 Qwen3.6 27B/35B GGUF 模型,针对速度和编码性能进行了优化。

0 人收藏 0 人点赞
#inference-server

@JaydevTonde: https://x.com/JaydevTonde/status/2068361821002846418

X AI KOLs Timeline · 2026-06-20 缓存

有关在LLM推理服务器Tokn中实现CUDA Graphs的详细教程,涵盖FastAPI服务器设置、引擎初始化以及用于优化解码阶段的CUDA Graph捕获。

0 人收藏 0 人点赞
#inference-server

如果你有15万美元预算,要搭建一个服务300人的生产级本地推理服务器,你会买什么?

Reddit r/LocalLLaMA · 2026-05-29

一位用户寻求建议,希望以低于15万美元的价格购买一台故障转移推理服务器,用于服务300人,讨论了使用二手H100、RTX Pro 6000和DGX Station等选项来运行vLLM上的122b AWQ模型。

0 人收藏 0 人点赞
#inference-server

@gyro_ai: 在本地跑大模型给自己的工具用,装一堆 Python 依赖、配半天后端,光环境就劝退一批人 其实很多人只想要一个能立刻跑起来的本地接口 Shimmy 是 Rust 写的本地推理服务,编译成单个二进制文件,提供跟 OpenAI 完全一样的接口…

X AI KOLs Timeline · 2026-05-24 缓存

Shimmy is a lightweight single-binary local inference server that provides a drop-in OpenAI-compatible API for running GGUF models, supporting hot-swapping models and requiring no Python dependencies.

0 人收藏 0 人点赞
← 返回首页

提交意见反馈