inference-server

标签

Cards List
#inference-server

GitHub - coder543/minnow: 快速的 LLaDA2.2 推理服务器

Reddit r/LocalLLaMA ↗ · 2026-09-09 缓存

Minnow 是一个用于 LLaDA2.2 模型的高性能 Rust 推理服务器,提供通过量化、GPU加速的优化推理,以及相比标准 Transformers 实现的显著速度提升。

0 人收藏 0 人点赞
#inference-server

Perplexity 开源其针对 Qwen 3.6 的 Mac 推理服务器

Reddit r/LocalLLaMA ↗ · 2026-09-02

Perplexity 开源了一款针对 Qwen 3.6 模型优化的 Mac 推理服务器,以在 Apple Silicon 上实现最佳性能。

0 人收藏 0 人点赞
#inference-server

@akshay_pachaar: 运行代理工具链 100% 私有 & 离线。 (无令牌成本,无API密钥,100%开源)您的代理在本地运行。 th…

X AI KOLs Following ↗ · 2026-09-02 缓存

Magnitude 是一个开源推理服务器,可在您的硬件上本地运行AI模型,与编码代理集成以确保隐私和无数据泄露,设置只需一个命令。

0 人收藏 0 人点赞
#inference-server

@ao_qu18465: https://x.com/ao_qu18465/status/2094867930081337730

X AI KOLs Timeline ↗ · 2026-09-01 缓存

Reef 是一个开源基础设施,它使 AI 代理能够通过从推理经验中学习来持续改进自身,专注于进化模型和工具。

0 人收藏 0 人点赞
#inference-server

@akshay_pachaar: https://x.com/akshay_pachaar/status/2094765529231929361

X AI KOLs Following ↗ · 2026-09-01 缓存

本文是一篇实践指南,介绍如何为代理工作运行本地AI模型,重点讨论硬件权衡,并引入Magnitude,一个开源推理服务器,它简化配置以优化性能。

0 人收藏 0 人点赞
#inference-server

Show HN: Reame – 一个随着运行而变快的CPU推理服务器

Hacker News Top ↗ · 2026-07-11 缓存

Reame 是一个基于 llama.cpp 构建的 LLM 推理服务器,通过缓存提示前缀和生成的 n-gram 来优化 CPU 硬件,随着重复使用变得越来越快。它专为廉价硬件设计,如共享 vCPU 和免费套餐,适用于重复性的 AI 工作负载,例如文档提取和批量处理管道。

0 人收藏 0 人点赞
#inference-server

@MiaAI_lab:如果你在寻找一个简单的启动/停止脚本来运行你的 Qwen3.6 27B/35B,可以看看这个。它针对速度进行了优化……

X AI KOLs Timeline ↗ · 2026-06-28 缓存

MiaAI-Lab 提供了一个简单的 Bash 启动/停止脚本,用于通过 llama-server 运行 Qwen3.6 27B/35B GGUF 模型,针对速度和编码性能进行了优化。

0 人收藏 0 人点赞
#inference-server

@JaydevTonde: https://x.com/JaydevTonde/status/2068361821002846418

X AI KOLs Timeline ↗ · 2026-06-20 缓存

有关在LLM推理服务器Tokn中实现CUDA Graphs的详细教程,涵盖FastAPI服务器设置、引擎初始化以及用于优化解码阶段的CUDA Graph捕获。

0 人收藏 0 人点赞
#inference-server

如果你有15万美元预算,要搭建一个服务300人的生产级本地推理服务器,你会买什么?

Reddit r/LocalLLaMA ↗ · 2026-05-29

一位用户寻求建议,希望以低于15万美元的价格购买一台故障转移推理服务器,用于服务300人,讨论了使用二手H100、RTX Pro 6000和DGX Station等选项来运行vLLM上的122b AWQ模型。

0 人收藏 0 人点赞
#inference-server

@gyro_ai: 在本地跑大模型给自己的工具用,装一堆 Python 依赖、配半天后端,光环境就劝退一批人 其实很多人只想要一个能立刻跑起来的本地接口 Shimmy 是 Rust 写的本地推理服务,编译成单个二进制文件,提供跟 OpenAI 完全一样的接口…

X AI KOLs Timeline ↗ · 2026-05-24 缓存

Shimmy is a lightweight single-binary local inference server that provides a drop-in OpenAI-compatible API for running GGUF models, supporting hot-swapping models and requiring no Python dependencies.

0 人收藏 0 人点赞
#inference-server

magnitudedev/magnitude

GitHub Trending (daily) ↗ · 2026-09-03 缓存

Magnitude是一个开源推理服务器,可在本地硬件上运行AI模型,确保隐私和离线使用,并集成到各种代理工具中,如Pi和Claude Code。

0 人收藏 0 人点赞
#inference-server

模块化/模块化

GitHub Trending (daily) ↗ · 2026-08-20 缓存

Modular 平台提供了开源工具,用于 AI 开发和部署,具有 MAX 框架和 Mojo 语言。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈