model-serving

标签

Cards List
#model-serving

@songhan_mit: 惊人的创新与执行力。恭喜!

X AI KOLs Timeline · 3天前 缓存

Nunchux AI 推出了 Modelverse,这是一个多模态生成式AI推理服务,通过单一API提供快速、实惠的访问,支持超过30种图像、视频和化身模型。

0 人收藏 0 人点赞
#model-serving

Z.ai 完全在中国AI芯片上运行GLM-5.3-Flash

Reddit r/singularity · 2026-08-27 缓存

Z.ai宣布,其完全在中国AI芯片上运行了GLM-5.3-Flash模型,每个token的成本与Nvidia GPU相当,并使用了一个针对内存受限硬件优化的自定义推理引擎。

0 人收藏 0 人点赞
#model-serving

我们如何实现文本转语音模型低于50毫秒响应

Hacker News Top · 2026-08-21 缓存

Nari Labs详细描述了他们在文本转语音模型中实现低于50毫秒响应时间的方法,强调低延迟、实时多模态推理。

0 人收藏 0 人点赞
#model-serving

@omarsar0: Fireworks AI 同时出现在 "热门" 和 "增长最快" 中,这告诉你采用自定义模型和 "…" 有多重要。

X AI KOLs Timeline · 2026-08-19 缓存

Fireworks AI 出现在热门和增长最快类别中,凸显了自定义模型和拥有 AI 智能技术栈日益增长的重要性,以及 AI SaaS 供应商增长的更广泛趋势。

0 人收藏 0 人点赞
#model-serving

FreeToken:高效边缘原生MoE服务与带宽自适应执行

Hugging Face Daily Papers · 2026-08-17 缓存

FreeToken是一个边缘原生服务系统,它将计算和模型状态动态映射到异构本地硬件上,以在个人机器上运行大型开放权重模型,使得在单个GPU上高效执行高达753B参数的模型成为可能。

0 人收藏 0 人点赞
#model-serving

Qwen3-8B 2.4T 在 Nvidia GB300 NVL72 上达到 288k tokens/s

Reddit r/LocalLLaMA · 2026-08-16

NVIDIA 展示了在 GB300 NVL72 硬件上运行 Qwen3-8B 2.4T 参数模型的高吞吐量性能,实现每 GPU 超过 4k tokens/s。

0 人收藏 0 人点赞
#model-serving

@akshay_pachaar:重大突破!自托管LLM的成本刚刚降低了约75%:大多数Agent流水线现在在底层运行4-5个小模型……

X AI KOLs Timeline · 2026-08-06 缓存

Superlinked发布了SIE,一个开源推理引擎,通过一个API提供85+个模型,支持按需加载和LRU逐出,为Agent流水线节省约75%的自托管GPU成本。

0 人收藏 0 人点赞
#model-serving

@akshay_pachaar: https://x.com/akshay_pachaar/status/2084992645966016757

X AI KOLs Timeline · 2026-08-05 缓存

一份技术指南,演示如何使用开源工具在单个 GPU 上部署五个专用的小型模型(SLM、OCR、NER、重排序器、目标检测器),涵盖内存管理、批处理以及 Superlinked Inference Engine。

0 人收藏 0 人点赞
#model-serving

更小、更快、更安全:大规模运行Kimi和GLM

Hacker News Top · 2026-08-03 缓存

Cloudflare详细介绍了如何利用FP8 KV缓存量化和权重压缩,高效服务Kimi K2.6和GLM 5.2等大型开源MoE模型,在不损失准确性的情况下提升吞吐量并降低成本。

0 人收藏 0 人点赞
#model-serving

@akshay_pachaar: 无服务器 vs 本地部署 vs 边缘部署。(下次部署前必读)这三种方式是对同一个问题……

X AI KOLs Following · 2026-07-28 缓存

本文比较了无服务器、本地和边缘部署三种 AI 模型部署方式,指出了当前多模型服务中的低效问题。它介绍了 Superlinked Inference Engine (SIE),一个开源工具,通过动态加载和卸载权重,在单个 GPU 上服务多个模型,旨在降低成本和复杂性。

0 人收藏 0 人点赞
#model-serving

@DanKornas:提供AI模型服务不应需要从头重建API和部署层。BentoML是一个Python模型…

X AI KOLs Timeline · 2026-07-27 缓存

BentoML是一个开源Python框架,简化了将AI模型打包、提供服务和部署为REST API的过程,支持容器化和多模型编排。

0 人收藏 0 人点赞
#model-serving

@MiaAI_lab: 刚刚为您的 2 台 DGX Sparks 升级了 DeepSeek v4 Flash。单次每秒 66.6 tokens,6 个并发会话时可达 153.7 tokens/秒……

X AI KOLs Timeline · 2026-07-15 缓存

MiaAI Lab 发布了一项升级方案,用于在两台 DGX Spark 节点上使用 vLLM 结合 DSpark 推测解码和 NVFP4 KV-cache 来部署 DeepSeek V4 Flash,在六个并发会话中实现了高达 153.7 tokens/秒 的吞吐量。

0 人收藏 0 人点赞
#model-serving

Director: 通过在线主动专家放置加速分布式MoE服务

arXiv cs.LG · 2026-07-13 缓存

本文介绍了Director,一个分布式MoE服务系统,通过预测驱动的在线主动专家放置来最小化端到端延迟。它采用轻量级预测器和基于松弛法的优化器,对Mistral、DeepSeek和Qwen等模型可实现高达55%的延迟降低。

0 人收藏 0 人点赞
#model-serving

原生速度 vLLM transformers 建模后端

Hugging Face Blog · 2026-07-08 缓存

Hugging Face 发布了 transformers vLLM 建模后端,相比自定义 vLLM 实现能达到原生甚至更快的速度,使模型作者无需移植代码即可自动利用超快推理。

0 人收藏 0 人点赞
#model-serving

DeepSeek v4 (Flash) 的运行成本真的极低吗?如果是,原因是什么?

Reddit r/LocalLLaMA · 2026-07-06

用户询问为什么 DeepSeek v4 Flash(284B 参数)相比于像 Qwen 27B 这样的更小模型运行成本如此之低,质疑这是否源于定价倾销或架构差异。答案可能涉及其 MoE 架构和高效的推理技术。

0 人收藏 0 人点赞
#model-serving

@ParamSiddh:作为AI基础设施工程师,请学习: - GPU/VRAM基础、量化与批处理 - vLLM/TensorRT-LLM / 推理优化

X AI KOLs Timeline · 2026-07-01 缓存

一条推文列出AI基础设施工程师必备技能,涵盖GPU基础、推理优化、分布式训练及生产部署。

0 人收藏 0 人点赞
#model-serving

@RayFernando1337:我需要什么硬件才能以不错的每秒token数跑通这个庞然大物?

X AI KOLs Following · 2026-06-27 缓存

一位用户询问服务GLM-5.2(NVFP4格式)所需的硬件要求,该格式现已被vLLM支持,具有减少的内存占用和保持的准确性。

0 人收藏 0 人点赞
#model-serving

@0xSero: 欢呼吧,各位6000系列爱好者。我们家里有GLM了

X AI KOLs Following · 2026-06-18 缓存

一套现成的Docker配置,用于在4块RTX PRO 6000 Blackwell GPU上通过vLLM部署GLM-5.2-NVFP4-REAP-469B模型,包含详细说明和配置选项。

0 人收藏 0 人点赞
#model-serving

@QingQ77: 将阿里达摩院的 ZipEnhancer 降噪模型从 ModelScope pipeline 中剥离,封装为高性能 FastAPI 降噪服务。 https://github.com/gyj1201/zipEnhancer… 阿里达摩院的 Z…

X AI KOLs Timeline · 2026-06-08 缓存

本项目将阿里达摩院的ZipEnhancer降噪模型从ModelScope pipeline剥离,用纯PyTorch重写推理逻辑并封装为FastAPI服务,支持FP16半精度和长音频分段处理,提供多种降噪模型切换和API接口。

0 人收藏 0 人点赞
#model-serving

Luce Spark:无需卸载开销,在16GB GPU上运行35B MoE模型

Reddit r/LocalLLaMA · 2026-06-08

Luce Spark 是一款开源工具,通过智能地将热门专家缓存到 GPU 上,同时将其他专家保留在系统 RAM 中,从而在 16GB GPU 上运行 35B MoE 模型。它采用校准放置和有限异步缓存,保持高吞吐量,避免了常见的卸载速度断崖。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈