标签
Nunchux AI 推出了 Modelverse,这是一个多模态生成式AI推理服务,通过单一API提供快速、实惠的访问,支持超过30种图像、视频和化身模型。
Z.ai宣布,其完全在中国AI芯片上运行了GLM-5.3-Flash模型,每个token的成本与Nvidia GPU相当,并使用了一个针对内存受限硬件优化的自定义推理引擎。
Nari Labs详细描述了他们在文本转语音模型中实现低于50毫秒响应时间的方法,强调低延迟、实时多模态推理。
Fireworks AI 出现在热门和增长最快类别中,凸显了自定义模型和拥有 AI 智能技术栈日益增长的重要性,以及 AI SaaS 供应商增长的更广泛趋势。
FreeToken是一个边缘原生服务系统,它将计算和模型状态动态映射到异构本地硬件上,以在个人机器上运行大型开放权重模型,使得在单个GPU上高效执行高达753B参数的模型成为可能。
NVIDIA 展示了在 GB300 NVL72 硬件上运行 Qwen3-8B 2.4T 参数模型的高吞吐量性能,实现每 GPU 超过 4k tokens/s。
Superlinked发布了SIE,一个开源推理引擎,通过一个API提供85+个模型,支持按需加载和LRU逐出,为Agent流水线节省约75%的自托管GPU成本。
一份技术指南,演示如何使用开源工具在单个 GPU 上部署五个专用的小型模型(SLM、OCR、NER、重排序器、目标检测器),涵盖内存管理、批处理以及 Superlinked Inference Engine。
Cloudflare详细介绍了如何利用FP8 KV缓存量化和权重压缩,高效服务Kimi K2.6和GLM 5.2等大型开源MoE模型,在不损失准确性的情况下提升吞吐量并降低成本。
本文比较了无服务器、本地和边缘部署三种 AI 模型部署方式,指出了当前多模型服务中的低效问题。它介绍了 Superlinked Inference Engine (SIE),一个开源工具,通过动态加载和卸载权重,在单个 GPU 上服务多个模型,旨在降低成本和复杂性。
BentoML是一个开源Python框架,简化了将AI模型打包、提供服务和部署为REST API的过程,支持容器化和多模型编排。
MiaAI Lab 发布了一项升级方案,用于在两台 DGX Spark 节点上使用 vLLM 结合 DSpark 推测解码和 NVFP4 KV-cache 来部署 DeepSeek V4 Flash,在六个并发会话中实现了高达 153.7 tokens/秒 的吞吐量。
本文介绍了Director,一个分布式MoE服务系统,通过预测驱动的在线主动专家放置来最小化端到端延迟。它采用轻量级预测器和基于松弛法的优化器,对Mistral、DeepSeek和Qwen等模型可实现高达55%的延迟降低。
Hugging Face 发布了 transformers vLLM 建模后端,相比自定义 vLLM 实现能达到原生甚至更快的速度,使模型作者无需移植代码即可自动利用超快推理。
用户询问为什么 DeepSeek v4 Flash(284B 参数)相比于像 Qwen 27B 这样的更小模型运行成本如此之低,质疑这是否源于定价倾销或架构差异。答案可能涉及其 MoE 架构和高效的推理技术。
一条推文列出AI基础设施工程师必备技能,涵盖GPU基础、推理优化、分布式训练及生产部署。
一位用户询问服务GLM-5.2(NVFP4格式)所需的硬件要求,该格式现已被vLLM支持,具有减少的内存占用和保持的准确性。
一套现成的Docker配置,用于在4块RTX PRO 6000 Blackwell GPU上通过vLLM部署GLM-5.2-NVFP4-REAP-469B模型,包含详细说明和配置选项。
本项目将阿里达摩院的ZipEnhancer降噪模型从ModelScope pipeline剥离,用纯PyTorch重写推理逻辑并封装为FastAPI服务,支持FP16半精度和长音频分段处理,提供多种降噪模型切换和API接口。
Luce Spark 是一款开源工具,通过智能地将热门专家缓存到 GPU 上,同时将其他专家保留在系统 RAM 中,从而在 16GB GPU 上运行 35B MoE 模型。它采用校准放置和有限异步缓存,保持高吞吐量,避免了常见的卸载速度断崖。