Hetzner 正在开发 LLM 推理服务
摘要
Hetzner 推出了一项实验性的 LLM 推理 API 服务,提供与 OpenAI 兼容的端点,并搭载 Qwen3.6-35B-A3B-FP8 模型。该服务在实验期间免费,无 SLA,旨在收集用户反馈。
暂无内容
查看缓存全文
缓存时间: 2026/07/24 14:02
# Hetzner Inference:初探
来源:https://sliplane.io/blog/hetzner-inference
Hetzner 正在尝试 LLM 推理。
这句话我原本没想过会写出来,但我觉得挺有意思的 :)
在任何人将生产级 AI 工作负载迁移到 Hetzner 之前,需要明确:这目前只是一个**实验**。没有计费、没有 SLA、没有生产环境保证,而且目前只有一个模型可用。Hetzner 表示,他们想了解用户是否真的需要这个功能、系统如何扩展、哪些特性重要,以及它能处理什么样的负载。
所以这并非一个成熟的产品发布。它是 Hetzner 将早期版本放到用户面前,看看会有什么结果。我很欣赏这种思路。
## 什么是 Hetzner Inference?(https://sliplane.io/blog/hetzner-inference#what-is-hetzner-inference)
Hetzner Inference(https://experiments.hetzner.com/)是一个兼容 OpenAI 的 API,运行在 Hetzner 自己的基础设施上。你在 Experiments 仪表盘中创建一个 API 令牌,将 OpenAI 客户端指向 Hetzner 的基础 URL,就可以像使用其他大多数推理 API 一样使用它。
目前,唯一可用的模型是 `Qwen/Qwen3.6-35B-A3B-FP8`(https://huggingface.co/Qwen/Qwen3.6-35B-A3B-FP8)。它是一个 350 亿参数的混合专家模型,拥有 30 亿活跃参数。它支持文本和图像输入,上下文窗口为 262K,并且使用了 FP8 量化权重。
对于一个实验来说,这是一个相当合理的模型。它足够小,不需要夸张的 GPU 集群就能提供服务,但同时又足够有用,可以用真实工作负载来测试 API。
Hetzner 还发布了一篇简短的教程,介绍如何将 OpenCode 连接到 API(https://community.hetzner.com/tutorials/opencode-with-hetzner-inference-api-systemd-sandbox/),如果你不想写代码,可以试试看。
## 我尝试了一下(https://sliplane.io/blog/hetzner-inference#i-tried-it)
由于 API 是兼容 OpenAI 的,集成过程几乎没什么特别之处:
值得一提的是 `enable_thinking` 选项。如果不开启它,模型可能会在返回可见答案之前,耗费大量生成预算用于推理。这个选项在我的测试中有效,但 Hetzner 并未对其加以说明,所以我暂时不会围绕这种精确的请求格式构建任何重要功能。
我在 2026 年 7 月 23 日做了几个小测试。我不想把这篇文章变成一份庞大的基准测试报告,因为这个产品是实验性的,针对它的基准测试很可能很快就会过时。但大致数据如下:
- **七个短请求的中位首个令牌时间为 153 毫秒**(基于已建立的连接)
- **五个生成(上限 512 令牌)的输出速度为每秒 224 个令牌**
这很快!但这也只是一次测试、一个客户端、一个时间点的数据。它不是 SLA,也几乎不能说明当很多人同时使用该服务时会发生什么。
模型本身的表现基本符合预期。它遵循了大多数格式化和检索指令,正确处理了一张图像,但在两个非常简单的算术问题上失败了。所以,这算是一个有点糟糕的小型 LLM :D
## 产品比模型更有趣(https://sliplane.io/blog/hetzner-inference#the-product-is-more-interesting-than-the-model)
Qwen 端点确实好玩,但我认为当前的模型并不是有趣的部分。
有趣的地方在于,Hetzner 为什么要测试推理。
> 接下来的内容纯粹是我的猜测。我没有内部信息,Hetzner 也没有人告诉我他们的计划。我只是观察这个产品,尝试连接一些线索。
开源权重推理是一个商品化市场。人人都可以下载相同的权重,运行几乎相同的服务软件,然后暴露一个兼容 OpenAI 的 API。切换提供商也很容易,尤其是借助 OpenRouter 或 LiteLLM 等产品,如果自己托管的话。
这导致很难获得高利润,除非你有一些优势。通常这意味着:
- 你能以非常便宜的价格购买并运营 GPU 硬件;
- 你非常擅长让这些硬件保持繁忙;
- 或者你已经拥有 GPU,否则它们会闲置在那里等待客户。
Hetzner 非常擅长购买硬件,将其部署在自己的数据中心,并以极其高效的成本结构进行运营。这基本上就是这家公司的全部。如果有人能把推理变成另一个低利润的基础设施产品,Hetzner 至少是一个可信的候选人。
这里还有一个不错的利用率故事。一台租用的裸金属 GPU 属于一个客户,无论该客户是否使用它。推理 API 可以让 GPU 容量在多个用户之间共享,保持硬件繁忙。如果 Hetzner 有闲置的 GPU 容量——或者计划构建一个更大的 GPU 集群——推理产品可以帮助将这种容量转化为收入。
再次强调,我不知道他们是否真的在这样做。但这对我来说在经济学上是合理的。
## 最大的问题是硬件(https://sliplane.io/blog/hetzner-inference#the-big-question-is-hardware)
这是我目前还不确定的地方。
Hetzner 当前公开的专用 GPU 服务器系列(https://docs.hetzner.com/robot/dedicated-server/server-lines/gpu-server/)使用两种 GPU 型号:
- **NVIDIA RTX 4000 SFF Ada Generation**,20 GB 显存
- **NVIDIA RTX PRO 6000 Blackwell Max-Q**,96 GB 显存
这些 GPU 能力不错,96 GB 的 RTX PRO 6000 对于中小型模型来说是一台相当不错的推理机器。Hetzner 当前 Qwen 模型的 FP8 文件大约 38 GB,实际显存使用量根据上下文长度、缓存大小和服务设置会更高一些。
但这些都是工作站 GPU,而不是服务于真正大型开源模型所需的密集多 GPU 系统。
以 GLM-5(https://huggingface.co/zai-org/GLM-5)作为一个极端例子。它有 7540 亿参数,官方服务方案将其分布在八块 GPU 上。即使采用激进的量化,你也需要数百 GB 显存。实际来看,这需要 B200/B300 级别或类似的硬件,并且多 GPU 之间要有非常快速的连接。
Hetzner 目前在其公开的裸金属产品线中并没有提供这种硬件。
当然,这并不能告诉我们实验性 API 背后是什么。Hetzner 可能使用了完全不同的内部硬件,而且一个公开的推理产品也不一定需要与其专用服务器目录保持一致。
尽管如此,这是我在密切关注的部分。
如果 Hetzner 继续只提供一两个较小的模型,我很难看到它成为重要的推理服务提供商。这将会是一个很酷的实验,但仅此而已。
如果这个实验是迈向更大 GPU 集群、合适模型目录以及 B200/B300 级别硬件的第一步,那么事情就变得有趣多了。Hetzner 已经拥有数据中心、网络、硬件经验、欧洲市场定位以及激进定价的声誉。这些因素结合起来,可能使其成为一个强有力的竞争者。
目前来看,这个 API 快速、免费,并且尝试起来很有趣。对我来说,有趣的问题不是他们接下来添加哪个小模型,而是 Hetzner 是否会投资于服务于大型模型所需的硬件。
干杯,
Jonas
相似文章
@AndrewYNg:全新课程:高效部署 LLM——如何以低延迟、合理成本为大量并发用户提供模型服务…
Andrew Ng 与 DeepLearning.AI 联合 Red Hat 推出了一门关于使用 vLLM 进行高效 LLM 推理的短期课程,内容涵盖量化、PagedAttention、连续批处理以及大规模 LLM 服务的性能基准测试。
InferenceBench:面向AI代理的开放式LLM推理优化基准测试
InferenceBench是一个基准测试,用于评估AI代理在多个瓶颈场景下使用H100 GPU优化LLM推理速度的表现。结果显示,代理虽然优于简单基线,但常常收敛于单一框架,且性能不及简单的超参数搜索,表明需要更好的探索策略。
大语言模型与本地AI硬件的推理引擎(2026版)
本文提供了一份全面的指南,针对2026年本地AI硬件上的大语言模型推理引擎,解释了如何根据硬件策略、工作负载和服务模型进行选择,并涵盖了诸如llama.cpp、MLX、ExLlamaV2/3、vLLM、SGLang、TensorRT-LLM和NVIDIA Dynamo等引擎。
@keigohtr: 来自Netflix。他们的内部LLM服务方法。In-House LLM Serving at Netflix https://netflixtechblog.com/in-house-l…
Netflix分享了他们的内部LLM服务方法,使用vLLM和Triton推理服务器,提供兼容OpenAI的API,并详细介绍了部署策略和生产权衡。
深入vLLM:高吞吐量LLM推理系统剖析(2025)
深入探讨vLLM用于高吞吐量LLM推理的架构与组件,涵盖调度、分页注意力、连续批处理、高级特性、扩展、服务及基准测试。