Hetzner 正在试验 LLM 推理。

在任何人将其生产级 AI 工作负载迁移到 Hetzner 之前,需要明确:这目前还只是一项实验。没有计费、没有服务等级协议(SLA)、没有生产保障,目前也只提供单一模型。Hetzner 表示,他们想了解用户是否真的需要这项服务,系统如何扩展,哪些功能是重要的,以及它能承受怎样的负载。
所以这并非成品发布,而是 Hetzner 在用户面前提前放出一个雏形,观察后续发展。我非常欣赏这种思路。
什么是 Hetzner Inference?
Hetzner Inference 是一个兼容 OpenAI 的 API,运行在 Hetzner 自有基础设施上。用户在 Experiments 仪表盘中创建一个 API 令牌,将 OpenAI 客户端指向 Hetzner 的基础 URL,就能像使用大多数推理 API 一样使用它。
目前,唯一可用的模型是 Qwen/Qwen3.6-35B-A3B-FP8。这是一个拥有 350 亿参数的混合专家模型,激活参数为 30 亿。它支持文本和图像输入,上下文窗口为 262K,并使用了 FP8 量化权重。
对于一个实验而言,这是一个相当合理的模型。它足够小,不需要夸张的 GPU 集群即可提供服务,但又足够实用,可以用真实工作负载来测试 API。
Hetzner 还发布了一篇简短的教程,介绍如何将 OpenCode 连接到该 API,如果你不想写代码也可以尝试。
我试了一下
由于该 API 兼容 OpenAI,集成过程几乎没有特殊之处:
pip install openai
from openai import OpenAI
client = OpenAI(
base_url="https://inference.hetzner.com/api/v1",
api_key="YOUR_TOKEN",
)
response = client.chat.completions.create(
model="Qwen/Qwen3.6-35B-A3B-FP8",
messages=[
{"role": "user", "content": "Explain why the sky is blue in one sentence."}
],
extra_body={
"chat_template_kwargs": {
"enable_thinking": False,
}
},
)
print(response.choices[0].message.content)
enable_thinking 选项值得一提。若不设置,模型可能会在给出可见回答之前,花费大量 completion 预算进行推理。该选项在我的测试中是有效的,但 Hetzner 并未对此进行文档说明,因此我还不建议围绕这个精确的请求结构构建重要东西。
我在 2026 年 7 月 23 日运行了几次小规模测试。我不想把这篇博文变成一份庞大的基准测试报告,因为该产品仍是实验性的,针对它的基准测试很可能很快就会过时。不过大致数据如下:
- 在已建立的连接上,七个短请求的首次令牌到达时间中位数为 153 毫秒
- 五次较长生成(限制为 512 令牌)中,每秒输出令牌数为 224
这很快!但这只是在单一时间点、单一客户端进行的单次测试。它并非 SLA,而且几乎说明不了当多人同时使用该服务时会发生什么。
模型本身的表现大致符合预期。它能够遵循大部分格式和检索指令,正确处理了一张图像,但在两道非常简单的算术题上出错。所以:这是一个小巧、略显蹩脚的 LLM :D
产品本身比模型更有趣
Qwen 端点很有趣,但我认为当前模型并非有趣之处所在。
有趣的是 Hetzner 为何会首先尝试推理。
从这往后纯属我的推测。我没有内幕消息,Hetzner 也没有任何人告诉我他们的计划。我只是观察这个产品,尝试串联一些线索。
开放权重推理是一个大宗商品市场。每个人都可以下载相同的权重,运行几乎相同的服务软件,并暴露一个兼容 OpenAI 的 API。更换提供商很容易,尤其是借助 OpenRouter 或 LiteLLM(用于自托管场景)这类产品。
这意味着除非你拥有某种优势,否则很难获得高额利润。通常这种优势意味着:
- 你能以极低的成本购买和运营 GPU 硬件;
- 你非常擅长让这些硬件保持忙碌;
- 或者你已经拥有本来可能闲置等待客户的 GPU。
Hetzner 非常擅长购买硬件、将其放入自己的数据中心,并以极其高效的成本结构运营。这基本上就是这家公司的全部。如果有人能将推理转化为另一个低利润的基础设施产品,Hetzner 至少是一个可信的候选者。
这里还有一个很好的利用率故事。一台租用的裸金属 GPU 属于单个客户,无论该客户是否使用它。而推理 API 可以在众多用户之间共享 GPU 容量,保持硬件忙碌。如果 Hetzner 有闲置的 GPU 容量——或者计划构建规模更大的 GPU 集群——那么推理产品可以帮助将这种容量转化为收入。
再次强调,我不知道这是否是他们正在做的事情。但对我来说,这在经济上是有道理的。
关键问题在于硬件
这是我还未能信服的地方。
Hetzner 目前公开的专用 GPU 服务器产品线使用两种 GPU 类型:
- NVIDIA RTX 4000 SFF Ada Generation,20 GB VRAM
- NVIDIA RTX PRO 6000 Blackwell Max-Q,96 GB VRAM
这些都是有能力的 GPU,其中 96 GB 的 RTX PRO 6000 对于中小型模型来说是一台相当不错的推理机器。Hetzner 当前 Qwen 模型的 FP8 文件大约为 38 GB,实际 VRAM 使用量会更高,具体取决于上下文长度、缓存大小和服务设置。
但这些是工作站 GPU,而不是服务真正大型开放模型所需的密集型多 GPU 系统。
以 GLM-5 作为极端例子。它有 7540 亿参数,官方服务方案将其拆分到八张 GPU 上。即使采用激进的量化,你谈论的也是数百 GB 的 VRAM。现实来说,这需要 B200/B300 级别的硬件,或者类似的设备,并配备多 GPU 之间的极速互连。
Hetzner 目前在其公开裸金属产品线中并未提供这类硬件。
当然,这并不能告诉我们实验性 API 背后是什么。Hetzner 可能使用完全不同的内部硬件,一个公开的推理产品也不必与其专用服务器目录保持一致。
不过,这是我在密切关注的部分。
如果 Hetzner 只继续提供一两个较小的模型,我认为它不太可能成为重要的推理服务提供商。那将是一个很酷的实验,但仅此而已。
如果这个实验是迈向更大 GPU 集群、更完善的模型目录以及 B200/B300 级别硬件的第一步,那就变得有趣得多了。Hetzner 已经拥有数据中心、网络、硬件经验、欧洲定位以及以激进定价著称的声誉。这种组合可能会使其成为一个严肃的竞争对手。
目前,这个 API 速度快、免费且很有趣。下一次硬件公告将比任何一个小模型更能说明问题。
祝好,
Jonas
原文:https://dev.to/code42cate/hetzner-inference-first-look-587