首页 / 文章 / Hetzner Inference 初体验
← 返回
AI技术

Hetzner Inference 初体验

✍️ zhirenhun 📅 2026/7/25 👁 153 阅读 ⏱ 11 分钟
Hetzner Inference 初体验

Hetzner 正在试验 LLM 推理。

Hetzner Inference Dashboard

这句话并非我原本预料会写下的,但我觉得它相当有意思 :)

在任何人将其生产级 AI 工作负载迁移到 Hetzner 之前,需要明确:这目前还只是一项实验。没有计费、没有服务等级协议(SLA)、没有生产保障,目前也只提供单一模型。Hetzner 表示,他们想了解用户是否真的需要这项服务,系统如何扩展,哪些功能是重要的,以及它能承受怎样的负载。

所以这并非成品发布,而是 Hetzner 在用户面前提前放出一个雏形,观察后续发展。我非常欣赏这种思路。

什么是 Hetzner Inference?

Hetzner Inference 是一个兼容 OpenAI 的 API,运行在 Hetzner 自有基础设施上。用户在 Experiments 仪表盘中创建一个 API 令牌,将 OpenAI 客户端指向 Hetzner 的基础 URL,就能像使用大多数推理 API 一样使用它。

目前,唯一可用的模型是 Qwen/Qwen3.6-35B-A3B-FP8。这是一个拥有 350 亿参数的混合专家模型,激活参数为 30 亿。它支持文本和图像输入,上下文窗口为 262K,并使用了 FP8 量化权重。

对于一个实验而言,这是一个相当合理的模型。它足够小,不需要夸张的 GPU 集群即可提供服务,但又足够实用,可以用真实工作负载来测试 API。

Hetzner 还发布了一篇简短的教程,介绍如何将 OpenCode 连接到该 API,如果你不想写代码也可以尝试。

我试了一下

由于该 API 兼容 OpenAI,集成过程几乎没有特殊之处:

pip install openai

from openai import OpenAI

client = OpenAI(
    base_url="https://inference.hetzner.com/api/v1",
    api_key="YOUR_TOKEN",
)

response = client.chat.completions.create(
    model="Qwen/Qwen3.6-35B-A3B-FP8",
    messages=[
        {"role": "user", "content": "Explain why the sky is blue in one sentence."}
    ],
    extra_body={
        "chat_template_kwargs": {
            "enable_thinking": False,
        }
    },
)

print(response.choices[0].message.content)

enable_thinking 选项值得一提。若不设置,模型可能会在给出可见回答之前,花费大量 completion 预算进行推理。该选项在我的测试中是有效的,但 Hetzner 并未对此进行文档说明,因此我还不建议围绕这个精确的请求结构构建重要东西。

我在 2026 年 7 月 23 日运行了几次小规模测试。我不想把这篇博文变成一份庞大的基准测试报告,因为该产品仍是实验性的,针对它的基准测试很可能很快就会过时。不过大致数据如下:

  • 在已建立的连接上,七个短请求的首次令牌到达时间中位数为 153 毫秒
  • 五次较长生成(限制为 512 令牌)中,每秒输出令牌数为 224

这很快!但这只是在单一时间点、单一客户端进行的单次测试。它并非 SLA,而且几乎说明不了当多人同时使用该服务时会发生什么。

模型本身的表现大致符合预期。它能够遵循大部分格式和检索指令,正确处理了一张图像,但在两道非常简单的算术题上出错。所以:这是一个小巧、略显蹩脚的 LLM :D

产品本身比模型更有趣

Qwen 端点很有趣,但我认为当前模型并非有趣之处所在。

有趣的是 Hetzner 为何会首先尝试推理。

从这往后纯属我的推测。我没有内幕消息,Hetzner 也没有任何人告诉我他们的计划。我只是观察这个产品,尝试串联一些线索。

开放权重推理是一个大宗商品市场。每个人都可以下载相同的权重,运行几乎相同的服务软件,并暴露一个兼容 OpenAI 的 API。更换提供商很容易,尤其是借助 OpenRouter 或 LiteLLM(用于自托管场景)这类产品。

这意味着除非你拥有某种优势,否则很难获得高额利润。通常这种优势意味着:

  • 你能以极低的成本购买和运营 GPU 硬件;
  • 你非常擅长让这些硬件保持忙碌;
  • 或者你已经拥有本来可能闲置等待客户的 GPU。

Hetzner 非常擅长购买硬件、将其放入自己的数据中心,并以极其高效的成本结构运营。这基本上就是这家公司的全部。如果有人能将推理转化为另一个低利润的基础设施产品,Hetzner 至少是一个可信的候选者。

这里还有一个很好的利用率故事。一台租用的裸金属 GPU 属于单个客户,无论该客户是否使用它。而推理 API 可以在众多用户之间共享 GPU 容量,保持硬件忙碌。如果 Hetzner 有闲置的 GPU 容量——或者计划构建规模更大的 GPU 集群——那么推理产品可以帮助将这种容量转化为收入。

再次强调,我不知道这是否是他们正在做的事情。但对我来说,这在经济上是有道理的。

关键问题在于硬件

这是我还未能信服的地方。

Hetzner 目前公开的专用 GPU 服务器产品线使用两种 GPU 类型:

  • NVIDIA RTX 4000 SFF Ada Generation,20 GB VRAM
  • NVIDIA RTX PRO 6000 Blackwell Max-Q,96 GB VRAM

这些都是有能力的 GPU,其中 96 GB 的 RTX PRO 6000 对于中小型模型来说是一台相当不错的推理机器。Hetzner 当前 Qwen 模型的 FP8 文件大约为 38 GB,实际 VRAM 使用量会更高,具体取决于上下文长度、缓存大小和服务设置。

但这些是工作站 GPU,而不是服务真正大型开放模型所需的密集型多 GPU 系统。

以 GLM-5 作为极端例子。它有 7540 亿参数,官方服务方案将其拆分到八张 GPU 上。即使采用激进的量化,你谈论的也是数百 GB 的 VRAM。现实来说,这需要 B200/B300 级别的硬件,或者类似的设备,并配备多 GPU 之间的极速互连。

Hetzner 目前在其公开裸金属产品线中并未提供这类硬件。

当然,这并不能告诉我们实验性 API 背后是什么。Hetzner 可能使用完全不同的内部硬件,一个公开的推理产品也不必与其专用服务器目录保持一致。

不过,这是我在密切关注的部分。

如果 Hetzner 只继续提供一两个较小的模型,我认为它不太可能成为重要的推理服务提供商。那将是一个很酷的实验,但仅此而已。

如果这个实验是迈向更大 GPU 集群、更完善的模型目录以及 B200/B300 级别硬件的第一步,那就变得有趣得多了。Hetzner 已经拥有数据中心、网络、硬件经验、欧洲定位以及以激进定价著称的声誉。这种组合可能会使其成为一个严肃的竞争对手。

目前,这个 API 速度快、免费且很有趣。下一次硬件公告将比任何一个小模型更能说明问题。

祝好,
Jonas

原文:https://dev.to/code42cate/hetzner-inference-first-look-587

——

🧑‍💻

zhirenhun

一个热爱技术的程序员,喜欢分享前沿AI知识和开发经验。

Hetzner LLM推理 云计算
← 上一篇
Unlimited-OCR:一次解析40页PDF,无需GPU熔化
下一篇 →
MCP rug-pulls:你批准的「安全」AI工具如何变恶意

📌 相关推荐

停止相信仅文本代理排行榜:来自 Cua-Bench 和 Factorio 的教训
2026/8/26
Agent Memory 有两种不同含义,回答引擎给出的却是错误的那一种
2026/8/26
LLM的止境:AI辅助VAPT流水线的确定性评分
2026/8/22
← 返回文章列表