测量: 所有延迟和吞吐量数据均在 2026-08-12 对实时端点进行测量。
在 NVIDIA HGX™ B300 GPU 上使用 NVFP4 量化权重提供服务,并与 Inferact 合作进行调优。
Qwen3.8-2.4T-A95B 现已在 DigitalOcean 推理引擎上提供。这是从阿里巴巴的 Qwen3.8-Max 旗舰模型派生的开放权重、纯文本版本:一个具有 2.4 万亿参数的混合专家模型 — — 每个 token 大约激活 95B 参数 — — 专为编码、工具使用和长时程代理工作而构建。在 阿里巴巴云发布的基准测试 中,Qwen3.8-Max 旗舰模型在 PaperBench 上领先(93.0),在 IFBench 上得分 82.8,并在 Terminal-Bench 2.1 上得到 86.6 分,超越 Claude Opus 4.8 和 Claude Fable 5(均为 84.6);目前尚未存在特定变体的公开基准测试(参见下方基准测试)。列表价格为每 1M 输入 token $2,每 1M 输出 token $6,而 Fable 5 的价格为 $10/$50。
我们在 NVIDIA HGX™ B300 GPU 上使用 NVFP4 量化权重提供此服务,这是通过与 Inferact 的技术合作开发的。它可通过 DigitalOcean 无服务器推理获得,采用基于使用量的定价和完全托管的基础设施,也可通过 DigitalOcean 推理路由器获得,这样您可以将其添加到现有的路由组合中,并根据成本、延迟或任务适配性向其发送请求。 注册 DigitalOcean 以开始发起调用。
| 架构 | 2.4T 参数的混合专家模型,每 token 活跃约 95B |
| 输入 / 输出 | 文本输入,文本输出 |
| 上下文窗口 | 总计 262,144 个 token(输入 + 输出合计) |
| 最大输出 | 最多 131,072 个 token |
| 硬件 | NVIDIA HGX™ B300,NVFP4 量化权重 |
| 价格 | $2 / $6 每 1M token(输入 / 输出);$0.20 每 1M 缓存输入 |
| 可用性 | DigitalOcean 无服务器推理 · DigitalOcean 推理路由 |
| 工具使用 | 原生函数调用;服务器端网络搜索,网页获取,模型合成,知识库检索(RAG),以及 MCP |
| 还支持 | 结构化输出(JSON Schema),可配置的推理工作量,异步批量推理 |
关于变体的说明。 Qwen3.8-2.4T-A95B 是源自 Qwen3.8-Max 旗舰版的开放权重、纯文本发行版 — — Qwen 已公开提供的版本。它不接受图像或视频输入。本文引用的基准数字是 Qwen3.8-Max 的纯文本基准;我们刻意排除了阿里巴巴的多模态结果,因为这些结果不适用于此模型。
长期智能体工作。 这是 Qwen 围绕其构建模型的能力,也是选择它的最明显原因。阿里巴巴的自身评估以多天自主运行为中心 — — 持续的工具使用,来自执行反馈的自我纠正,以及在数百轮中保持连贯的策略,而不仅仅是一次性生成。
生产工作流中的指令遵循。 Qwen3.8-Max 旗舰版的 IFBench 82.8 在阿里巴巴的比较集中领先于所有模型,包括 Opus 4.8、Fable 5 和 GPT-5.6 Sol。如果您正在构建需要模型可靠遵循格式契约和约束的系统,这就是重要的数字。
大文档和大代码库推理,最高可达 262K 上下文上限。
规模化的成本敏感型工作负载。 以 $2/$6 的价格,在高请求量下运行前沿级模型相比替代方案在成本上具有显著优势。
该端点与 OpenAI 兼容。将现有应用迁移只需更改基础 URL 和模型 ID。请注意,平台上的模型 ID 为 qwen3.8-max — — 该 ID 与模型的全称不同。
from openai import OpenAI
client = OpenAI(
base_url="https://inference.do-ai.run/v1",
api_key="" ,
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[{"role": "user", "content": "Refactor this function for readability: ..."}],
reasoning_effort="low",
max_tokens=1024,
)
print(response.choices[0].message.content)
Reasoning effort. Qwen3.8-2.4T-A95B 在回答前会进行推理,并且 reasoning_effort 接受 low, high, 或者 xhigh. 推理令牌计入您的输出账单和上下文窗口,所以 low 是正确的默认值 用于提取、分类、格式化和路由工作 — 保留 high 和 xhigh 用于思维链在做实际工作的任务。 本文后面的延迟数值是在未设置参数的情况下测量的,因此它们反映了服务器默认值,而不是 low。
Streaming,我们推荐用于任何面向用户的场景:
stream = client.chat.completions.create(
model="qwen3.8-max",
messages=[{"role": "user", "content": "Walk me through the basics of stock trading"}],
max_tokens=1024,
stream=True,
)
for chunk in stream:
delta = chunk.choices[0].delta
if delta.content:
print(delta.content, end="", flush=True)
函数调用使用标准的 OpenAI 格式:模型返回一个 tool_calls 列表,您的代码执行该函数,然后将结果传回以便模型撰写最终答案。
以下是带有真实实现的完整循环 — Open-Meteo,无需 API 密钥:
import json
import urllib.parse
import urllib.request
def get_weather(city: str) -> str:
"""Look up current conditions for a city."""
geo = json.load(urllib.request.urlopen(
"https://geocoding-api.open-meteo.com/v1/search?"
+ urllib.parse.urlencode({"name": city, "count": 1})
))
if not geo.get("results"):
return "No location found for %r." % city
loc = geo["results"][0]
wx = json.load(urllib.request.urlopen(
"https://api.open-meteo.com/v1/forecast?"
+ urllib.parse.urlencode({
"latitude": loc["latitude"],
"longitude": loc["longitude"],
"current": "temperature_2m,wind_speed_10m",
})
))
now = wx["current"]
return "%s, %s: %s°C, wind %s km/h" % (
loc["name"], loc.get("country", ""),
now["temperature_2m"], now["wind_speed_10m"],
)
tools = [{
"type": "function",
"function": {
"name": "get_weather",
"description": "Get current weather for a city",
"parameters": {
"type": "object",
"properties": {"city": {"type": "string"}},
"required": ["city"],
},
},
}]
messages = [{"role": "user", "content": "Is it jacket weather in Lisbon right now?"}]
resp = client.chat.completions.create(
model="qwen3.8-max", messages=messages, tools=tools, max_tokens=512
)
msg = resp.choices[0].message
if msg.tool_calls:
messages.append(msg) # keep the model's request in history
for call in msg.tool_calls:
args = json.loads(call.function.arguments)
result = get_weather(**args) # your function actually runs
messages.append({
"role": "tool",
"tool_call_id": call.id, # must match the call
"content": result,
})
final = client.chat.completions.create(
model="qwen3.8-max", messages=messages, max_tokens=512
)
print(final.choices[0].message.content)
模型决定 get_weather 是正确的函数,从一个从未说“获取天气”的问题中提取 {"city": "Lisbon"},读取您函数返回的实时温度,并回答实际提出的问题 — 是否应该带一件外套。
需要正确做到两点:追加助手消息本身,而不仅仅是工具结果,并为每个工具消息提供匹配的 tool_call_id。如果遗漏其中任意一点,后续请求将会失败,或者模型会丢失它所请求的内容的跟踪。
传入一个 JSON Schema,得到符合规范的 JSON,这样您就可以省去大多数管道所携带的解析和重试包装器:
resp = client.chat.completions.create(
model="qwen3.8-max",
messages=[{"role": "user", "content": "Extract the invoice fields from: ..."}],
reasoning_effort="low",
response_format={
"type": "json_schema",
"json_schema": {
"name": "invoice",
"schema": {
"type": "object",
"properties": {
"vendor": {"type": "string"},
"total": {"type": "number"},
"due_date": {"type": "string"},
},
"required": ["vendor", "total", "due_date"],
},
"strict": True,
},
},
)
这是真实的受限解码,而不仅仅是一个提示。我们使用一个明确指示模型使用枚举外的值、在 schema 需要整数时返回小数、添加一个被禁止的字段,并以一段散文开头的提示进行了测试。附带 schema 时,输出在每次试验中都符合要求。使用相同的提示但没有 schema 时,它在每次试验中都违反了契约。您可以删除 parse-and-retry 包装器。
预算注意:推理 token 与答案共享同一个 max_tokens 池。在默认推理力度下,即使是一个小对象的 schema-constrained 请求也可能耗尽 512-token 预算并返回截断的 JSON。请将 response_format 与 reasoning_effort="low" 以及充足的 max_tokens 配合使用,如上所示。
Qwen3.8-2.4T-A95B 可以使用 DigitalOcean 的服务器端工具,这些工具在我们的基础设施上运行,而不是要求您自行构建和托管 harness。
| 工具 | 它的作用 |
|---|---|
| 网络搜索 (公开预览) | 实时网络搜索,通过 Exa.ai |
| 网络获取 (公开预览) | 从网络检索 URL 和 PDF 内容,通过 Exa.ai |
| 模型合成 (公开预览) | 在同一任务上并行运行多达八个分析模型;评判者比较小组的结果,外部模型给出单一最终答案。小组模型可以使用服务器端搜索和获取。仅限 API。 |
| 知识库检索 | 在推理过程中查询您的私有数据源(RAG) |
| MCP | 访问远程 MCP 服务器并协调跨它们的调用 |
MCP 是您首先应该查看的 if you’re building agents. A model tuned for long-horizon autonomous work, pointed at your existing MCP servers, with no harness to operate yourself — that’s the combination this release is built for.
这些在我们这边运行。如快速启动所示的函数调用工作方式不同:模型返回调用,您的应用执行它。这两种机制均可用于 Qwen3.8-2.4T-A95B,并且可以在单个请求中组合使用。
DigitalOcean 目录中的一些工具是特定于提供商的,并且对于 Qwen3.8-2.4T-A95B 不可用:工具搜索、计算机使用、Bash/本地 Shell、文本编辑器和应用补丁。
以下数字是阿里云发布的 Qwen3.8-Max 结果——这是此开放权重发行版所衍生的旗舰模型——仅限于文本基准测试。目前尚未有针对 Qwen3.8-2.4T-A95B 的变体特定公开基准测试,因此请将这些视为指示而非精确;我们将在开放权重发行版的独立数字发布时更新此部分。我们未独立复现这些结果。
| 基准测试 | Qwen3.8-Max | Opus 4.8 | Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| PaperBench | 93.0 | 80.3 | 88.8 | 90.5 |
| IFBench | 82.8 | 62.2 | 63.5 | 72.7 |
| Terminal-Bench 2.1 | 86.6 | 84.6 | 84.6 | 88.8 |
| SWE-bench Pro | 67.7 | 69.2 | 80.0 | 64.6 |
| GPQA Diamond | 92.6 | 92.0 | 92.6 | 94.1 |
| HLE (no tools) | 43.6 | 45.7 | 53.3 | 47.2 |
它领先的地方:PaperBench 和 IFBench,两者均以显著优势领先。
它落后的地方:SWE-bench Pro,在这项基准上 Fable 5 显著领先(80.0 对 67.7),以及 HLE 上的纯文本推理。如果您的工作负载涉及困难的纯 SWE 或前沿推理,请在决定前进行基准测试。
阅读这些结果时的注意:此模型的一些最强的公开结果来源于 Qwen 自己的内部基准测试,由 Qwen 自己的评判模型评分。我们在此已排除这些结果,仅引用了第三方基准测试。
为什么是4位。 2.4T参数模型足够大,以至于FP8变体无法在单个节点上加载。NVFP4量化使权重在B300上能够在单个节点内获取,从而完全消除了服务路径中的跨节点专家路由 — — 拓扑更简单,关键路径中没有节点间通信,并且我们在价格中体现了更好的经济性。这项工作是在与Inferact合作的情况下完成的,起点是在Hugging Face上发布的开放权重Qwen。
质量。 对量化构建的内部抽检得分为GPQA Diamond 88,相比之下,阿里巴巴公布的Qwen3.8-Max旗舰版得分为92.6。这两个数字来源于不同的评估堆栈和配置,且差距同时体现了两方面的差异 — — 旗舰版与开放权重变体,以及未量化与NVFP4 — — 因此这是一个指示性数据点,而不是受控比较,并且它仅涵盖了模型最弱类别(纯文本推理)的一个基准,而不是其优势。我们发布它是因为一个诚实的数字比没有更有用。Qwen3.8-2.4T-A95B 是开放权重,其他提供商也会提供服务;当您进行比较时,请要求提供我们在此处所作的相同披露:量化格式、硬件、量化构建的质量数据以及带日期的性能测量。
以下数字是在2026-08-12从单个客户端通过公共互联网针对生产端点测量得到的,使用带有唯一前缀的流式请求(因此提示缓存未启用),且未设置reasoning_effort,因此它们反映了服务器的默认设置。它们展示了开发者会观察到的情况,这意味着它们包含网络延迟,并代表一个下限而非上限。我们观察到在各会话之间总吞吐量的运行间差异;请将这些视为快照,而非服务保证。
Prefill 在整个上下文范围内线性增长,大约为 16,000 tokens/sec,没有拐点。
| 输入 tokens | TTFT 中位数 |
|---|---|
| 1,080 | 1.1 s |
| 46,484 | 3.5 s |
| 185,610 | 11.4 s |
| 199,524 | 12.9 s |
| 239,414 | 14.9 s |
| 254,370 | 15.8 s |
一个实用的经验法则:TTFT ≈ (输入 tokens ÷ 16,000) + 0.7 s。
总吞吐量在 256 个并发请求下几乎呈线性增长,而 TTFT 中位数保持在约一秒左右。在此范围内我们未发现饱和点——上限高于 256。
| 并发请求数 | TTFT 中位数 | TTFT 95th百分位 | 总输出 tok/s |
|---|---|---|---|
| 1 | 1.12 s | 3.58 s | 9.8 |
| 8 | 0.73 s | 1.33 s | 106 |
| 32 | 1.03 s | 1.76 s | 289 |
| 64 | 0.95 s | 2.23 s | 669 |
| 128 | 1.07 s | 2.76 s | 1,230 |
| 256 | 1.24 s | 3.05 s | 1,937 |
~1,080-token 输入,~128-token 输出。在并发 256 下有 1,536 个请求,零错误。
令牌间延迟的中位数为 并发 1 时为 108 ms,并发 8 时为 115 ms — 大约为 每流 8–9 tokens/sec,随着并发增加保持稳定。
这是模型性能的真实情况:单流生成较为 modest,容量通过并发而非单流速度来扩展。对于代理管线、批处理和后台工作,这种权衡是正确的。对于对延迟敏感的交互式聊天,请先根据自己的 UX 预算进行基准测试。
262,144-token 窗口是模型在训练时的原生上下文长度。架构可以通过上下文扩展技术扩展到略超过 1M 的 token,但我们故意只提供原生窗口:扩展会让模型在其原生训练配置之外运行,并且这与单节点服务路径相冲突,而该路径使延迟和定价保持在当前水平(参见上面的 NVFP4 on B300)。如果您的工作负载确实需要在单个请求中使用超过 262K 的 token,那么此构建不适合 — — 对于大多数工作负载,包括具有大型稳定前缀的 agentic 循环,原生上下文加上提示缓存是更好的选择。
在实践中:254K-token 输入加上 128 tokens 的输出会成功;相同的输入配合一个大的 max_tokens 则不会成功。前填充成本随输入长度线性增长(见上文),因此完整窗口请求在第一个 token 到达之前大约需要 16 秒。
如果您在多轮中重放一个大的稳定前缀 — — 这是 agentic 循环的常见形式 — — 请参见定价部分下的提示缓存说明。
Qwen3.8-2.4T-A95B 可通过 DigitalOcean 推理路由器获得,因此您可以将其添加到现有的路由组合中。根据已发布的基准测试,一个合理的起始策略:
| 路由到 Qwen3.8-2.4T-A95B | 考虑其他模型 |
|---|---|
| 代理和工具使用工作负载 | 艰难的纯 SWE 任务(SWE-bench Pro) |
| 严格遵循指令和格式约定 | 前沿纯文本推理(HLE) |
| 成本占主导的高负载工作 | 延迟关键的交互式聊天 |
| 大型文档和大型代码库推理 | 需要图像或视频输入的任何内容 |
| 每 1M 令牌 | |
|---|---|
| 输入 | $2.00 |
| 输出 | $6.00 |
| 缓存输入 | $0.20 |
对于比较,Claude Fable 5 的价格为输入 $10 / 输出 $50。在输出密集型代理工作负载中——单个任务可能生成数十万个令牌——这种差异会迅速累积。
以每 1M 令牌 $0.20 的提示缓存是在此基础上可用的最大杠杆:对任何在轮次中重播大型稳定前缀的代理循环,输入可享受 10 折折扣。所有模型的完整费率见 推理定价文档。
对于不需要立即答案的工作负载,批量推理 与 Qwen3.8-2.4T-A95B 配合使用,能够异步处理大量请求:上传输入文件,创建作业,轮询完成情况,然后下载结果。可通过同一 API 列出和取消作业。
这正是模型擅长的形状。单流生成速度适中——大约 8–9 令牌/秒——而在并发请求下,总吞吐量可达约 1,900 令牌/秒。因此,诸如批量分类、文档提取、数据集生成和离线评估等吞吐量受限的工作更适合批处理,而非逐项请求循环。
如果您在权衡使用哪种方式,我们已经在 DigitalOcean 上撰写了一篇 无服务器、专用和批量推理的比较。
Qwen3.8-2.4T-A95B 现已在 DigitalOcean Serverless Inference 上线。 注册 DigitalOcean, 创建推理密钥, 将您的 OpenAI 客户端指向 https://inference.do-ai.run/v1, 并传递 qwen3.8-max 作为模型。
从那里开始:
什么是 Qwen3.8-2.4T-A95B? Qwen3.8-2.4T-A95B 是阿里巴巴云的首席开源大型语言模型,于 2026 年 8 月发布。这是从 Qwen3.8-Max 旗舰版派生的开放权重、纯文本版本:一种专家混合模型,总参数量为 2.4 万亿,每个 token 活跃参数约 950 亿,专为编码、工具使用和长时程代理任务而构建。在 DigitalOcean 上,它以文本输入、文本输出模型运行。
什么是 Qwen3.8-2.4T-A95B 在 DigitalOcean 上的模型 ID?
DigitalOcean Serverless Inference 上的模型 ID 是 qwen3.8-max。将该字符串作为 model 参数传递 — — 平台 ID 与模型的完整 Hugging Face 名称不同 (Qwen/Qwen3.8-2.4T-A95B)。
什么是 Qwen3.8-2.4T-A95B 在 DigitalOcean 上的上下文窗口?
总共 262,144 个 token,在输入、推理和输出之间共享。端点将其视为单一预算 — — 超过它时,API 将返回 HTTP 400 错误,报告 max_model_len=max_total_tokens=262144,并附上您自己的 token 计数。不会静默截断,因此请将输出 token 的预算与输入的同一池子进行对比。
Qwen3.8-2.4T-A95B 是否支持图像或视频? 不。Qwen3.8-2.4T-A95B 是基于 Qwen3.8-Max 旗舰版的纯文本、开放权重发行版,也是 DigitalOcean 提供的变体。本文引用的基准测试均为纯文本基准;阿里巴巴为旗舰版发布的多模态结果不适用于该变体。
Qwen3.8-2.4T-A95B 在 DigitalOcean 上的费用是多少? 每 100 万输入 token 2 美元,每 100 万输出 token 6 美元,每 100 万缓存输入 token 0.20 美元。供参考,Claude Fable 5 的价格为输入 10 美元,输出 50 美元。
Qwen3.8-2.4T-A95B 的速度如何? 在我们于 2026-08-12 进行的测量中,在约 1,000 输入 token 时,首个 token 的延迟约为 1.1 秒,而 prefill 的处理速度约为 16,000 token/秒 — 因此 TTFT 大约等于 (输入 token ÷ 16,000) + 0.7 秒。单流生成速度约为 8–9 token/秒,而在 256 并发请求且未达到饱和的情况下,总吞吐量可扩展至约 1,900 token/秒。
Qwen3.8-2.4T-A95B 是否支持函数调用和工具使用?
可以。它通过标准 OpenAI tools 参数支持原生函数调用,此外还支持 DigitalOcean 的服务器端工具:网页搜索、网页获取、模型合成、知识库检索和 MCP。这两种机制可以在单个请求中组合使用。
Qwen3.8-2.4T-A95B 是否支持结构化输出?
可以,并提供真实的 schema 强制执行。通过 response_format 传入 JSON Schema,输出将符合该 schema — 我们通过一个明确指示模型违反 schema 的提示进行了验证,受限输出每次都保持一致。请注意,推理 token 共享 max_tokens 预算,因此应将 schema 与 reasoning_effort="low" 以及充足的 token 上限配合使用。
什么是 NVFP4 量化? NVFP4 是一种在 NVIDIA Blackwell GPU 上原生支持的 4 位浮点格式。DigitalOcean 使用 NVFP4 量化的权重来提供 Qwen3.8-2.4T-A95B,因为 2.4T 参数模型的 FP8 变体无法在单个节点上加载;4 位量化使其能够在 HGX B300 上单节点运行,从而消除了服务路径中的跨节点专家路由。
我可以自己运行 Qwen3.8-2.4T-A95B 吗? 可以。Qwen 在 Hugging Face 上公开发布了权重。自行托管 2.4T 参数的 MoE 需要大量 GPU 资源,这就是托管无服务器端点的用途。
Qwen3.8-2.4T-A95B 是否可用于批处理? 可以。它与 DigitalOcean Batch Inference 配合使用,适用于异步、高吞吐量的工作负载 — 相比逐项请求循环,它更适合批量分类、文档提取和离线评估。
——
一个热爱技术的程序员,喜欢分享前沿AI知识和开发经验。