为您的项目提供 GPU · 无 KYC 的加密货币支付 如何租用
简体中文
打开控制台
GPU 参数页 / KERNODECK

H200 SXM:141 GB 扩展您的推理空间

H200 SXM 在 NVIDIA Hopper 生态中为每块 GPU 提供 141 GB HBM3e 显存。当权重、上下文或并发请求让 80 GB 显卡捉襟见肘时,这是一个值得考虑的选择。

1 包含 GPUHBM3e
141每块显卡 GB

19 可用显卡.

所示显存为每块 GPU。选择时长,然后在配置器中选择批组数量。

3 jours

每批 1 块 GPU

US$274.29租用 3 jours

7 jours

每批 1 块 GPU

US$640.00租用 7 jours

30 jours

每批 1 块 GPU

US$2,290.00租用 30 jours

超出权重文件之外的容量规划

对于生成服务而言,模型在磁盘上的大小并不能描述所需的全部显存。还要加上工作缓冲区和生成过程中使用的缓存。构建一组包含长输入和多个并发级别的请求集,然后测量得到的峰值。

利用这一余量来选择明确的上下文上限和队列。单次请求成功并不足以确定一个被多个客户端使用的服务的容量。

保持 CUDA 路径可追溯

将 Python、PyTorch、推理引擎及其扩展一并固定。如果更改精度或注意力引擎,请重跑相同的示例并同时比较输出质量。H200 带来的是显存容量;它不会替你选择可接受的生成参数。

将 tokenizer、模型版本和服务配置与结果一同归档。这样你便能区分是软件变更还是硬件变更。

扩容显存的正确思路

如果你的负载在 80 GB 上已有足够余量,请先比较 H100 PCIe 套餐再选择 H200。如果单个进程需要超过 141 GB,请考察 MI300X 及 ROCm 兼容性,或在 B200 上准备多卡切分。增加批次并不会自动扩大单个进程的显存。

从压力测试到套餐

在 3 天内,专注于有限的上下文/并发矩阵。一周可以加入错误、重启和导出;30 天适合已经组织好的迭代campaign。预留时间用于取回结果和最终清单。

配置需要填写批次数、准备情况以及你的联系方式。加密支付无需 KYC 或身份证件。转账后,请点击“我已支付”进行标记,然后在订单中查看支付状态。