超出权重文件之外的容量规划
对于生成服务而言,模型在磁盘上的大小并不能描述所需的全部显存。还要加上工作缓冲区和生成过程中使用的缓存。构建一组包含长输入和多个并发级别的请求集,然后测量得到的峰值。
利用这一余量来选择明确的上下文上限和队列。单次请求成功并不足以确定一个被多个客户端使用的服务的容量。
保持 CUDA 路径可追溯
将 Python、PyTorch、推理引擎及其扩展一并固定。如果更改精度或注意力引擎,请重跑相同的示例并同时比较输出质量。H200 带来的是显存容量;它不会替你选择可接受的生成参数。
将 tokenizer、模型版本和服务配置与结果一同归档。这样你便能区分是软件变更还是硬件变更。
扩容显存的正确思路
如果你的负载在 80 GB 上已有足够余量,请先比较 H100 PCIe 套餐再选择 H200。如果单个进程需要超过 141 GB,请考察 MI300X 及 ROCm 兼容性,或在 B200 上准备多卡切分。增加批次并不会自动扩大单个进程的显存。
从压力测试到套餐
在 3 天内,专注于有限的上下文/并发矩阵。一周可以加入错误、重启和导出;30 天适合已经组织好的迭代campaign。预留时间用于取回结果和最终清单。
配置需要填写批次数、准备情况以及你的联系方式。加密支付无需 KYC 或身份证件。转账后,请点击“我已支付”进行标记,然后在订单中查看支付状态。