一个清晰可读的单卡应用
先从一个能加载模型、处理一个批次并导出结果的流程开始。固定输入大小和请求数量。这个简单的场景可以帮您判断下一步的努力应该放在 GPU 内存、数据还是 Python 逻辑上。
凭借 80 GB,您可以探索比 24 或 48 GB 显卡更大的负载,同时只需管理一个内存域。不过要为引擎的临时分配预留余量。
像观察内核一样观察数据传输
一个在两次调用之间重新加载相同数据的程序,可能会把很大一部分时间花在有效计算之外。请分别计时 CPU 准备、传输、执行和结果取回。对于 CUDA 测量,要考虑到异步执行,以免只测到工作的提交。
用您的 PyTorch 版本和项目编译的库来验证运行情况。在修改执行路径之前,保留一次未优化运行作为对比基准。
比较时不要混淆 H100 的两种规格
H100 SXM 和 H100 PCIe 描述的并非同一套硬件配置。如果您的测试有理由测量分布式通信下的表现,就选 SXM。如果您的单卡负载超过 80 GB,则更应选择 H200。对于已经验证过的 Ampere 环境,A100 SXM 仍是值得考虑的选择。
租用是为了做出决策
3 天套餐可用于建立初始画像。用 7 天测试多种批次大小并保留一份对比报告;用 30 天借助稳定的标识符来组织运行及其跟踪。
在配置器中选择时长、批次数量和准备方案,然后创建账户或登录。结算会遵循所选资产和网络。转账之后,“我已付款”会为订单添加一个标记,您可以在自己的 Kernodeck 账户中查看。