两块显卡,一套明确的分配方案
首先在两种策略之间做出选择:每块显卡各存一份模型副本以处理不同数据,或将模型真正拆分到各 GPU 之间。PyTorch 的数据并行本身并不会把两块显存变成一块可供超大模型使用的统一储备。
180 GB 分别属于每块 B200。若要共同利用它们,请记录模型切分、进程间通信以及分区保存方式。在启动完整训练之前,应先进行一次简短的通信与恢复测试。
优化之前先验证 Blackwell
准备兼容 B200 的 PyTorch 发行版与已编译扩展。一个成功导入的 Python 库仍可能在第一个 CUDA 内核上失败:因此请测试加载、前向传播、梯度计算以及检查点写入。保留执行过这一流程的版本。
随后在您的测量中将初次编译与稳定计算区分开。这一区分有助于判断某项优化是否值得为您的自有用例保留。
何时选择 H200 或 MI300X
如果您全部的处理都能装在一块显卡上、用不到第二块 GPU,不妨考虑拥有 141 GB 的 H200 SXM。如果您的首要需求是每卡大显存且拥有可控的 ROCm 环境,192 GB 的 MI300X 是另一条路径。选择首先取决于软件与计算方案。
规划批次及其交付成果
预留 3 天用于验证分布式启动,7 天用于对比多组设置,30 天用于配合定期检查点的训练。每个下单批次包含两块 B200;请在订单摘要中核对显卡总数。
选择时长、批次和准备工作,然后填写名字、姓氏和电子邮件。选择您的加密货币及其网络;转账完成后,点击「J’ai payé」记录您的申报。请将订单参考号与运行清单一并保留。