2枚のカード、明示的な分散計画
まず 2 つの戦略から選びましょう。各カードにモデルのコピーを置いて異なるデータを処理するか、モデルを GPU 間に実際に分散させるかです。PyTorch のデータ並列は、それだけでは 2 つのメモリを、大きすぎるモデルが使える単一の領域に変えるものではありません。
180 GB は各 B200 に属します。それらをまとめて活用するには、モデルの分割、プロセス間の通信、パーティションの保存を文書化しましょう。本番キャンペーンの前に、通信と復元の短いテストを行う必要があります。
最適化の前に Blackwell を検証
B200 に対応した PyTorch ディストリビューションとコンパイル済み拡張を準備しましょう。エラーなくインポートされた Python ライブラリでも、最初の CUDA カーネルで失敗することがあります。そのため、読み込み、順伝播、勾配計算、チェックポイントの書き込みをテストしてください。この一連の処理を実行したバージョンを保持しておきましょう。
次に、測定では初回コンパイルと安定した計算を分けましょう。この区別は、ある最適化を自分の負荷のために残す価値があるかを判断する助けになります。
いつ H200 や MI300X を選ぶか
すべての処理が1枚のカードに収まり、2枚目のGPUを使用しないなら、141GBのH200 SXMを検討してください。管理されたROCm環境でカードあたりの大容量メモリを優先するなら、192GBのMI300Xが別の選択肢となります。選択はまずソフトウェアと計算計画によって決まります。
ロットとその成果物を計画
分散起動の検証に3日、複数の設定の比較に7日、定期的なチェックポイントを伴うキャンペーンに30日を見込んでください。発注した各ロットにはB200が2枚含まれます。まとめでカードの合計を確認してください。
期間、ロット、準備を選択し、名、姓、メールアドレスを入力します。暗号資産とそのネットワークを選び、送金後に「支払いました」で申告を記録します。注文参照番号は実行のマニフェストと一緒に保管しましょう。