完全なトレーニングステップから始める
最初の試行では、データ読み込み、順伝播、勾配計算、オプティマイザの更新を一通り実行する必要があります。バッチを増やす前に、この完全なサイクルを測定してください。重みは使用メモリの一部にすぎません。活性化とトレーニング状態も80GBに収まる必要があります。
代表的な入力シーケンスを、大きなサンプルも含めて維持してください。特に簡単な最初のバッチだけでキャンペーン全体を設計することを避けられます。
混合精度と管理された比較
PyTorchでは、autocastで一部の演算に適した精度を選択できます。この設定を損失関数と検証基準でテストしてください。オプションを有効にすることは数値的安定性の証明にはなりません。比較実行、メトリクス、正確なパラメータを保持してください。
複数カードの場合、GPUあたりのバッチとグローバルバッチを区別してください。プロセス数と勾配蓄積は、学習率と同様にプロトコルの一部です。
SXM、PCIe、あるいはより多くのメモリ
H100 PCIeは80GBの容量を維持しており、主にシングルカードで作業する場合に比較する価値があります。GPU間で頻繁に交換する場合は、アプリケーションが実際に使用するトポロジーを測定してください。SXMという名称はこの確認の代わりにはなりません。特定された問題がまずカードあたりのメモリ不足である場合は、H200を優先してください。
再開を含む期間を予約する
1つのループとチェックポイントを検証するには3日、アブレーションの一連には7日、継続的な実験には30日を選びましょう。このスケジュールには訓練エポックだけでなく、評価とエクスポートも含めてください。
コンフィギュレーターでPyTorchまたはカスタムの準備、バッチ数、期間を選択します。注文を保存して暗号通貨での支払い方法を選ぶ前に、アカウントを作成するかログインしてください。「支払いました」ボタンは送金を報告するためのもので、支払いの追跡はアカウント内で確認できます。