プロジェクトをそのパラメータのまま再開する
既知の環境は新しい実験の不確定要素を減らします。コードのバージョン、依存関係ファイル、パラメータ、小規模な評価セットを持ち込んでください。バッチやオプティマイザを変更する前に、まずモデルの再読み込みとデータ形式をテストしましょう。
再現性はプロジェクト単位で構築されます。同じシードでも、PyTorch のバージョン、ハードウェア、アルゴリズムが変われば同一の結果は保証されません。そのため、条件と観測された差異を保存しておきましょう。
80 GB を適切な段階で使う
メモリはモデルのインポート直後だけでなく、ループ内で最も負荷が高い時点で測定してください。学習は単純な推論よりも多くの状態を保持します。勾配の蓄積はより小さなマイクロバッチで作業するのに役立ちますが、重みやオプティマイザの状態をなくすことはできません。
A100はBF16を含む複数の計算フォーマットをサポートしています。演算と期待される品質に応じて精度を選び、2つの実験を比較する際は同じルールを維持してください。
代替案は診断に応えるものでなければならない
80 GB で足りるが Hopper を検討したい場合は、まったく同じプロトコルで H100 SXM を比較してください。すでに割り当てが溢れている場合は、代わりに 141 GB の H200 を検討しましょう。逆に、48 GB を大幅に下回るプロジェクトでは、より多くの容量を割り当てる前に RTX A6000 での試用が妥当かもしれません。
予約して再開可能性を保つ
3日間は目標とする結果の再現に適しています。7日間は複数のバリエーションを試す余裕があり、30日間は再開ポイントを設けたより長いシリーズを組むことができます。各チェックポイントをそのステップに関連付け、期限前に読み込みをテストしてください。
レンタルは、A100、ロット、期間、環境を選択し、続いて連絡先を入力して準備します。暗号資産の方法を選択して送金した後、「支払いました」を使用します。ハードウェア、期間、結果を結び付けるため、注文番号を実験のジャーナルに保存しておきましょう。