読みやすいシングルカードアプリケーション
まず、モデルをロードし、バッチを処理し、結果を出力するプロセスから始めましょう。入力サイズとリクエスト数を固定します。このシンプルなシナリオにより、次に取り組むべきが GPU メモリなのか、データなのか、Python のロジックなのかを特定できます。
80 GBあれば、管理すべきメモリ領域を1つに保ちながら、24または48 GBのカードよりも大きな負荷を試せます。ただし、エンジンの一時的な割り当て用に余裕を確保しておいてください。
カーネルだけでなく転送も観察する
2回の呼び出しの間で同じデータを再読み込みするプログラムは、その時間の大部分を有効な計算以外に費やす可能性があります。CPUでの準備、転送、実行、結果の取得を個別に計測してください。CUDAの測定では、作業の投入だけを測定しないよう、非同期実行を考慮に入れてください。
お使いのPyTorchのバージョンとプロジェクトのコンパイル済みライブラリで動作を検証してください。実行経路を変更する前に、最適化なしの試行を比較の基準として残してください。
H100のフォーマットを混同せずに比較する
H100 SXMとH100 PCIeは同じハードウェア構成を表すものではありません。分散通信の挙動を測定することを研究が正当化する場合はSXMを選んでください。シングルカードの負荷が80 GBを超える場合は、むしろH200を選んでください。A100 SXMは、すでに検証済みのAmpere環境にとって検討すべき代替案です。
意思決定を生み出すためにレンタルする
3日の定額プランは初期プロファイルの確立に使えます。7日間では複数のバッチサイズを試し、比較レポートを残してください。30日間では、安定した識別子を使って実行とその追跡を整理してください。
コンフィギュレーターで期間、バッチ数、準備を選択し、アカウントを作成するかログインします。支払いは選択したアセットとネットワークに従います。送金後、「支払いました」が注文に報告を追加し、Kernodeckアカウントで確認できます。