レンタルを正当化する成果物を定義する
ファイル処理であれば、走査する件数、出力形式、再開のルールを定義します。処理済みのファイルは、実行全体を読み直さなくても判別できる必要があります。対話型サービスであれば、リクエストの最大サイズ、許容できる遅延、容量に達したときの挙動を定義します。同じモデルでも、これらの制約によって大きく異なる構成が必要になることがあります。
短いケース、典型的なケース、そして限界に近いケースを含む代表的なサンプルを保持します。埋め込みのパイプラインでは、各ベクトルをその入力の識別子とバージョンに対応付けます。テキスト生成では、評価に使用した生成パラメータを記録します。結果の差異を説明できるようにしておく必要があり、それを直ちに GPU のせいにしてはいけません。
推論負荷全体に必要なメモリを選ぶ
モデルのファイルサイズだけでは、推論中に使用されるメモリのすべてを表せません。一時テンソル、入力、保持される出力、そして該当するモデルでは attention のキーと値のキャッシュも考慮する必要があります。このキャッシュは、シーケンスが長くなったり、複数のリクエストをまとめて処理したりすると、大きなものになり得ます。
まず、代表的な検証を測定可能な余裕をもって実行できるメモリのカードから始めます。24、32、48、80 GB 以上のモデルはそれぞれ異なる用途に応えますが、ある容量があれば特定のモデルがすべての設定で通ることを保証するものではありません。精度を下げたり量子化したりするとフットプリントは変わり得ますが、ソフトウェアの対応と、自分の入力に対する出力品質を確認する必要があります。
お使いのソフトウェアスタックに対応するGPUを選ぶ
ハードウェアを選ぶ前に、推論エンジン、その特殊な演算子、依存している拡張を洗い出します。PyTorch アプリケーションは複数の実行パスを提供できる一方、専用の拡張はそのうち 1 つしかサポートしないことがあります。NVIDIA なら CUDA、AMD なら ROCm で、モデルの読み込みや前処理を含む一連の経路全体を確認します。
パイプラインを通って結果の書き込みに至るまでの最小限のコマンドを維持してください。その後になって初めて、最適化を一つずつ有効にしていきます。精度、コンパイル、エンジンの変更はそれぞれ、同等の品質管理を保つ必要があります。読み込みの成功は重みが読み取り可能であることを示すだけで、必要な計算パスがすべて機能していることを示すものではありません。
処理目標に合わせてバッチを調整しましょう
方法の例:テキストを長さごとに3つのグループに分け、それぞれをバッチサイズ1、2、4で処理します。これらのサイズは試行の出発点であり、万能な推奨値ではありません。各組み合わせについて、完了した入力数、合計時間、観測された最大メモリ、エラーを記録します。失敗を平均値で覆い隠すのではなく、限界が現れた時点で進行を止めてください。
対話型サービスであれば、キューで待機した時間も加えます。バッチを大きくするとスループットとリクエストあたりの体感遅延が変わり得るため、単一の平均だけでは選べません。オフライン処理であれば、グルーピングによって結果の順序が入れ替わらないことを確認します。最終的には、品質基準と遅延の制約を満たす構成を選びます。
アプリケーションが作業を分散できる場合は複数の GPU に切り替えましょう
モデルの各インスタンスが1枚のカードに収まる場合は、入力の異なるパーティションを消費する複数のワーカーを構成できます。その場合は、識別子、再開、出力の収集を調整する必要があります。モデルをカード間に分割する必要がある場合は、お使いのエンジンがサポートする並列化戦略を使用し、その通信要件を確認してください。
注文するロットはハードウェアの数量を表し、アプリケーションのバッチや統合されたメモリ空間を表すものではありません。B200では、1ロットは2枚のカードで構成されます。その他のプランでは、1ロットは1枚のカードです。予定するワーカー数、各ワーカーに割り当てる入力の割合、ジョブが実際に完了したことを確認する方法を、資料に明記してください。
検証とエクスポートを含む期間を選びましょう
初めての3日間のレンタルでは、限定的な目標を設定しましょう。インストール、パイプラインの検証、そして最初の実用的な結果の生成です。7日間の期間はより多くのバリエーションを試すのに役立ち、30日間は処理を繰り返して運用を固めるのに役立ちます。これらは作業を整理する方法であり、実行時間の約束ではありません。
出力時には、重みまたはそのバージョン、設定、品質チェック、実際に得られた測定値、エクスポートされた結果を保管してください。ソフトウェアと処理はご自身の裁量で選択できます。Kernodeckはその内容を検査しません。アクセス情報、バックアップ、およびモデルとデータの使用に必要な許諾はご自身で準備してください。