モデルだけでなくパイプラインを試す
マルチモーダルアプリケーションでは、実際の用途を反映したファイルを用意しましょう。フォーマット、サイズ、長さを変えてください。読み込み、前処理、計算、エクスポートの時間を計測します。GPU側が素早く処理を終えても、CPUでのデコードや変換のステップが全体を律速することがあります。
さらに、何をもって有効な出力とするかを定義しましょう。結果の件数、フォーマット、サイズ、入力との対応関係です。こうして得られるのは単独の計算時間ではなく、デプロイに役立つ指標です。
48GBの中で余裕を確保する
重みに加えて、入力や一時的な状態のための領域も確保しましょう。複数のリクエストを処理するサービスでは、並行数を段階的に上げてメモリのピークを観察します。大きなファイル1つと通常サイズのファイル複数を別々に試してください。両者は異なる制約を生むことがあります。
PyTorch/CUDAスタックと、実際に使用するメディアライブラリを検証しましょう。L40SにはNVLinkがありません。カードを増やす場合は、メモリが統合されていると仮定せず、明示的に処理を分散するソフトウェアを用意してください。
アプリケーションの経路に応じて選ぶ
モデルと入力が収まるなら、24GBのL4も試す価値があります。RTX 6000 Adaも同じく48GBを備えており、計算と可視化ツールを組み合わせるプロジェクトでは比較対象になります。必要なメモリがこの容量を超える場合は、分割を複雑にする前に80GBのプランを検討しましょう。
サービスを検証するためのプラン
最小構成のパイプラインには3日、扱いにくいフォーマットや並行処理の検証には7日、構成をアーカイブしながら繰り返し実施するキャンペーンには30日を充てましょう。エラーの発見につながった例は保存しておきましょう。それらが回帰テストになります。
準備、ロット、期間を選び、注文情報を入力してください。ソフトウェアと処理はご自身で管理します。Kernodeckはファイル、プロンプト、計算の内容を検査しません。その後、暗号資産の送金を「支払いました」で申告します。