代表的なリクエストを定義する
埋め込み、分類、文字起こしのサービスでは、入力が同じではありません。文書の長さ、画像の寸法、音声の長さを固定し、その多様性をカバーする小さなセットを作成します。各ケースについて、期待される出力とエラーの報告方法を定義します。
モデルの読み込みは別途測定してください。初回呼び出しの時間と、すでに準備済みのプロセスの時間は、アプリケーションのユーザーにとって異なる問いに答えるものです。
24 GB をリクエスト間で共有する
まず1つのリクエストから始め、同じ入力のまま並行数を増やしていきます。メモリとキューを監視してください。同時により多くの呼び出しを受け付けても、それらがより速く完了するとは限りません。上限と、そこに達したときの明確な動作を定めてください。
CUDA、PyTorch、およびサービスが使用する場合はメディア準備ライブラリの環境を検証します。L4 のビデオ機能は、お使いのソフトウェアが互換パスを有効にした場合にのみ使用されます。ハードウェアの存在が Python スクリプトを自動的に変えることはありません。
別の容量を選ぶべき場合
24 GBに収まらない難しいケースがあるなら、L40Sは同じAdaファミリーで48 GBという選択肢を用意します。モデル計算中心のプロトタイプなら、RTX 4090も比較してみてください。単一のメモリ領域で80 GBを検討する必要があるなら、L4を戦略なく増やすのではなく、A100へ移行しましょう。
きちんと終わるお試しを組み立てる
3日間では、読み込みとリクエストを確認します。7日間では、並行処理、無効な入力、再起動を加えます。30日間のプランは、保存しておく日次レポートを伴う反復キャンペーンに活用できます。
このコマンドでは、モデル、バッチ、期間、準備を指定し、その後アカウント作成またはログインを行います。次に暗号資産とネットワークを選択します。KYC手続きや身分証明書は不要です。送金後、「支払いました」で報告を記録します。注文とその決済はKernodeckアカウントから確認できます。