重みファイルを超えた設計を行う
生成サービスの場合、ディスク上のモデルサイズだけでは必要なメモリの全体像はわかりません。作業バッファと生成中に使用されるキャッシュを加算してください。長い入力と複数の同時実行レベルを含むリクエストセットを構築し、得られたピークを測定しましょう。
この余裕を基に、明示的なコンテキスト上限とキューを選択してください。単発のリクエストが成功しただけでは、複数のクライアントが利用するサービスの容量を決定するには不十分です。
トレーサブルなCUDAパスを維持する
Python、PyTorch、推論エンジンとその拡張機能をまとめて固定してください。精度やアテンションエンジンを変更した場合は、同じサンプルを再実行し、出力品質も比較しましょう。H200はメモリ容量を提供しますが、許容できる生成パラメータをあなたの代わりに選んでくれるわけではありません。
トークナイザー、モデルのリビジョン、サービスの設定を結果とともにアーカイブしてください。そうすれば、ソフトウェアの変更とハードウェアの変更を区別できます。
メモリを増やすべき適切なケース
ワークロードがすでに80GBに十分な余裕をもって収まっているなら、H200を選ぶ前にH100 PCIeのプランを比較してください。単一プロセスが141GBを超える必要がある場合は、MI300XとROCmの互換性を検討するか、B200でのマルチカード分割を準備しましょう。バッチを追加しても、プロセスのメモリが自動的に増えるわけではありません。
負荷テストからプランまで
3日間では、限定されたコンテキスト/並行数のマトリクスに集中してください。1週間あれば、エラー、再起動、エクスポートを追加できます。30日間は、すでに整理された反復キャンペーンに適しています。結果と最終マニフェストを取得する時間も確保してください。
設定にはバッチ数、準備、連絡先が必要です。暗号資産での支払いはKYCや身分証明書なしで利用できます。送金後は「支払いました」で報告し、注文で支払いステータスを確認してください。