プロジェクト向けGPU · KYC不要の暗号資産決済 レンタル方法
日本語
コンソールを開く
KERNODECK / VOTRE APPLICATION

推論アプリケーションに合った GPU を選びましょう。

バッチ埋め込み、画像分類、対話型アプリケーションなど、Kernodeck ではご自身の推論に適した GPU をレンタルできます。RTX 4090 の 24 GB で、1 GPU を 7 日間利用するロットが 110.00 USD から始められます。計測済みのメモリと CUDA チェーンに応じて容量を選び、アプリケーションの準備と運用はご自身で行えます。

  • バッチ処理または対話型処理
  • 7日間に3つの予算
  • ご自身のエンジンと設定
Kernodeckでは、このGPUレンタルの流れにおいて身分証明書もKYC手続きも不要です。必要なのはアカウントのみで、名、姓、メールアドレス、パスワードが必要です。ただし、これは匿名を意味するものではありません。 アカウントデータ ↗
3つの容量 · 1週間

ワークロードを具体的な予算に結び付けます。

モデル、入力、一時メモリ、同時実行数が選択の指針となります。アプリケーションに必要なバージョンとアクセスは確認が必要です。

バッチ処理の場合:必要なものから考え、次に料金を選ぶ

文書コレクションの埋め込みを生成したい、または画像セットを分類したいとします。CUDA パイプラインが入力、一時データ、計測済みの余裕を含めてこのメモリに収まるなら、24 GB の 1 GPU を 7 日間利用するロットが 110.00 USD の RTX 4090 が候補です。この料金でハードウェア予算の枠が決まります。ファイル数、再開ルール、保存する結果はご自身で決められます。

処理のメモリピークがこの容量を超える場合は、L40Sを比較してください:48 GBのGPU 1基を7日間借りる場合で 148.00 USD です。これは測定したワークロードに対してカードあたりより多くのスペースを提供します。両者の選択は、約束されたドキュメントの量ではなく、この容量とソフトウェアチェーンの互換性に基づいて行われます。

独立したパーティションが必要なら、B200は別の構成を提供します。2,071.00 USDで、180 GBのGPU 2枚を7日間借りられ、この価格に両方のカードがすでに含まれています。アプリケーションが処理を複数のワーカーに分散できる場合は、この選択肢を比較してください。ただし、2つのメモリが360 GBの単一空間になるわけではありません。

対話型アプリケーションの場合:負荷全体を収めるメモリを選ぶ

アシスタントや社内ツールでは、同時リクエスト、その長さ、エンジン固有のキャッシュを考慮する必要があります。148.00 USDで48 GBのGPU 1基を7日間利用するL40Sは、この負荷全体がそのメモリに収まり、お使いのエンジンがCUDAスタックをサポートしていれば候補になります。キューと応答の計測結果が、構成を選ぶ際の基準となります。

カード1枚あたりのメモリをさらに必要とする場合は、H100 SXMを比較してください:475.00 USDは80 GBのGPU 1基を7日間利用する場合の料金です。GPUあたりの容量は増えますが、アプリケーションのレイテンシやスループットを保証するには十分ではありません。必要な容量がすでに24 GBに収まっている場合は、上位のプランを契約する前にRTX 4090を比較検討してください。

このサービスは、お客様のアプリケーション向けのGPUレンタルです。マネージド推論APIは別カテゴリのサービスであり、運用された呼び出しエンドポイントをまず求める場合に適しているかもしれません。Kernodeckでは、エンジン、依存関係、その運用はお客様のご準備となります。プロジェクトに必要な準備とアクセス方法については、環境を選ぶ前に確認が必要です。

お支払い

プランは暗号資産で直接お支払いいただけます。

Kernodeck のレンタルは暗号資産で直接支払え、入金の強制はありません。特に Bitcoin 上の BTC と Tron 上の USDT (TRC-20) に対応しています。手続きに身分証明書や KYC は不要です。アカウントには名、姓、メールアドレス、パスワードが必要で、匿名性を保証するものではありません。

対応する8つの資産とネットワークを比較 ↗

プロジェクトに役立つ条件

可用性. オファーごとのモデル別申告数量。将来の空き状況や提供日を予約するものではありません。プロジェクトが設置国や対象地域を必須とする場合は、購入前に確認してください。

準備. Ubuntu、PyTorch、Blender、またはカスタムリクエスト。バージョン、CPU、RAM、ストレージ、ネットワーク、アクセス方法はプロジェクトに応じて確認が必要で、GPUモデルから自動的に決まるものではありません。

価格と条件. 金額はUSDで、ロットおよび全期間分です。税務上の扱いや発生しうる手数料は、適用される条件でご確認ください。

レンタル条件を読む ↗
AVANT DE CHOISIR

推論にはどの容量をレンタルすべきですか?

初めての推論処理にはどのプランを選べばよいですか?

お使いのCUDAパイプラインと代表的なバッチが、計測した余裕を持って24 GBに収まる場合は、RTX 4090から比較を始めてください:110.00 USDはGPU 1基を7日間利用する場合の料金です。このプランはそのレンタル期間をカバーするもので、アプリケーションが処理できるファイル数は定められません。計画にはインストール、出力の確認、エクスポートを含めてください。3日と30日のプランで別の期間を選ぶこともできます。

いつL40SやH100 SXMに追加費用を払うべきですか?

負荷全体が24 GBの利用可能な余裕を超える場合は48 GBのL40Sを、カード1枚あたりのメモリをさらに求める場合は80 GBのH100 SXMを比較してください。7日間のプランはそれぞれ148.00 USDと475.00 USDで、いずれもGPU 1基あたりの料金です。モデル、入力、一時ファイル、キャッシュを計測に含めてください。容量が大きいだけでは、アプリケーションの応答が良くなる保証にはなりません。

レンタルには、すぐに呼び出せる推論APIが含まれますか?

ここで紹介しているサービスは、お客様自身のアプリケーション向けのGPUレンタルであり、すぐに呼び出せると謳うマネージド推論APIは含まれません。エンジン、モデル、依存関係、設定はお客様が選択し、その運用を組み立てます。マネージドサービスを優先する場合は、そのカテゴリのサービスを別途比較してください。Kernodeckでのレンタルには、プロジェクトに必要な準備とアクセス方法を確認のうえ進めてください。

B200は複数の同時処理に論理的な選択ですか?

アプリケーションが独立したパーティションを複数のワーカーに割り当てられる場合や、明示的な分散をサポートしている場合に検討すべき選択肢になります。7日間で2,071.00 USDの場合、1つのB200ロットにはすでに180GBのGPUが2枚含まれています。メモリは自動的に統合されません。分散モデルには、お使いのエンジンに対応した戦略が必要です。予定している負荷に1枚で足りるなら、1枚あたりのコストも比較してください。

作業を準備するために

プラン選択からアプリケーションまで。

入力と応答時間を確認する

GPU の前にデータを検証する型、形状、値を確認して無効な入力を切り分ける。PyTorch のステップをプロファイリングする測定範囲を区切り、早合点せずに CPU/GPU トレースを読む。

レンタルを正当化する成果物を定義する

ファイル処理であれば、走査する件数、出力形式、再開のルールを定義します。処理済みのファイルは、実行全体を読み直さなくても判別できる必要があります。対話型サービスであれば、リクエストの最大サイズ、許容できる遅延、容量に達したときの挙動を定義します。同じモデルでも、これらの制約によって大きく異なる構成が必要になることがあります。

短いケース、典型的なケース、そして限界に近いケースを含む代表的なサンプルを保持します。埋め込みのパイプラインでは、各ベクトルをその入力の識別子とバージョンに対応付けます。テキスト生成では、評価に使用した生成パラメータを記録します。結果の差異を説明できるようにしておく必要があり、それを直ちに GPU のせいにしてはいけません。

推論負荷全体に必要なメモリを選ぶ

モデルのファイルサイズだけでは、推論中に使用されるメモリのすべてを表せません。一時テンソル、入力、保持される出力、そして該当するモデルでは attention のキーと値のキャッシュも考慮する必要があります。このキャッシュは、シーケンスが長くなったり、複数のリクエストをまとめて処理したりすると、大きなものになり得ます。

まず、代表的な検証を測定可能な余裕をもって実行できるメモリのカードから始めます。24、32、48、80 GB 以上のモデルはそれぞれ異なる用途に応えますが、ある容量があれば特定のモデルがすべての設定で通ることを保証するものではありません。精度を下げたり量子化したりするとフットプリントは変わり得ますが、ソフトウェアの対応と、自分の入力に対する出力品質を確認する必要があります。

お使いのソフトウェアスタックに対応するGPUを選ぶ

ハードウェアを選ぶ前に、推論エンジン、その特殊な演算子、依存している拡張を洗い出します。PyTorch アプリケーションは複数の実行パスを提供できる一方、専用の拡張はそのうち 1 つしかサポートしないことがあります。NVIDIA なら CUDA、AMD なら ROCm で、モデルの読み込みや前処理を含む一連の経路全体を確認します。

パイプラインを通って結果の書き込みに至るまでの最小限のコマンドを維持してください。その後になって初めて、最適化を一つずつ有効にしていきます。精度、コンパイル、エンジンの変更はそれぞれ、同等の品質管理を保つ必要があります。読み込みの成功は重みが読み取り可能であることを示すだけで、必要な計算パスがすべて機能していることを示すものではありません。

処理目標に合わせてバッチを調整しましょう

方法の例:テキストを長さごとに3つのグループに分け、それぞれをバッチサイズ1、2、4で処理します。これらのサイズは試行の出発点であり、万能な推奨値ではありません。各組み合わせについて、完了した入力数、合計時間、観測された最大メモリ、エラーを記録します。失敗を平均値で覆い隠すのではなく、限界が現れた時点で進行を止めてください。

対話型サービスであれば、キューで待機した時間も加えます。バッチを大きくするとスループットとリクエストあたりの体感遅延が変わり得るため、単一の平均だけでは選べません。オフライン処理であれば、グルーピングによって結果の順序が入れ替わらないことを確認します。最終的には、品質基準と遅延の制約を満たす構成を選びます。

アプリケーションが作業を分散できる場合は複数の GPU に切り替えましょう

モデルの各インスタンスが1枚のカードに収まる場合は、入力の異なるパーティションを消費する複数のワーカーを構成できます。その場合は、識別子、再開、出力の収集を調整する必要があります。モデルをカード間に分割する必要がある場合は、お使いのエンジンがサポートする並列化戦略を使用し、その通信要件を確認してください。

注文するロットはハードウェアの数量を表し、アプリケーションのバッチや統合されたメモリ空間を表すものではありません。B200では、1ロットは2枚のカードで構成されます。その他のプランでは、1ロットは1枚のカードです。予定するワーカー数、各ワーカーに割り当てる入力の割合、ジョブが実際に完了したことを確認する方法を、資料に明記してください。

検証とエクスポートを含む期間を選びましょう

初めての3日間のレンタルでは、限定的な目標を設定しましょう。インストール、パイプラインの検証、そして最初の実用的な結果の生成です。7日間の期間はより多くのバリエーションを試すのに役立ち、30日間は処理を繰り返して運用を固めるのに役立ちます。これらは作業を整理する方法であり、実行時間の約束ではありません。

出力時には、重みまたはそのバージョン、設定、品質チェック、実際に得られた測定値、エクスポートされた結果を保管してください。ソフトウェアと処理はご自身の裁量で選択できます。Kernodeckはその内容を検査しません。アクセス情報、バックアップ、およびモデルとデータの使用に必要な許諾はご自身で準備してください。

このページをMarkdownで読む ↗