[参照ページ](<https://kernodeck.com/ja/usages/inference>)

# 推論アプリケーションに合った GPU を選びましょう。

バッチ埋め込み、画像分類、対話型アプリケーションなど、Kernodeck ではご自身の推論に適した GPU をレンタルできます。RTX 4090 の 24 GB で、1 GPU を 7 日間利用するロットが 110.00 USD から始められます。計測済みのメモリと CUDA チェーンに応じて容量を選び、アプリケーションの準備と運用はご自身で行えます。

- バッチ処理または対話型処理
- 7日間に3つの予算
- ご自身のエンジンと設定

[RTX 4090 を選ぶ · 7 日間](<https://kernodeck.com/ja/compute/configure?config=rtx-4090&days=7>)

Kernodeckでは、このGPUレンタルの流れにおいて身分証明書もKYC手続きも不要です。必要なのはアカウントのみで、名、姓、メールアドレス、パスワードが必要です。ただし、これは匿名を意味するものではありません。

推論向けレンタル

アプリケーションに合わせた料金、負荷に応じて選ぶ容量。レンタル前に 24、48、80 GB を比較しましょう。

## 基本情報

| 項目 | 詳細 |
| --- | --- |
| 期間と単位 | 1ロットあたり3日、7日、または30日のプランです。1ロットには1 GPUが含まれますが、B200は2 GPUで、その価格にすでに含まれています。 |
| 可用性 | オファーごとのモデル別申告数量。将来の空き状況や提供日を予約するものではありません。プロジェクトが設置国や対象地域を必須とする場合は、購入前に確認してください。 |
| KYC不要 | Kernodeckでは、このGPUレンタルの流れにおいて身分証明書もKYC手続きも不要です。必要なのはアカウントのみで、名、姓、メールアドレス、パスワードが必要です。ただし、これは匿名を意味するものではありません。 |
| 準備 | Ubuntu、PyTorch、Blender、またはカスタムリクエスト。バージョン、CPU、RAM、ストレージ、ネットワーク、アクセス方法はプロジェクトに応じて確認が必要で、GPUモデルから自動的に決まるものではありません。 |
| 価格と条件 | 金額はUSDで、ロットおよび全期間分です。税務上の扱いや発生しうる手数料は、適用される条件でご確認ください。 |

## 利用可能なプラン

1ロットおよび全期間のUSD合計価格です。メモリはGPUあたりで示され、表示される在庫はロット数で表されます。

| モデル | GPUあたりのメモリ | ロットあたりのGPU数 | 期間 | ロット数 | 合計価格 | 申告在庫（ロット） | 状況 | 構成 |
| --- | --- | --- | --- | --- | --- | --- | --- | --- |
| [NVIDIA GeForce RTX 4090 24GB](<https://kernodeck.com/ja/compute/rtx-4090>) | 24 Go | 1 | 7日間 | 1 | 110.00 USD | 265 | カードあたり 24 GB に収まる負荷のバッチ処理向け。 | [このプランを構成する](<https://kernodeck.com/ja/compute/configure?config=rtx-4090&days=7>) |
| [NVIDIA L40S 48GB](<https://kernodeck.com/ja/compute/l40s>) | 48 Go | 1 | 7日間 | 1 | 148.00 USD | 74 | カードあたり 48 GB で対話型またはマルチモーダルな負荷を検討する向け。 | [このプランを構成する](<https://kernodeck.com/ja/compute/configure?config=l40s&days=7>) |
| [NVIDIA H100 SXM 80GB](<https://kernodeck.com/ja/compute/h100-sxm>) | 80 Go | 1 | 7日間 | 1 | 475.00 USD | 63 | 48 GB を超えるメモリが必要で、検証済みの CUDA スタックを使う場合。 | [このプランを構成する](<https://kernodeck.com/ja/compute/configure?config=h100-sxm&days=7>) |
| [NVIDIA B200 SXM](<https://kernodeck.com/ja/compute/b200>) | 180 Go | 2 | 7日間 | 1 | 2,071.00 USD | 4 | それぞれ180GBのGPU 2枚を、その利用を制御するアプリケーション向けに。 | [このプランを構成する](<https://kernodeck.com/ja/compute/configure?config=b200&days=7>) |

## バッチ処理の場合：必要なものから考え、次に料金を選ぶ

文書コレクションの埋め込みを生成したい、または画像セットを分類したいとします。CUDA パイプラインが入力、一時データ、計測済みの余裕を含めてこのメモリに収まるなら、24 GB の 1 GPU を 7 日間利用するロットが 110.00 USD の RTX 4090 が候補です。この料金でハードウェア予算の枠が決まります。ファイル数、再開ルール、保存する結果はご自身で決められます。

処理のメモリピークがこの容量を超える場合は、L40Sを比較してください：48 GBのGPU 1基を7日間借りる場合で 148.00 USD です。これは測定したワークロードに対してカードあたりより多くのスペースを提供します。両者の選択は、約束されたドキュメントの量ではなく、この容量とソフトウェアチェーンの互換性に基づいて行われます。

独立したパーティションが必要なら、B200は別の構成を提供します。2,071.00 USDで、180 GBのGPU 2枚を7日間借りられ、この価格に両方のカードがすでに含まれています。アプリケーションが処理を複数のワーカーに分散できる場合は、この選択肢を比較してください。ただし、2つのメモリが360 GBの単一空間になるわけではありません。

- [RTX 4090で7日間を選択 — 110.00 USD](<https://kernodeck.com/ja/compute/configure?config=rtx-4090&days=7>)
- [L40Sで7日間を選択 — 148.00 USD](<https://kernodeck.com/ja/compute/configure?config=l40s&days=7>)
- [分散処理向けのB200プランを検討する](<https://kernodeck.com/ja/compute/b200>)

## 対話型アプリケーションの場合：負荷全体を収めるメモリを選ぶ

アシスタントや社内ツールでは、同時リクエスト、その長さ、エンジン固有のキャッシュを考慮する必要があります。148.00 USDで48 GBのGPU 1基を7日間利用するL40Sは、この負荷全体がそのメモリに収まり、お使いのエンジンがCUDAスタックをサポートしていれば候補になります。キューと応答の計測結果が、構成を選ぶ際の基準となります。

カード1枚あたりのメモリをさらに必要とする場合は、H100 SXMを比較してください：475.00 USDは80 GBのGPU 1基を7日間利用する場合の料金です。GPUあたりの容量は増えますが、アプリケーションのレイテンシやスループットを保証するには十分ではありません。必要な容量がすでに24 GBに収まっている場合は、上位のプランを契約する前にRTX 4090を比較検討してください。

このサービスは、お客様のアプリケーション向けのGPUレンタルです。マネージド推論APIは別カテゴリのサービスであり、運用された呼び出しエンドポイントをまず求める場合に適しているかもしれません。Kernodeckでは、エンジン、依存関係、その運用はお客様のご準備となります。プロジェクトに必要な準備とアクセス方法については、環境を選ぶ前に確認が必要です。

- [H100 SXMで7日間を選択 — 475.00 USD](<https://kernodeck.com/ja/compute/configure?config=h100-sxm&days=7>)
- [L40Sとそのプランを比較する](<https://kernodeck.com/ja/compute/l40s>)
- [RTX 4090で24 GBに戻る](<https://kernodeck.com/ja/compute/rtx-4090>)
- [アプリケーションのソフトウェアスタックを準備する](<https://kernodeck.com/ja/docs/environnements-reproductibles>)
- [3日、7日、30日のプランを比較する](<https://kernodeck.com/ja/pricing>)

## プランは暗号資産で直接お支払いいただけます。

Kernodeck のレンタルは暗号資産で直接支払え、入金の強制はありません。特に Bitcoin 上の BTC と Tron 上の USDT (TRC-20) に対応しています。手続きに身分証明書や KYC は不要です。アカウントには名、姓、メールアドレス、パスワードが必要で、匿名性を保証するものではありません。

- [対応する8つの資産とネットワークを比較する](<https://kernodeck.com/ja/docs/crypto-payments>)

## レンタルを正当化する成果物を定義する

ファイル処理であれば、走査する件数、出力形式、再開のルールを定義します。処理済みのファイルは、実行全体を読み直さなくても判別できる必要があります。対話型サービスであれば、リクエストの最大サイズ、許容できる遅延、容量に達したときの挙動を定義します。同じモデルでも、これらの制約によって大きく異なる構成が必要になることがあります。

短いケース、典型的なケース、そして限界に近いケースを含む代表的なサンプルを保持します。埋め込みのパイプラインでは、各ベクトルをその入力の識別子とバージョンに対応付けます。テキスト生成では、評価に使用した生成パラメータを記録します。結果の差異を説明できるようにしておく必要があり、それを直ちに GPU のせいにしてはいけません。

## 推論負荷全体に必要なメモリを選ぶ

モデルのファイルサイズだけでは、推論中に使用されるメモリのすべてを表せません。一時テンソル、入力、保持される出力、そして該当するモデルでは attention のキーと値のキャッシュも考慮する必要があります。このキャッシュは、シーケンスが長くなったり、複数のリクエストをまとめて処理したりすると、大きなものになり得ます。

まず、代表的な検証を測定可能な余裕をもって実行できるメモリのカードから始めます。24、32、48、80 GB 以上のモデルはそれぞれ異なる用途に応えますが、ある容量があれば特定のモデルがすべての設定で通ることを保証するものではありません。精度を下げたり量子化したりするとフットプリントは変わり得ますが、ソフトウェアの対応と、自分の入力に対する出力品質を確認する必要があります。

- [カタログのメモリ容量を比較する](<https://kernodeck.com/ja/compute>)
- [メモリを消費しているフェーズを特定する](<https://kernodeck.com/ja/docs/observer-un-lancement>)

## お使いのソフトウェアスタックに対応するGPUを選ぶ

ハードウェアを選ぶ前に、推論エンジン、その特殊な演算子、依存している拡張を洗い出します。PyTorch アプリケーションは複数の実行パスを提供できる一方、専用の拡張はそのうち 1 つしかサポートしないことがあります。NVIDIA なら CUDA、AMD なら ROCm で、モデルの読み込みや前処理を含む一連の経路全体を確認します。

パイプラインを通って結果の書き込みに至るまでの最小限のコマンドを維持してください。その後になって初めて、最適化を一つずつ有効にしていきます。精度、コンパイル、エンジンの変更はそれぞれ、同等の品質管理を保つ必要があります。読み込みの成功は重みが読み取り可能であることを示すだけで、必要な計算パスがすべて機能していることを示すものではありません。

## 処理目標に合わせてバッチを調整しましょう

方法の例：テキストを長さごとに3つのグループに分け、それぞれをバッチサイズ1、2、4で処理します。これらのサイズは試行の出発点であり、万能な推奨値ではありません。各組み合わせについて、完了した入力数、合計時間、観測された最大メモリ、エラーを記録します。失敗を平均値で覆い隠すのではなく、限界が現れた時点で進行を止めてください。

対話型サービスであれば、キューで待機した時間も加えます。バッチを大きくするとスループットとリクエストあたりの体感遅延が変わり得るため、単一の平均だけでは選べません。オフライン処理であれば、グルーピングによって結果の順序が入れ替わらないことを確認します。最終的には、品質基準と遅延の制約を満たす構成を選びます。

## アプリケーションが作業を分散できる場合は複数の GPU に切り替えましょう

モデルの各インスタンスが1枚のカードに収まる場合は、入力の異なるパーティションを消費する複数のワーカーを構成できます。その場合は、識別子、再開、出力の収集を調整する必要があります。モデルをカード間に分割する必要がある場合は、お使いのエンジンがサポートする並列化戦略を使用し、その通信要件を確認してください。

注文するロットはハードウェアの数量を表し、アプリケーションのバッチや統合されたメモリ空間を表すものではありません。B200では、1ロットは2枚のカードで構成されます。その他のプランでは、1ロットは1枚のカードです。予定するワーカー数、各ワーカーに割り当てる入力の割合、ジョブが実際に完了したことを確認する方法を、資料に明記してください。

## 検証とエクスポートを含む期間を選びましょう

初めての3日間のレンタルでは、限定的な目標を設定しましょう。インストール、パイプラインの検証、そして最初の実用的な結果の生成です。7日間の期間はより多くのバリエーションを試すのに役立ち、30日間は処理を繰り返して運用を固めるのに役立ちます。これらは作業を整理する方法であり、実行時間の約束ではありません。

出力時には、重みまたはそのバージョン、設定、品質チェック、実際に得られた測定値、エクスポートされた結果を保管してください。ソフトウェアと処理はご自身の裁量で選択できます。Kernodeckはその内容を検査しません。アクセス情報、バックアップ、およびモデルとデータの使用に必要な許諾はご自身で準備してください。

## 購入前の質問

### 初めての推論処理にはどのプランを選べばよいですか？

お使いのCUDAパイプラインと代表的なバッチが、計測した余裕を持って24 GBに収まる場合は、RTX 4090から比較を始めてください：110.00 USDはGPU 1基を7日間利用する場合の料金です。このプランはそのレンタル期間をカバーするもので、アプリケーションが処理できるファイル数は定められません。計画にはインストール、出力の確認、エクスポートを含めてください。3日と30日のプランで別の期間を選ぶこともできます。

### いつL40SやH100 SXMに追加費用を払うべきですか？

負荷全体が24 GBの利用可能な余裕を超える場合は48 GBのL40Sを、カード1枚あたりのメモリをさらに求める場合は80 GBのH100 SXMを比較してください。7日間のプランはそれぞれ148.00 USDと475.00 USDで、いずれもGPU 1基あたりの料金です。モデル、入力、一時ファイル、キャッシュを計測に含めてください。容量が大きいだけでは、アプリケーションの応答が良くなる保証にはなりません。

### レンタルには、すぐに呼び出せる推論APIが含まれますか？

ここで紹介しているサービスは、お客様自身のアプリケーション向けのGPUレンタルであり、すぐに呼び出せると謳うマネージド推論APIは含まれません。エンジン、モデル、依存関係、設定はお客様が選択し、その運用を組み立てます。マネージドサービスを優先する場合は、そのカテゴリのサービスを別途比較してください。Kernodeckでのレンタルには、プロジェクトに必要な準備とアクセス方法を確認のうえ進めてください。

### B200は複数の同時処理に論理的な選択ですか？

アプリケーションが独立したパーティションを複数のワーカーに割り当てられる場合や、明示的な分散をサポートしている場合に検討すべき選択肢になります。7日間で2,071.00 USDの場合、1つのB200ロットにはすでに180GBのGPUが2枚含まれています。メモリは自動的に統合されません。分散モデルには、お使いのエンジンに対応した戦略が必要です。予定している負荷に1枚で足りるなら、1枚あたりのコストも比較してください。

## 選択と構成

- [再現可能な推論環境を準備する](<https://kernodeck.com/ja/docs/environnements-reproductibles>)
- [NVIDIAの48GBオプションを検討する](<https://kernodeck.com/ja/compute/l40s>)
- [ROCmチェーン向けのAMDオプションを検討する](<https://kernodeck.com/ja/compute/mi300x>)
- [3日、7日、または30日の期間を選択する](<https://kernodeck.com/ja/pricing>)
- [対応する8組の暗号資産ペア](<https://kernodeck.com/ja/docs/crypto-payments>)
- [推論用の容量を選ぶ](<https://kernodeck.com/ja/usages/inference>)
