[Halaman referensi](<https://kernodeck.com/id/usages/inference>)

# Pilih GPU untuk aplikasi inferensi Anda.

Embedding batch, klasifikasi gambar, atau aplikasi interaktif: sewa di Kernodeck GPU yang sesuai untuk inferensi Anda sendiri. Mulailah dengan RTX 4090 24 GB seharga 110,00 USD untuk lot 1 GPU selama 7 hari. Pilih kapasitas sesuai memori terukur dan rangkaian CUDA Anda; Anda tetap mengelola persiapan dan pengoperasian aplikasi.

- Pemrosesan batch atau interaktif
- Tiga anggaran selama 7 hari
- Mesin dan pengaturan Anda sendiri

[Pilih RTX 4090 · 7 hari](<https://kernodeck.com/id/compute/configure?config=rtx-4090&days=7>)

Di Kernodeck, tidak ada identitas resmi maupun prosedur KYC dalam alur sewa GPU ini. Akun diperlukan: nama depan, nama belakang, email, dan kata sandi; ini tidak berarti anonim.

Sewa untuk inferensi

Satu forfait untuk aplikasi Anda, kapasitas yang dipilih sesuai bebannya: bandingkan 24, 48, dan 80 GB sebelum menyewa.

## Fakta penting

| Fakta | Detail |
| --- | --- |
| Periode dan unit | Paket 3, 7, atau 30 hari untuk satu lot. Satu lot berisi 1 GPU, kecuali B200: 2 GPU, sudah termasuk dalam harganya. |
| Ketersediaan | Jumlah yang dinyatakan per model dalam penawaran. Jumlah ini tidak mereservasi ketersediaan di masa mendatang maupun tanggal ketersediaan. Negara hosting dan wilayah layanan perlu dikonfirmasi sebelum membeli jika proyek Anda mengharuskannya. |
| Tanpa KYC | Di Kernodeck, tidak ada identitas resmi maupun prosedur KYC dalam alur sewa GPU ini. Akun diperlukan: nama depan, nama belakang, email, dan kata sandi; ini tidak berarti anonim. |
| Persiapan | Ubuntu, PyTorch, Blender, atau permintaan khusus. Versi, CPU, RAM, penyimpanan, jaringan, dan mode akses harus dikonfirmasi sesuai proyek; penyertaannya tidak dapat disimpulkan dari model GPU. |
| Harga dan ketentuan | Jumlah dalam USD untuk paket dan seluruh periode. Status pajak dan biaya yang mungkin timbul harus dikonfirmasi dalam syarat yang berlaku. |

## Paket yang tersedia

Harga total dalam USD untuk satu lot dan seluruh periode. Memori ditampilkan per GPU; stok yang dinyatakan dihitung dalam lot.

| Model | Memori per GPU | GPU per lot | Durasi | Lot | Harga total | Stok dinyatakan dalam lot | Status | Konfigurasi |
| --- | --- | --- | --- | --- | --- | --- | --- | --- |
| [NVIDIA GeForce RTX 4090 24GB](<https://kernodeck.com/id/compute/rtx-4090>) | 24 Go | 1 | 7 hari | 1 | 110,00 USD | 265 | Untuk pemrosesan batch yang bebannya muat dalam 24 GB per kartu. | [Konfigurasi paket ini](<https://kernodeck.com/id/compute/configure?config=rtx-4090&days=7>) |
| [NVIDIA L40S 48GB](<https://kernodeck.com/id/compute/l40s>) | 48 Go | 1 | 7 hari | 1 | 148,00 USD | 74 | Untuk menguji beban interaktif atau multimodal dengan 48 GB per kartu. | [Konfigurasi paket ini](<https://kernodeck.com/id/compute/configure?config=l40s&days=7>) |
| [NVIDIA H100 SXM 80GB](<https://kernodeck.com/id/compute/h100-sxm>) | 80 Go | 1 | 7 hari | 1 | 475,00 USD | 63 | Untuk kebutuhan memori yang melampaui 48 GB, dengan tumpukan CUDA yang tervalidasi. | [Konfigurasi paket ini](<https://kernodeck.com/id/compute/configure?config=h100-sxm&days=7>) |
| [NVIDIA B200 SXM](<https://kernodeck.com/id/compute/b200>) | 180 Go | 2 | 7 hari | 1 | 2.071,00 USD | 4 | Dua GPU masing-masing 180 GB untuk aplikasi yang mengatur penggunaannya. | [Konfigurasi paket ini](<https://kernodeck.com/id/compute/configure?config=b200&days=7>) |

## Untuk pemrosesan batch Anda: mulai dari kebutuhan, lalu forfait

Anda ingin menghasilkan embedding untuk kumpulan dokumen atau mengklasifikasikan sekumpulan gambar? RTX 4090 adalah kandidat seharga 110,00 USD untuk lot 1 GPU 24 GB selama 7 hari jika pipeline CUDA Anda muat dalam memori tersebut bersama input, data sementara, dan margin terukurnya. Forfait ini membatasi anggaran perangkat keras Anda; Anda menentukan jumlah file, aturan pemulihan, dan hasil yang harus disimpan.

Jika puncak memori pemrosesan Anda melebihi kapasitas ini, bandingkan L40S: 148,00 USD untuk paket 1 GPU 48 GB selama 7 hari. Kartu ini memberi lebih banyak ruang per kartu untuk beban yang Anda ukur. Pilihan di antara keduanya terletak pada kapasitas ini dan kompatibilitas rantai perangkat lunak Anda, bukan pada volume dokumen yang dijanjikan.

Untuk partisi independen, B200 menawarkan organisasi lain: 2.071,00 USD untuk paket 2 GPU masing-masing 180 GB selama 7 hari, kedua kartu sudah termasuk dalam harga ini. Bandingkan opsi ini ketika aplikasi Anda mampu mendistribusikan pemrosesan ke beberapa pekerja. Ini tidak mengubah kedua memori menjadi satu ruang tunggal berukuran 360 GB.

- [Pilih 7 hari pada RTX 4090 — 110,00 USD](<https://kernodeck.com/id/compute/configure?config=rtx-4090&days=7>)
- [Pilih 7 hari pada L40S — 148,00 USD](<https://kernodeck.com/id/compute/configure?config=l40s&days=7>)
- [Pelajari paket B200 untuk pemrosesan terdistribusi](<https://kernodeck.com/id/compute/b200>)

## Untuk aplikasi interaktif: pilih memori untuk beban penuh Anda

Asisten atau alat internal harus memperhitungkan permintaan bersamaan, panjangnya, dan cache khusus mesin inferensi. L40S dengan 148,00 USD untuk paket 1 GPU 48 GB selama 7 hari adalah kandidat jika beban penuh ini muat dalam memorinya dan jika mesin Anda mendukung rantai CUDA-nya. Pengukuran antrean dan respons Anda tetap menjadi kriteria untuk memilih konfigurasi.

Jika Anda memerlukan lebih banyak memori pada satu kartu, bandingkan H100 SXM: 475,00 USD untuk paket 1 GPU 80 GB selama 7 hari. Kartu ini menambah kapasitas per GPU; itu saja tidak cukup untuk menjamin latensi atau throughput aplikasi Anda. Jika kebutuhan Anda sudah muat dalam 24 GB, RTX 4090 tetap layak dibandingkan sebelum memilih paket yang lebih tinggi.

Penawaran ini adalah penyewaan GPU untuk aplikasi Anda. API inferensi terkelola merupakan kategori layanan yang berbeda: bisa cocok jika Anda terutama mencari titik panggil yang dikelola untuk Anda. Di Kernodeck, siapkan mesin inferensi Anda, dependensinya, dan operasionalnya; penyiapan serta ketentuan akses yang diperlukan proyek Anda masih perlu dikonfirmasi sebelum memilih lingkungan Anda.

- [Pilih 7 hari pada H100 SXM — 475,00 USD](<https://kernodeck.com/id/compute/configure?config=h100-sxm&days=7>)
- [Bandingkan L40S dan paket-paketnya](<https://kernodeck.com/id/compute/l40s>)
- [Kembali ke 24 GB dengan RTX 4090](<https://kernodeck.com/id/compute/rtx-4090>)
- [Siapkan rantai perangkat lunak aplikasi Anda](<https://kernodeck.com/id/docs/environnements-reproductibles>)
- [Bandingkan paket 3, 7, dan 30 hari](<https://kernodeck.com/id/pricing>)

## Paket Anda, dapat dibayar langsung dengan kripto.

Bayar sewa Kernodeck Anda langsung dengan crypto, tanpa top-up yang diwajibkan: BTC di Bitcoin dan USDT di Tron (TRC-20), antara lain. Prosesnya tidak memerlukan dokumen identitas maupun prosedur KYC; akun dengan nama depan, nama belakang, email, dan kata sandi diperlukan, tanpa janji anonimitas.

- [Bandingkan delapan aset dan jaringan yang diterima](<https://kernodeck.com/id/docs/crypto-payments>)

## Tetapkan hasil yang membenarkan penyewaan Anda

Untuk pemrosesan berkas, tentukan volume yang akan diproses, format output, dan aturan pemulihan. Berkas yang selesai harus dapat dikenali tanpa membaca ulang seluruh eksekusi. Untuk layanan interaktif, tentukan ukuran maksimum permintaan, waktu tunggu yang dapat diterima, dan perilaku ketika kapasitas tercapai. Model yang sama dapat menuntut dua pengaturan yang sangat berbeda bergantung pada kendala ini.

Simpan sampel representatif dengan kasus pendek, umum, dan yang mendekati batas Anda. Dalam pipeline embeddings, kaitkan setiap vektor dengan pengenal dan versi inputnya. Dalam generasi teks, catat parameter generasi yang digunakan untuk evaluasi. Anda harus dapat menjelaskan perbedaan hasil tanpa langsung menyalahkan GPU.

## Pilih memori untuk seluruh beban inferensi

Bobot berkas model tidak menggambarkan seluruh memori yang digunakan selama inferensi. Perlu juga mempertimbangkan tensor sementara, input, output yang disimpan, dan untuk model yang bersangkutan, cache key dan value dari attention. Cache ini dapat menjadi besar ketika sekuens memanjang atau beberapa permintaan diproses bersamaan.

Mulailah dengan kartu yang memorinya memungkinkan uji coba representatif Anda dengan margin terukur. Model 24, 32, 48, 80 GB dan lebih besar menjawab kebutuhan yang berbeda; tidak ada kapasitas yang menjamin model tertentu akan berjalan dengan semua pengaturannya. Mengurangi presisi atau kuantisasi dapat mengubah jejak memori, tetapi menuntut verifikasi dukungan perangkat lunak dan kualitas output pada input Anda sendiri.

- [Bandingkan kapasitas memori dari katalog](<https://kernodeck.com/id/compute>)
- [Identifikasi fase yang mengonsumsi memori](<https://kernodeck.com/id/docs/observer-un-lancement>)

## Pilih GPU yang kompatibel dengan rantai perangkat lunak Anda

Daftarkan mesin inferensi, operator khususnya, dan ekstensi yang Anda andalkan sebelum memilih perangkat keras. Aplikasi PyTorch dapat menawarkan beberapa jalur eksekusi, sedangkan ekstensi khusus hanya mendukung satu. Verifikasi seluruh rantai pada CUDA untuk NVIDIA atau pada ROCm untuk AMD, termasuk pemuatan model dan prapemrosesannya.

Simpan perintah minimal yang menelusuri pipeline hingga penulisan hasil. Baru setelah itu, aktifkan optimasi Anda satu per satu. Setiap perubahan presisi, kompilasi, atau mesin harus mempertahankan kontrol kualitas yang sebanding. Pemuatan yang berhasil membuktikan bahwa bobot dapat dibaca; itu tidak membuktikan bahwa semua jalur komputasi yang diperlukan berfungsi.

## Atur batch sesuai tujuan pemrosesan Anda

Contoh metode: buat tiga kelompok teks berdasarkan panjang, lalu proses masing-masing dengan batch 1, 2, dan 4 input. Ukuran ini berfungsi sebagai titik uji, bukan rekomendasi universal. Untuk setiap kombinasi, catat input yang selesai, waktu total, memori maksimum yang teramati, dan kesalahan. Hentikan kemajuan ketika batas muncul alih-alih menyembunyikan kegagalan dalam rata-rata.

Untuk layanan interaktif, tambahkan waktu yang dihabiskan dalam antrean. Batch yang lebih besar dapat mengubah throughput dan waktu tunggu yang dirasakan oleh suatu permintaan; satu rata-rata saja tidak cukup untuk memilih. Untuk pemrosesan offline, pastikan pengelompokan tidak mengacak urutan hasil. Akhirnya pilih konfigurasi yang memenuhi kriteria kualitas dan kendala waktu Anda.

## Beralih ke beberapa GPU jika aplikasi Anda dapat mendistribusikan pekerjaan

Jika setiap salinan model muat pada satu kartu, Anda dapat mengatur beberapa pekerja yang mengonsumsi partisi input yang berbeda. Maka perlu mengoordinasikan pengenal, pemulihan, dan pengumpulan output. Jika model harus dibagi antar kartu, gunakan strategi paralelisme yang didukung oleh mesin Anda dan verifikasi persyaratan komunikasinya.

Paket yang dipesan menggambarkan jumlah perangkat keras, bukan batch aplikasi maupun ruang memori gabungan. Untuk B200, satu paket mencakup dua kartu; untuk penawaran lainnya, satu paket mencakup satu kartu. Cantumkan dalam berkas Anda jumlah pekerja yang direncanakan, porsi masukan yang dipercayakan kepada masing-masing, dan cara memastikan bahwa suatu pekerjaan benar-benar selesai.

## Pilih periode yang mencakup kontrol dan ekspor

Untuk penyewaan pertama selama 3 hari, tetapkan tujuan yang terbatas: menginstal, memvalidasi pipeline, dan menghasilkan hasil pertama yang dapat digunakan. Durasi 7 hari dapat dimanfaatkan untuk menjajaki lebih banyak varian; 30 hari untuk mengulang suatu pemrosesan dan mengonsolidasikan operasinya. Ini adalah cara mengorganisasi pekerjaan, bukan janji waktu eksekusi.

Pada akhirnya, simpan bobot atau versinya, konfigurasi, pemeriksaan kualitas, metrik yang benar-benar diperoleh, dan hasil yang diekspor. Anda memilih perangkat lunak dan pemrosesan Anda secara mandiri; Kernodeck tidak melakukan inspeksi atas isinya. Siapkan sendiri akses, cadangan, dan izin yang diperlukan untuk penggunaan model dan data.

## Pertanyaan sebelum membeli

### Paket mana yang harus dipilih untuk pemrosesan inferensi pertama?

Jika pipeline CUDA dan satu batch representatif Anda muat dalam 24 GB dengan margin terukur, mulailah perbandingan dari RTX 4090: 110,00 USD untuk paket 1 GPU selama 7 hari. Paket ini mencakup periode penyewaan tersebut, tanpa menetapkan jumlah berkas yang dapat diproses aplikasi Anda. Sertakan instalasi, kontrol keluaran, dan ekspor dalam rencana Anda; paket 3 dan 30 hari memungkinkan Anda memilih periode lain.

### Kapan harus membayar lebih untuk L40S atau H100 SXM?

Bandingkan L40S 48 GB ketika beban penuh melebihi margin yang tersedia pada 24 GB, lalu H100 SXM 80 GB jika Anda mencari lebih banyak memori pada satu kartu. Paket 7 hari masing-masing berharga 148,00 USD dan 475,00 USD, keduanya untuk paket 1 GPU. Sertakan model, input, data sementara, dan cache dalam pengukuran Anda; kapasitas yang lebih tinggi saja tidak menjamin respons yang lebih baik untuk aplikasi Anda.

### Apakah penyewaan mencakup API inferensi yang siap dipanggil?

Penawaran yang disajikan di sini adalah penyewaan GPU untuk aplikasi Anda sendiri, dan tidak mencakup API inferensi terkelola yang dinyatakan siap dipanggil. Anda memilih mesin inferensi, model, dependensi, dan pengaturannya, lalu Anda mengatur operasionalnya. Jika prioritas Anda adalah layanan terkelola, bandingkan kategori penawaran itu secara terpisah. Untuk menyewa di Kernodeck, mintalah konfirmasi atas penyiapan dan ketentuan akses yang diperlukan proyek Anda.

### Apakah B200 pilihan logis untuk beberapa pemrosesan bersamaan?

Opsi ini menjadi layak dipertimbangkan jika aplikasi Anda dapat menyerahkan partisi independen kepada beberapa pekerja atau mendukung distribusi eksplisit. Dengan 2.071,00 USD selama 7 hari, satu paket B200 sudah mencakup 2 GPU masing-masing 180 GB. Memori tersebut tidak otomatis menyatu; model terdistribusi memerlukan strategi yang kompatibel dengan mesin inferensi Anda. Bandingkan juga biaya satu kartu jika kartu itu cukup untuk beban yang direncanakan.

## Pilih dan konfigurasi

- [Menyiapkan lingkungan inferensi yang reprodusibel](<https://kernodeck.com/id/docs/environnements-reproductibles>)
- [Meninjau opsi NVIDIA 48 GB](<https://kernodeck.com/id/compute/l40s>)
- [Meninjau opsi AMD untuk rangkaian ROCm](<https://kernodeck.com/id/compute/mi300x>)
- [Memilih durasi 3, 7, atau 30 hari](<https://kernodeck.com/id/pricing>)
- [Delapan pasangan crypto yang diterima](<https://kernodeck.com/id/docs/crypto-payments>)
- [Pilih kapasitas untuk inferensi](<https://kernodeck.com/id/usages/inference>)
