GPU untuk proyek Anda · pembayaran kripto tanpa KYC Cara menyewa
Bahasa Indonesia
Buka konsol
KERNODECK / VOTRE APPLICATION

Pilih GPU untuk aplikasi inferensi Anda.

Embedding batch, klasifikasi gambar, atau aplikasi interaktif: sewa di Kernodeck GPU yang sesuai untuk inferensi Anda sendiri. Mulailah dengan RTX 4090 24 GB seharga 110,00 USD untuk lot 1 GPU selama 7 hari. Pilih kapasitas sesuai memori terukur dan rangkaian CUDA Anda; Anda tetap mengelola persiapan dan pengoperasian aplikasi.

  • Pemrosesan batch atau interaktif
  • Tiga anggaran selama 7 hari
  • Mesin dan pengaturan Anda sendiri
Di Kernodeck, tidak ada identitas resmi maupun prosedur KYC dalam alur sewa GPU ini. Akun diperlukan: nama depan, nama belakang, email, dan kata sandi; ini tidak berarti anonim. Data akun ↗
TIGA KAPASITAS · SATU MINGGU

Kaitkan beban kerja Anda dengan anggaran yang nyata.

Model, input, memori sementara, dan konkurensi menentukan pilihan. Versi dan akses yang diperlukan untuk aplikasi Anda masih perlu dikonfirmasi.

Untuk pemrosesan batch Anda: mulai dari kebutuhan, lalu forfait

Anda ingin menghasilkan embedding untuk kumpulan dokumen atau mengklasifikasikan sekumpulan gambar? RTX 4090 adalah kandidat seharga 110,00 USD untuk lot 1 GPU 24 GB selama 7 hari jika pipeline CUDA Anda muat dalam memori tersebut bersama input, data sementara, dan margin terukurnya. Forfait ini membatasi anggaran perangkat keras Anda; Anda menentukan jumlah file, aturan pemulihan, dan hasil yang harus disimpan.

Jika puncak memori pemrosesan Anda melebihi kapasitas ini, bandingkan L40S: 148,00 USD untuk paket 1 GPU 48 GB selama 7 hari. Kartu ini memberi lebih banyak ruang per kartu untuk beban yang Anda ukur. Pilihan di antara keduanya terletak pada kapasitas ini dan kompatibilitas rantai perangkat lunak Anda, bukan pada volume dokumen yang dijanjikan.

Untuk partisi independen, B200 menawarkan organisasi lain: 2.071,00 USD untuk paket 2 GPU masing-masing 180 GB selama 7 hari, kedua kartu sudah termasuk dalam harga ini. Bandingkan opsi ini ketika aplikasi Anda mampu mendistribusikan pemrosesan ke beberapa pekerja. Ini tidak mengubah kedua memori menjadi satu ruang tunggal berukuran 360 GB.

Untuk aplikasi interaktif: pilih memori untuk beban penuh Anda

Asisten atau alat internal harus memperhitungkan permintaan bersamaan, panjangnya, dan cache khusus mesin inferensi. L40S dengan 148,00 USD untuk paket 1 GPU 48 GB selama 7 hari adalah kandidat jika beban penuh ini muat dalam memorinya dan jika mesin Anda mendukung rantai CUDA-nya. Pengukuran antrean dan respons Anda tetap menjadi kriteria untuk memilih konfigurasi.

Jika Anda memerlukan lebih banyak memori pada satu kartu, bandingkan H100 SXM: 475,00 USD untuk paket 1 GPU 80 GB selama 7 hari. Kartu ini menambah kapasitas per GPU; itu saja tidak cukup untuk menjamin latensi atau throughput aplikasi Anda. Jika kebutuhan Anda sudah muat dalam 24 GB, RTX 4090 tetap layak dibandingkan sebelum memilih paket yang lebih tinggi.

Penawaran ini adalah penyewaan GPU untuk aplikasi Anda. API inferensi terkelola merupakan kategori layanan yang berbeda: bisa cocok jika Anda terutama mencari titik panggil yang dikelola untuk Anda. Di Kernodeck, siapkan mesin inferensi Anda, dependensinya, dan operasionalnya; penyiapan serta ketentuan akses yang diperlukan proyek Anda masih perlu dikonfirmasi sebelum memilih lingkungan Anda.

PEMBAYARAN ANDA

Paket Anda, dapat dibayar langsung dengan kripto.

Bayar sewa Kernodeck Anda langsung dengan crypto, tanpa top-up yang diwajibkan: BTC di Bitcoin dan USDT di Tron (TRC-20), antara lain. Prosesnya tidak memerlukan dokumen identitas maupun prosedur KYC; akun dengan nama depan, nama belakang, email, dan kata sandi diperlukan, tanpa janji anonimitas.

Bandingkan delapan aset dan jaringan yang diterima ↗

Ketentuan yang berguna untuk proyek Anda

Ketersediaan. Jumlah yang dinyatakan per model dalam penawaran. Jumlah ini tidak mereservasi ketersediaan di masa mendatang maupun tanggal ketersediaan. Negara hosting dan wilayah layanan perlu dikonfirmasi sebelum membeli jika proyek Anda mengharuskannya.

Persiapan. Ubuntu, PyTorch, Blender, atau permintaan khusus. Versi, CPU, RAM, penyimpanan, jaringan, dan mode akses harus dikonfirmasi sesuai proyek; penyertaannya tidak dapat disimpulkan dari model GPU.

Harga dan ketentuan. Jumlah dalam USD untuk paket dan seluruh periode. Status pajak dan biaya yang mungkin timbul harus dikonfirmasi dalam syarat yang berlaku.

Baca ketentuan sewa ↗
AVANT DE CHOISIR

Kapasitas apa yang disewa untuk inferensi Anda?

Paket mana yang harus dipilih untuk pemrosesan inferensi pertama?

Jika pipeline CUDA dan satu batch representatif Anda muat dalam 24 GB dengan margin terukur, mulailah perbandingan dari RTX 4090: 110,00 USD untuk paket 1 GPU selama 7 hari. Paket ini mencakup periode penyewaan tersebut, tanpa menetapkan jumlah berkas yang dapat diproses aplikasi Anda. Sertakan instalasi, kontrol keluaran, dan ekspor dalam rencana Anda; paket 3 dan 30 hari memungkinkan Anda memilih periode lain.

Kapan harus membayar lebih untuk L40S atau H100 SXM?

Bandingkan L40S 48 GB ketika beban penuh melebihi margin yang tersedia pada 24 GB, lalu H100 SXM 80 GB jika Anda mencari lebih banyak memori pada satu kartu. Paket 7 hari masing-masing berharga 148,00 USD dan 475,00 USD, keduanya untuk paket 1 GPU. Sertakan model, input, data sementara, dan cache dalam pengukuran Anda; kapasitas yang lebih tinggi saja tidak menjamin respons yang lebih baik untuk aplikasi Anda.

Apakah penyewaan mencakup API inferensi yang siap dipanggil?

Penawaran yang disajikan di sini adalah penyewaan GPU untuk aplikasi Anda sendiri, dan tidak mencakup API inferensi terkelola yang dinyatakan siap dipanggil. Anda memilih mesin inferensi, model, dependensi, dan pengaturannya, lalu Anda mengatur operasionalnya. Jika prioritas Anda adalah layanan terkelola, bandingkan kategori penawaran itu secara terpisah. Untuk menyewa di Kernodeck, mintalah konfirmasi atas penyiapan dan ketentuan akses yang diperlukan proyek Anda.

Apakah B200 pilihan logis untuk beberapa pemrosesan bersamaan?

Opsi ini menjadi layak dipertimbangkan jika aplikasi Anda dapat menyerahkan partisi independen kepada beberapa pekerja atau mendukung distribusi eksplisit. Dengan 2.071,00 USD selama 7 hari, satu paket B200 sudah mencakup 2 GPU masing-masing 180 GB. Memori tersebut tidak otomatis menyatu; model terdistribusi memerlukan strategi yang kompatibel dengan mesin inferensi Anda. Bandingkan juga biaya satu kartu jika kartu itu cukup untuk beban yang direncanakan.

UNTUK MENYIAPKAN PEKERJAAN ANDA

Dari pemilihan paket hingga aplikasi Anda.

Verifikasi input dan waktu respons

Memvalidasi data sebelum GPUMengontrol tipe, bentuk, dan nilai untuk mengisolasi input yang tidak valid.Memprofil tahap PyTorchMembatasi pengukuran dan membaca jejak CPU/GPU tanpa menyimpulkan terlalu cepat.

Tetapkan hasil yang membenarkan penyewaan Anda

Untuk pemrosesan berkas, tentukan volume yang akan diproses, format output, dan aturan pemulihan. Berkas yang selesai harus dapat dikenali tanpa membaca ulang seluruh eksekusi. Untuk layanan interaktif, tentukan ukuran maksimum permintaan, waktu tunggu yang dapat diterima, dan perilaku ketika kapasitas tercapai. Model yang sama dapat menuntut dua pengaturan yang sangat berbeda bergantung pada kendala ini.

Simpan sampel representatif dengan kasus pendek, umum, dan yang mendekati batas Anda. Dalam pipeline embeddings, kaitkan setiap vektor dengan pengenal dan versi inputnya. Dalam generasi teks, catat parameter generasi yang digunakan untuk evaluasi. Anda harus dapat menjelaskan perbedaan hasil tanpa langsung menyalahkan GPU.

Pilih memori untuk seluruh beban inferensi

Bobot berkas model tidak menggambarkan seluruh memori yang digunakan selama inferensi. Perlu juga mempertimbangkan tensor sementara, input, output yang disimpan, dan untuk model yang bersangkutan, cache key dan value dari attention. Cache ini dapat menjadi besar ketika sekuens memanjang atau beberapa permintaan diproses bersamaan.

Mulailah dengan kartu yang memorinya memungkinkan uji coba representatif Anda dengan margin terukur. Model 24, 32, 48, 80 GB dan lebih besar menjawab kebutuhan yang berbeda; tidak ada kapasitas yang menjamin model tertentu akan berjalan dengan semua pengaturannya. Mengurangi presisi atau kuantisasi dapat mengubah jejak memori, tetapi menuntut verifikasi dukungan perangkat lunak dan kualitas output pada input Anda sendiri.

Pilih GPU yang kompatibel dengan rantai perangkat lunak Anda

Daftarkan mesin inferensi, operator khususnya, dan ekstensi yang Anda andalkan sebelum memilih perangkat keras. Aplikasi PyTorch dapat menawarkan beberapa jalur eksekusi, sedangkan ekstensi khusus hanya mendukung satu. Verifikasi seluruh rantai pada CUDA untuk NVIDIA atau pada ROCm untuk AMD, termasuk pemuatan model dan prapemrosesannya.

Simpan perintah minimal yang menelusuri pipeline hingga penulisan hasil. Baru setelah itu, aktifkan optimasi Anda satu per satu. Setiap perubahan presisi, kompilasi, atau mesin harus mempertahankan kontrol kualitas yang sebanding. Pemuatan yang berhasil membuktikan bahwa bobot dapat dibaca; itu tidak membuktikan bahwa semua jalur komputasi yang diperlukan berfungsi.

Atur batch sesuai tujuan pemrosesan Anda

Contoh metode: buat tiga kelompok teks berdasarkan panjang, lalu proses masing-masing dengan batch 1, 2, dan 4 input. Ukuran ini berfungsi sebagai titik uji, bukan rekomendasi universal. Untuk setiap kombinasi, catat input yang selesai, waktu total, memori maksimum yang teramati, dan kesalahan. Hentikan kemajuan ketika batas muncul alih-alih menyembunyikan kegagalan dalam rata-rata.

Untuk layanan interaktif, tambahkan waktu yang dihabiskan dalam antrean. Batch yang lebih besar dapat mengubah throughput dan waktu tunggu yang dirasakan oleh suatu permintaan; satu rata-rata saja tidak cukup untuk memilih. Untuk pemrosesan offline, pastikan pengelompokan tidak mengacak urutan hasil. Akhirnya pilih konfigurasi yang memenuhi kriteria kualitas dan kendala waktu Anda.

Beralih ke beberapa GPU jika aplikasi Anda dapat mendistribusikan pekerjaan

Jika setiap salinan model muat pada satu kartu, Anda dapat mengatur beberapa pekerja yang mengonsumsi partisi input yang berbeda. Maka perlu mengoordinasikan pengenal, pemulihan, dan pengumpulan output. Jika model harus dibagi antar kartu, gunakan strategi paralelisme yang didukung oleh mesin Anda dan verifikasi persyaratan komunikasinya.

Paket yang dipesan menggambarkan jumlah perangkat keras, bukan batch aplikasi maupun ruang memori gabungan. Untuk B200, satu paket mencakup dua kartu; untuk penawaran lainnya, satu paket mencakup satu kartu. Cantumkan dalam berkas Anda jumlah pekerja yang direncanakan, porsi masukan yang dipercayakan kepada masing-masing, dan cara memastikan bahwa suatu pekerjaan benar-benar selesai.

Pilih periode yang mencakup kontrol dan ekspor

Untuk penyewaan pertama selama 3 hari, tetapkan tujuan yang terbatas: menginstal, memvalidasi pipeline, dan menghasilkan hasil pertama yang dapat digunakan. Durasi 7 hari dapat dimanfaatkan untuk menjajaki lebih banyak varian; 30 hari untuk mengulang suatu pemrosesan dan mengonsolidasikan operasinya. Ini adalah cara mengorganisasi pekerjaan, bukan janji waktu eksekusi.

Pada akhirnya, simpan bobot atau versinya, konfigurasi, pemeriksaan kualitas, metrik yang benar-benar diperoleh, dan hasil yang diekspor. Anda memilih perangkat lunak dan pemrosesan Anda secara mandiri; Kernodeck tidak melakukan inspeksi atas isinya. Siapkan sendiri akses, cadangan, dan izin yang diperlukan untuk penggunaan model dan data.

Baca halaman ini dalam Markdown ↗