Aplikasi satu kartu yang mudah dibaca
Mulailah dengan satu proses yang memuat modelnya, memproses satu batch, dan mengekspor hasil. Tetapkan ukuran input dan jumlah permintaan. Skenario sederhana ini membantu mengidentifikasi apakah upaya berikutnya harus difokuskan pada memori GPU, data, atau logika Python.
Dengan 80 GB, Anda dapat mengeksplorasi beban yang lebih besar daripada dengan kartu 24 atau 48 GB, sambil tetap mengelola satu domain memori saja. Namun tetap siapkan margin untuk alokasi sementara dari engine Anda.
Mengamati transfer sama seperti kernel
Program yang memuat ulang data yang sama di antara dua pemanggilan dapat menghabiskan sebagian besar waktunya di luar komputasi yang berguna. Ukur secara terpisah waktu persiapan CPU, transfer, eksekusi, dan pengambilan hasil. Untuk pengukuran CUDA, perhitungkan eksekusi asinkron agar Anda tidak hanya mengukur pengiriman pekerjaan.
Validasi fungsinya dengan versi PyTorch Anda dan pustaka terkompilasi proyek. Simpan uji coba tanpa optimasi sebagai titik pembanding sebelum mengubah jalur eksekusi.
Membandingkan tanpa mencampuradukkan format H100
H100 SXM dan H100 PCIe tidak menggambarkan konfigurasi perangkat keras yang sama. Pilih SXM jika studi Anda membenarkan pengukuran perilakunya untuk pertukaran terdistribusi. Pilih H200 bila beban satu kartu Anda melampaui 80 GB. A100 SXM tetap menjadi alternatif yang perlu dipertimbangkan untuk lingkungan Ampere yang sudah terkualifikasi.
Menyewa untuk menghasilkan keputusan
Paket 3 hari dapat digunakan untuk menyusun profil awal. Selama 7 hari, uji beberapa ukuran batch dan simpan laporan perbandingan; selama 30 hari, atur eksekusi dan pemantauannya dengan pengenal yang stabil.
Pilih durasi, jumlah batch, dan persiapan di konfigurator, lalu buat akun atau masuk. Pembayaran mengikuti aset dan jaringan yang dipilih. Setelah transfer Anda, « J’ai payé » menambahkan penanda pada pesanan, yang dapat Anda temukan di akun Kernodeck Anda.