Dua kartu, satu rencana pembagian yang eksplisit
Mulailah dengan memilih di antara dua strategi: satu salinan model pada setiap kartu untuk memproses data yang berbeda, atau model yang benar-benar dibagi antar-GPU. Paralelisme data PyTorch tidak dengan sendirinya mengubah dua memori menjadi satu cadangan tunggal yang dapat digunakan oleh model yang terlalu besar.
180 GB dimiliki oleh masing-masing B200. Untuk memanfaatkannya bersama-sama, dokumentasikan pembagian model, pertukaran antar-proses, dan penyimpanan partisi. Uji singkat komunikasi dan pemulihan harus dilakukan sebelum kampanye lengkap.
Verifikasi Blackwell sebelum mengoptimalkan
Siapkan distribusi PyTorch dan ekstensi terkompilasi yang kompatibel dengan B200. Pustaka Python yang diimpor tanpa kesalahan masih bisa gagal pada kernel CUDA pertama: uji pemuatan, satu forward pass, perhitungan gradien, dan penulisan checkpoint. Simpan versi yang menjalankan alur ini.
Selanjutnya pisahkan kompilasi awal dan komputasi yang sudah stabil dalam pengukuran Anda. Pemisahan ini membantu memutuskan apakah sebuah optimasi layak dipertahankan untuk beban Anda sendiri.
Kapan memilih H200 atau MI300X
Jika seluruh pemrosesan Anda muat pada satu kartu dan tidak menggunakan GPU kedua, pertimbangkan H200 SXM 141 GB. Jika prioritas Anda adalah memori besar per kartu dengan lingkungan ROCm yang dikuasai, MI300X 192 GB menjadi opsi lain. Pilihan ini terutama bergantung pada perangkat lunak dan rencana komputasi.
Rencanakan lot dan hasilnya
Perkirakan 3 hari untuk memvalidasi peluncuran terdistribusi, 7 hari untuk membandingkan beberapa pengaturan, dan 30 hari untuk kampanye yang disertai checkpoint berkala. Setiap lot yang dipesan berisi dua B200; periksa total kartu di ringkasan.
Pilih durasi, lot, dan persiapan, lalu isi nama depan, nama belakang, dan email. Pilih crypto dan jaringannya; setelah transfer, “Saya sudah bayar” mencatat laporan Anda. Simpan referensi pesanan bersama manifes eksekusi.