İki kart, açık bir dağıtım planı
İki stratejiden birini seçerek başlayın: farklı verileri işlemek için her karta modelin bir kopyası, ya da GPU'lar arasında gerçekten dağıtılmış bir model. PyTorch veri paralelliği tek başına iki belleği, çok büyük bir modelin kullanabileceği tek bir havuz haline getirmez.
180 GB her B200'e aittir. Bunları birlikte kullanmak için modelin bölünmesini, süreçler arası iletişimi ve bölümlerin kaydedilmesini belgeleyin. Tam kampanyadan önce kısa bir iletişim ve geri yükleme testi yapılmalıdır.
Optimizasyondan önce Blackwell'i doğrulayın
B200 ile uyumlu bir PyTorch dağıtımı ve derlenmiş uzantılar hazırlayın. Hatasız içe aktarılan bir Python kütüphanesi ilk CUDA çekirdeğinde hâlâ başarısız olabilir: bu nedenle yüklemeyi, bir ileri geçişi, gradyan hesaplamasını ve bir checkpoint yazımını test edin. Bu yolu çalıştıran sürümleri saklayın.
Ardından ölçümlerinizde ilk derlemeyi ve stabilize edilmiş hesaplamayı ayırın. Bu ayrım, bir optimizasyonun kendi iş yükünüz için saklanmaya değip değmediğine karar vermeye yardımcı olur.
H200 veya MI300X ne zaman seçilmeli
Tüm işlemeniz tek bir karta sığıyorsa ve ikinci GPU'yu kullanmıyorsa, 141 GB'lık H200 SXM'e bakın. Önceliğiniz kart başına büyük bellek ve hakim olduğunuz bir ROCm ortamıysa, 192 GB'lık MI300X başka bir seçenektir. Seçim her şeyden önce yazılıma ve hesaplama planına bağlıdır.
Partiyi ve çıktılarını planlayın
Dağıtık başlatmayı doğrulamak için 3 gün, birkaç ayarı karşılaştırmak için 7 gün ve düzenli checkpoint'lerle birlikte bir kampanya için 30 gün ayırın. Sipariş edilen her parti iki B200 içerir; özet ekranında toplam kart sayısını kontrol edin.
Süreyi, partileri ve hazırlığı seçin, ardından ad, soyad ve e-posta bilgilerinizi girin. Kriptonuzu ve ağını seçin; transferden sonra « J'ai payé » bildiriminizi kaydeder. Sipariş referansını çalıştırma manifestosuyla birlikte saklayın.