Kapsamlı bir yazılım geçişi hazırlayın
GPU hesaplaması yürüten bileşenleri listeleyin: PyTorch, attention kütüphaneleri, niceleme ve varsa kendi operatörleriniz. Taşınabilir bir Python betiği, yalnızca CUDA'ya özel bir uzantıya bağlı olabilir. Önemli bir kampanya başlatmadan önce her bileşeni seçilen ROCm sürümünde doğrulayın.
ROCm için PyTorch'ta, GPU'yu belirtmek için torch.cuda arayüzleri kullanılmaya devam eder. Bu nedenle tüm kullanımları mekanik olarak "hip" ile değiştirmeyin: kurulu backend'i belirleyin ve küçük bir gerçek hesaplamayı test edin.
192 GB'ı temsili bir testle kullanın
Bu kapasite büyük modellere, aktivasyonlara veya önbelleklere yer açar. Tek başına bir modelin maksimum boyutunu belirlemez: hassasiyet, giriş uzunluğu, uyarlama yöntemi ve geçici alanlar toplam ihtiyacı değiştirir.
En uzun girişlerinizi ve tam bir yedeklemeyi içeren bir senaryo hazırlayın. Göçün sayısal sonuçlarını, platformlar arasında birebir aynı dosyalar gibi örtük bir beklenti yerine, göreviniz için tanımladığınız bir toleransla karşılaştırın.
NVIDIA yolunu ne zaman korumalı
Kritik bir eklentinin kullanılabilir bir ROCm yolu yoksa, 141 GB'lık H200 SXM CUDA altında kalarak projeyi basitleştirebilir. Zaten taşınabilir bir yazılım ama daha küçük bir yük için, gerçek ihtiyacı 80 GB'lık bir kartla da karşılaştırın. Ek bellek yalnızca bir teşhisi değiştirmek için değil, tanımlanmış bir sorunu çözmek için olmalıdır.
Kiralamayı doğrulama adımlarına bölmek
Kurulum, test ve sapmaların not edilmesi için 3 gün; bağımlılıkları stabilize etmek ve çıktılarınızı karşılaştırmak için 7 gün; ROCm yolu doğrulanmış bir kampanya için 30 gün kullanın. Sistem dağıtımını ve kütüphane sürümlerini manifestoya kaydedin.
MI300X'i, süreyi, lotları ve ROCm yığınınıza uygun bir hazırlığı seçin. Ad, soyad ve e-posta sipariş iletişim bilgileri olarak kalır; hiçbir KYC kimlik belgesi istenmez. Ardından kripto yöntemini seçin ve transferi «Ödedim» ile bildirin.