Dwie karty, jawny plan podziału
Zacznij od wyboru jednej z dwóch strategii: kopia modelu na każdej karcie do przetwarzania różnych danych albo model rzeczywiście rozdzielony między GPU. Równoległość danych w PyTorch sama w sobie nie zamienia dwóch pamięci w jedną pulę użyteczną dla zbyt dużego modelu.
180 GB należy do każdego B200. Aby wykorzystać je razem, udokumentuj podział modelu, wymianę między procesami i zapis partycji. Krótki test komunikacji i przywracania musi poprzedzić pełną kampanię.
Sprawdź Blackwell przed optymalizacją
Przygotuj dystrybucję PyTorch i skompilowane rozszerzenia zgodne z B200. Biblioteka Pythona zaimportowana bez błędu może wciąż zawieść przy pierwszym jądrze CUDA: przetestuj więc ładowanie, przebieg w przód, obliczanie gradientów i zapis checkpointu. Zachowaj wersje, które wykonały tę ścieżkę.
Następnie oddziel w pomiarach początkową kompilację od ustabilizowanych obliczeń. To rozróżnienie pomaga zdecydować, czy optymalizacja zasługuje na zachowanie dla Twojego własnego obciążenia.
Kiedy wybrać H200 lub MI300X
Jeśli całe Twoje przetwarzanie mieści się na jednej karcie i nie korzysta z drugiego GPU, rozważ H200 SXM z 141 GB. Jeśli priorytetem jest duża pamięć na kartę w opanowanym środowisku ROCm, MI300X z 192 GB to inna możliwość. Wybór zależy przede wszystkim od oprogramowania i planu obliczeń.
Zaplanuj lot i jego rezultaty
Zaplanuj 3 dni na walidację uruchomienia rozproszonego, 7 dni na porównanie kilku ustawień i 30 dni na kampanię z regularnymi checkpointami. Każdy zamówiony lot zawiera dwa B200; sprawdź łączną liczbę kart w podsumowaniu.
Wybierz czas trwania, loty i przygotowanie, a następnie podaj imię, nazwisko i adres e-mail. Wybierz swoją kryptowalutę i jej sieć; po przelewie „Zapłaciłem” zapisuje Twoje zgłoszenie. Zachowaj numer zamówienia wraz z manifestem uruchomień.