Czytelna aplikacja jednokartowa
Zacznij od procesu, który ładuje model, przetwarza batch i eksportuje wynik. Ustal rozmiar wejść i liczbę zapytań. Ten prosty scenariusz pozwala ustalić, czy kolejny wysiłek powinien dotyczyć pamięci GPU, danych czy logiki Pythona.
Mając 80 GB, możesz eksplorować większe obciążenia niż na karcie 24 lub 48 GB, zachowując jedną domenę pamięci do zarządzania. Zaplanuj jednak margines na tymczasowe alokacje swojego silnika.
Obserwuj transfery równie uważnie jak kernel
Program, który ponownie ładuje te same dane między dwoma wywołaniami, może spędzać znaczną część czasu poza użytecznym obliczeniem. Zmierz osobno przygotowanie CPU, transfer, wykonanie i pobranie wyniku. Przy pomiarach CUDA uwzględnij wykonanie asynchroniczne, aby nie mierzyć wyłącznie zlecenia pracy.
Zweryfikuj działanie z Twoją wersją PyTorch i skompilowanymi bibliotekami projektu. Zachowaj próbę bez optymalizacji jako punkt odniesienia przed modyfikacją ścieżki wykonania.
Porównuj bez mylenia formatów H100
H100 SXM i H100 PCIe nie opisują tej samej konfiguracji sprzętowej. Wybierz SXM, jeśli Twoje badanie uzasadnia pomiar jego zachowania dla wymiany rozproszonej. Wybierz raczej H200, gdy Twoje obciążenie jednokartowe przekracza 80 GB. A100 SXM pozostaje alternatywą do rozważenia dla już zweryfikowanego środowiska Ampere.
Wynajmij, aby podjąć decyzję
Pakiet 3-dniowy może posłużyć do ustalenia profilu początkowego. Przez 7 dni testuj różne rozmiary batchy i zachowaj raport porównawczy; przez 30 dni organizuj uruchomienia i ich śledzenie za pomocą stałych identyfikatorów.
Wybierz czas trwania, liczbę batchy i przygotowanie w konfiguratorze, a następnie utwórz konto lub zaloguj się. Płatność przebiega zgodnie z wybranym aktywem i siecią. Po przelewie „Zapłaciłem” dodaje zgłoszenie do zamówienia, które znajdziesz na swoim koncie Kernodeck.