Zacznij od pełnego kroku treningu
Twój pierwszy test powinien obejmować odczyt danych, przejście w przód, obliczenie gradientów i aktualizację optymalizatora. Zmierz ten pełny cykl, zanim zwiększysz partię. Wagi to tylko część zajmowanej pamięci: aktywacje i stany treningu również muszą zmieścić się w 80 GB.
Zachowaj reprezentatywną sekwencję danych wejściowych, w tym obszerne przykłady. Unikniesz wymiarowania całej kampanii na podstawie pierwszej, wyjątkowo łatwej partii.
Precyzja mieszana i kontrolowane porównanie
PyTorch pozwala wybrać odpowiednią precyzję dla niektórych operacji za pomocą autocast. Przetestuj to ustawienie na swojej funkcji straty i kryteriach walidacji. Włączona opcja nie jest dowodem stabilności numerycznej: zachowaj przebieg porównawczy, metryki i dokładne parametry.
W przypadku wielu kart odróżnij partię na GPU od partii globalnej. Liczba procesów i akumulacja gradientów są częścią protokołu, tak samo jak tempo uczenia się.
SXM, PCIe czy więcej pamięci
H100 PCIe zachowuje pojemność 80 GB i warto go porównać w przypadku pracy głównie na jednej karcie. Przy częstej wymianie danych między GPU zmierz topologię faktycznie używaną przez Twoją aplikację; nazwa SXM nie zastępuje tej kontroli. Wybierz H200, jeśli zidentyfikowanym problemem jest przede wszystkim brak pamięci na kartę.
Zarezerwuj okres obejmujący wznowienie
Wybierz 3 dni na walidację pętli i checkpointu, 7 dni na serię ablacji lub 30 dni na dłuższe eksperymenty. Uwzględnij w tym harmonogramie ewaluację i eksport, nie tylko epoki treningu.
W konfiguratorze wybierz przygotowanie PyTorch lub własne, liczbę batchy i czas trwania. Utwórz konto lub zaloguj się przed zapisaniem zamówienia i wyborem płatności krypto. Przycisk „Zapłaciłem” służy do zgłoszenia przelewu; śledzenie płatności pozostaje widoczne na Twoim koncie.