Podziel korpus na jednostki, które można wznowić
Przy ekstrakcji cech, analizie obrazów lub transformacji plików nadaj każdej jednostce pracy stały identyfikator. Zapisz wynik w deterministycznym miejscu i odnotuj zarówno sukcesy, jak i błędy. Przerwanie powinno pozwolić na wznowienie pozostałych elementów bez mylenia plików nieobecnych z plikami nieprawidłowymi.
Przetestuj najpierw ten mechanizm na kilku niejednorodnych danych wejściowych. Użytecznym rezultatem jest procedura zdolna wykryć nieukończoną pracę, a nie tylko katalog zawierający wyniki.
Znajdź batch, który zachowuje margines
48 GB pozwala Ci eksplorować większe partie niż pojemność 24 GB, w zależności od obciążenia. Zmieniaj liczbę elementów bez zmiany ich formatu, a następnie dodaj najcięższe przypadki. Wybrany batch powinien absorbować te różnice bez nasycania pamięci przy każdej zmianie danych wejściowych.
W PyTorch rozróżniaj pamięć zajętą przez tensory i pamięć zarezerwowaną przez alokator. Wysoka liczba w narzędziu systemowym nie oznacza automatycznie, że istnieje wyciek; przeanalizuj jej ewolucję i obiekty utrzymywane przez program.
A40, RTX A6000 czy L40S
RTX A6000 pozostaje w rodzinie Ampere z 48 GB i zasługuje na porównanie dla Twojego oprogramowania. L40S zachowuje tę pojemność w architekturze Ada, zwłaszcza dla łańcucha zorientowanego na wnioskowanie lub media. Jeśli korpus mieści się w 24 GB, a partie są małe, sprawdź również, czy skromniejsza karta wystarczy do Twojego celu.
Dopasuj okres i wolumen do przetworzenia
Użyj 3 dni, aby oszacować pracę na podstawie próbki, 7 dni na pierwszą kontrolowaną kampanię lub 30 dni na kilka zaplanowanych fal. Oszacowanie wynikające z własnego testu jest bardziej użyteczne niż ekstrapolacja z nazwy GPU.
Skonfiguruj partie A40, czas trwania i środowisko, a następnie swoje dane kontaktowe. Po wyborze krypto zachowaj dokument zamówienia wraz z manifestem korpusu. Przycisk „Zapłaciłem” rejestruje zgłoszenie po przelewie i pozwala weryfikacji przebiegać swoim trybem.