Testuj pipeline, nie tylko model
W przypadku aplikacji multimodalnej wybierz pliki reprezentujące Twoje zastosowania: różne formaty, wymiary i czasy trwania. Zmierz czas odczytu, przygotowania, obliczeń i eksportu. Etap dekodowania lub transformacji CPU może ograniczać całość, nawet gdy GPU szybko kończy swoją część.
Zdefiniuj również, co stanowi prawidłowy wynik: liczbę wyników, format, wymiary i powiązanie z danymi wejściowymi. Otrzymasz miarę przydatną przy wdrożeniu, a nie izolowany czas obliczeń.
Zachowaj margines w 48 GB
Zarezerwuj miejsce na dane wejściowe i stany tymczasowe oprócz wag. W przypadku usługi przetwarzającej wiele żądań zwiększaj współbieżność stopniowo i obserwuj szczytowe zużycie pamięci. Przetestuj osobno jeden duży plik i wiele zwykłych plików; oba przypadki mogą generować różne ograniczenia.
Zweryfikuj stos PyTorch/CUDA i biblioteki multimedialne, które są rzeczywiście używane. L40S nie oferuje NVLink: aby łączyć wiele kart, wybierz oprogramowanie, które jawnie rozdziela pracę, nie zakładając połączonej pamięci.
Wybierz według ścieżki aplikacji
L4 z 24 GB warto wypróbować, jeśli Twój model i dane wejściowe się w nim zmieszczą. RTX 6000 Ada również oferuje 48 GB i można go porównać, gdy Twój projekt łączy obliczenia i narzędzia wizualizacyjne. Jeśli zapotrzebowanie na pamięć przekracza tę pojemność, rozważ oferty 80 GB, zanim skomplikujesz podział.
Pakiet do weryfikacji Twojej usługi
Przeznacz 3 dni na minimalny łańcuch, 7 dni na trudne formaty i testy współbieżności lub 30 dni na powtarzaną kampanię z archiwizowanymi konfiguracjami. Zachowaj przykłady, które ujawniły błąd: staną się Twoimi testami regresji.
Wybierz przygotowanie, partie i czas trwania, a następnie uzupełnij dane zamówienia. Zarządzasz swoim oprogramowaniem i przetwarzaniem samodzielnie; Kernodeck nie sprawdza zawartości Twoich plików, promptów ani obliczeń. Przelew krypto zgłaszasz następnie przez „Zapłaciłem”.