Zdefiniuj reprezentatywne żądanie
Usługa embeddingów, klasyfikacji lub transkrypcji nie ma takich samych danych wejściowych. Ustal długość dokumentów, wymiary obrazu lub czas trwania audio, a następnie zbuduj mały zbiór obejmujący ich różnorodność. Dla każdego przypadku zdefiniuj oczekiwany wynik i sposób sygnalizowania błędu.
Zmierz ładowanie modelu osobno. Czas pierwszego wywołania i czas procesu już gotowego odpowiadają na dwa różne pytania dla użytkownika Twojej aplikacji.
Podziel 24 GB między żądaniami
Zacznij od jednego żądania, a następnie zwiększaj współbieżność, zachowując te same dane wejściowe. Obserwuj pamięć i kolejkę: akceptowanie większej liczby wywołań jednocześnie nie oznacza, że zakończą się szybciej. Ustal limit i jasne zachowanie po jego osiągnięciu.
Zweryfikuj środowisko CUDA, PyTorch i biblioteki przygotowania mediów, jeśli Twoja usługa ich używa. Funkcje wideo L4 są wykorzystywane tylko wtedy, gdy Twoje oprogramowanie aktywuje zgodną ścieżkę; sama obecność sprzętu nie zmienia automatycznie skryptu w Pythonie.
Kiedy wybrać inną pojemność
Jeśli Twoje trudne przypadki nie mieszczą się w 24 GB, L40S otwiera opcję 48 GB w tej samej rodzinie Ada. W przypadku prototypu skupionego na obliczeniach modelu porównaj również RTX 4090. Jeśli potrzebujesz zbadać 80 GB w jednej domenie pamięci, przejdź na A100, zamiast mnożyć partie L4 bez strategii programowej.
Zbuduj próbę, która kończy się czysto
W ciągu 3 dni zweryfikuj ładowanie i zapytania. W ciągu 7 dni dodaj współbieżność, nieprawidłowe dane wejściowe i restart. Pakiet 30-dniowy może posłużyć do kampanii iteracji z dziennymi raportami, które zachowasz.
Zamówienie wymaga modelu, partii, czasu trwania i przygotowania, a następnie utworzenia konta lub zalogowania. Następnie wybierasz aktywo i sieć krypto, bez procedury KYC i bez dokumentu tożsamości. Po przelewie „Zapłaciłem” rejestruje zgłoszenie. Znajdź zamówienie i jego rozliczenie na swoim koncie Kernodeck.