Тестуйте конвеєр, а не лише модель
Для мультимодального застосунку візьміть файли, що відображають ваші сценарії використання: різні формати, розміри та тривалості. Виміряйте час читання, підготовки, обчислень і експорту. Етап декодування або перетворення на CPU може обмежувати весь процес, навіть коли GPU швидко завершує свою частину.
Також визначте, що вважається коректним результатом: кількість результатів, формат, розміри та відповідність вхідним даним. Ви отримаєте показник, корисний для розгортання, а не ізольований час обчислень.
Залишайте запас у 48 ГБ
Залишайте місце для вхідних даних і тимчасових станів, окрім ваг. Для сервісу, що обробляє кілька запитів, збільшуйте навантаження поступово й спостерігайте за піком пам'яті. Перевірте окремо один великий файл і кілька звичайних файлів; обидва випадки можуть створювати різні обмеження.
Перевірте стек PyTorch/CUDA та медіабібліотеки, які справді використовуються. L40S не має NVLink: для збільшення кількості карток передбачте програмне забезпечення, яке явно розподіляє роботу, не припускаючи об'єднаної пам'яті.
Вибір за шляхом застосунку
L4 на 24 ГБ варто спробувати, якщо ваша модель і вхідні дані вміщуються. RTX 6000 Ada також має 48 ГБ і може бути порівняна, коли ваш проєкт поєднує обчислення та інструменти візуалізації. Якщо потреби в пам'яті перевищують цю ємність, розгляньте пропозиції на 80 ГБ, перш ніж ускладнювати розподіл.
Тариф для перевірки вашого сервісу
Присвятіть 3 дні мінімальному ланцюжку, 7 днів — складним форматам і тестам навантаження, або 30 днів — повторюваній кампанії з архівованими конфігураціями. Зберігайте приклади, що виявили помилку: вони стануть вашими тестами на регресію.
Оберіть свою конфігурацію, пакети та тривалість, а потім заповніть дані замовлення. Ви керуєте своїм програмним забезпеченням і обробкою самостійно; Kernodeck не перевіряє вміст ваших файлів, запитів чи обчислень. Криптотрансфер потім підтверджується кнопкою «Я оплатив».