Визначте репрезентативний запит
Сервіс вкладень, класифікації чи транскрипції має різні вхідні дані. Зафіксуйте довжину документів, розміри зображень або тривалість аудіо, потім складіть невеликий набір, який охоплює їхню різноманітність. Для кожного випадку визначте очікуваний вихід і спосіб повідомлення про помилку.
Вимірюйте завантаження моделі окремо. Час першого виклику та час уже готового процесу відповідають на два різні запитання для користувача вашого застосунку.
Розподіліть 24 GB між запитами
Почніть з одного запиту, потім збільшуйте паралелізм, зберігаючи ті самі вхідні дані. Стежте за пам'яттю та чергою: приймати більше викликів одночасно не означає, що вони завершаться швидше. Встановіть ліміт і чітку поведінку при його досягненні.
Перевірте середовище CUDA, PyTorch і бібліотеки підготовки медіа, якщо ваш сервіс їх використовує. Відеофункції L4 задіюються лише тоді, коли ваше програмне забезпечення активує сумісний шлях; наявність апаратного забезпечення не змінює скрипт Python автоматично.
Коли варто обрати іншу ємність
Якщо ваші складні випадки не вміщуються в 24 ГБ, L40S відкриває варіант на 48 ГБ у тій самій родині Ada. Для прототипу, зосередженого на обчисленні моделі, порівняйте також RTX 4090. Якщо вам потрібно досліджувати 80 ГБ в одному домені пам'яті, переходьте на A100, а не множте пакети L4 без програмної стратегії.
Побудувати пробний запуск, що завершується чисто
За 3 дні перевірте завантаження та запити. За 7 днів додайте конкурентність, недійсні вхідні дані та перезапуск. Пакет на 30 днів може стати в пригоді для серії ітерацій зі щоденними звітами, які ви зберігаєте.
Команда вказує модель, пакети, тривалість і підготовку, після чого потрібно створити обліковий запис або увійти. Далі ви обираєте криптоактив і мережу, без процедури KYC та без документа, що посвідчує особу. Після вашого переказу «Я оплатив» фіксує повідомлення. Знайдіть замовлення та його розрахунок у своєму обліковому записі Kernodeck.