Тестируйте конвейер, а не только модель
Для мультимодального приложения возьмите файлы, отражающие ваши сценарии: разные форматы, размеры и длительности. Замеряйте время чтения, подготовки, вычислений и экспорта. Этап декодирования или преобразования на CPU может ограничивать весь процесс, даже если GPU быстро завершает свою часть.
Также определите, что считается корректным результатом: количество результатов, формат, размеры и связь с входными данными. Так вы получите показатель, полезный для развёртывания, а не изолированное время вычислений.
Оставляйте запас в 48 ГБ
Оставьте место для входных данных и временных состояний помимо весов. Для сервиса, обрабатывающего несколько запросов, увеличивайте параллелизм постепенно и следите за пиком памяти. Тестируйте отдельно один большой файл и несколько обычных файлов; оба случая могут создавать разные ограничения.
Проверьте стек PyTorch/CUDA и реально используемые медиабиблиотеки. L40S не поддерживает NVLink: для объединения нескольких карт предусмотрите программное обеспечение, которое явно распределяет работу, не полагаясь на объединённую память.
Выбирайте по пути применения
L4 на 24 ГБ заслуживает проверки, если ваша модель и входные данные в неё помещаются. RTX 6000 Ada также предлагает 48 ГБ и может быть сравнена, если ваш проект сочетает вычисления и инструменты визуализации. Если потребность в памяти превышает эту ёмкость, рассмотрите предложения на 80 ГБ, прежде чем усложнять разбиение.
Тариф для проверки вашего сервиса
Посвятите 3 дня минимальному конвейеру, 7 дней — сложным форматам и испытаниям параллелизма или 30 дней — повторяющейся кампании с архивированными конфигурациями. Сохраняйте примеры, выявившие ошибку: они станут вашими тестами на регрессию.
Выберите подготовку, конфигурации и срок, затем заполните данные заказа. Вы управляете своими программами и обработкой самостоятельно; Kernodeck не проверяет содержимое ваших файлов, промптов или вычислений. Криптоперевод затем подтверждается кнопкой «Я оплатил».