Определите результат, который оправдывает вашу аренду
Для пакетной обработки файлов определите объём, который нужно пройти, формат вывода и правило возобновления. Завершённый файл должен распознаваться без повторного чтения всего запуска. Для интерактивного сервиса определите максимальный размер запросов, приемлемую задержку и поведение при достижении предельной нагрузки. Одна и та же модель может требовать двух совершенно разных организаций в зависимости от этих ограничений.
Сохраните репрезентативную выборку с короткими, обычными случаями и случаями вблизи ваших пределов. В конвейере эмбеддингов связывайте каждый вектор с идентификатором и версией его входных данных. При генерации текста записывайте параметры генерации, использованные для оценки. Вы должны уметь объяснить различие в результате, не относя его сразу на счёт GPU.
Выберите память под всю нагрузку инференса
Вес файлов модели не описывает всю память, используемую во время инференса. Нужно также учитывать временные тензоры, входные и сохраняемые выходные данные и, для соответствующих моделей, кэш ключей и значений внимания. Этот кэш может стать значительным, когда последовательности удлиняются или обрабатывается несколько запросов вместе.
Начните с карты, памяти которой достаточно для репрезентативной пробы с измеренным запасом. Модели на 24, 32, 48, 80 ГБ и более отвечают разным потребностям; ни одна ёмкость не гарантирует, что конкретная модель пройдёт со всеми своими настройками. Снижение точности или квантизация может изменить занимаемый объём, но требует проверки поддержки в программном обеспечении и качества выходных данных на ваших собственных входных данных.
Выберите GPU, совместимый с вашим программным стеком
Перечислите движок инференса, его особые операторы и расширения, от которых вы зависите, прежде чем выбирать оборудование. Приложение на PyTorch может предлагать несколько путей выполнения, тогда как специализированное расширение поддерживает только один. Проверьте всю цепочку на CUDA для NVIDIA или на ROCm для AMD, включая загрузку модели и её предобработку.
Сохраните минимальную команду, проходящую конвейер вплоть до записи результата. И только затем включайте оптимизации по одной. Каждое изменение точности, компиляции или движка должно сохранять сопоставимый контроль качества. Успешная загрузка доказывает, что веса читаются; она не доказывает, что работают все необходимые вычислительные пути.
Настройте batch в соответствии с вашей целью обработки
Пример метода: составьте три группы текстов по длине, затем обработайте каждую с батчем из 1, 2 и 4 входных данных. Эти размеры служат точками пробы, а не универсальной рекомендацией. Для каждой комбинации фиксируйте завершённые входные данные, общее время, наблюдавшуюся максимальную память и ошибки. Останавливайте продвижение, когда появляется предел, вместо того чтобы скрывать сбои в среднем значении.
Для интерактивного сервиса добавьте время, проведённое в очереди. Больший батч может изменить пропускную способность и задержку, ощущаемую запросом; одного среднего значения недостаточно для выбора. Для офлайн-обработки убедитесь, что группировка не смешивает порядок результатов. В итоге выберите конфигурацию, которая соблюдает ваш критерий качества и ваше ограничение по задержке.
Перейдите на несколько GPU, если ваше приложение умеет распределять работу
Если каждый экземпляр модели помещается на одну карту, вы можете организовать несколько воркеров, которые обрабатывают отдельные разделы входных данных. Тогда нужно координировать идентификаторы, возобновления и сбор выходных данных. Если модель должна быть распределена между картами, используйте стратегию параллелизма, поддерживаемую вашим движком, и проверьте её требования к коммуникации.
Заказанные лоты описывают количество оборудования, а не прикладной batch и не объединённое адресное пространство. Для B200 один лот включает две карты; для остальных предложений один лот включает одну карту. Укажите в своём досье планируемое число воркеров, долю входных данных, поручаемую каждому из них, и способ убедиться, что работа действительно завершена.
Выберите период, который охватывает проверки и экспорт
Для первой аренды на 3 дня наметьте ограниченную цель: установить, проверить конвейер и получить первый пригодный к использованию результат. Срок 7 дней может послужить для прохождения большего числа вариантов; 30 дней — для повторения обработки и закрепления её эксплуатации. Это способы организовать работу, а не обещания сроков выполнения.
На выходе сохраните веса или их версию, конфигурацию, проверки качества, фактически полученные измерения и экспортированные результаты. Вы самостоятельно выбираете свои программы и обработки; Kernodeck не проводит проверку их содержимого. Подготовьте самостоятельно свои доступы, резервные копии и разрешения, необходимые для использования моделей и данных.