Расчёт ресурсов за пределами файла весов
Для сервиса генерации размер модели на диске не описывает всю необходимую память. Добавьте рабочие буферы и кэш, используемый во время генерации. Составьте набор запросов, который включает ваши длинные входные данные и несколько уровней параллелизма, затем измерьте полученный пик.
Используйте этот запас, чтобы выбрать явный лимит контекста и явную очередь. Успешный одиночный запрос не достаточен, чтобы определить ёмкость сервиса, используемого несколькими клиентами.
Сохраняйте прослеживаемый путь CUDA
Зафиксируйте вместе Python, PyTorch, движок инференса и его расширения. Если вы меняете точность или движок внимания, прогоните те же примеры заново и сравните также качество выходных данных. H200 даёт ёмкость памяти; он не выбирает за вас приемлемые параметры генерации.
Архивируйте tokenizer, ревизию модели и конфигурацию сервиса вместе с вашими результатами. Тогда вы сможете отличить изменение программного обеспечения от изменения оборудования.
Правильный сценарий для увеличения памяти
Если ваша нагрузка уже укладывается в 80 ГБ с достаточным запасом, сравните тариф H100 PCIe, прежде чем выбирать H200. Если одному процессу требуется больше 141 ГБ, рассмотрите MI300X и совместимость с ROCm либо подготовьте многокарточное разделение на B200. Добавление батчей не увеличивает автоматически память одного процесса.
От нагрузочного теста до тарифа
За 3 дня сосредоточьтесь на ограниченной матрице контекст/параллелизм. Неделя позволяет добавить ошибки, перезапуски и экспорты; 30 дней подходят для уже организованной серии итераций. Заложите время на получение результатов и итогового манифеста.
Конфигурация требует количества батчей, подготовки и ваших контактных данных. Криптовалютный расчёт предлагается без KYC и удостоверения личности. После перевода сообщите об этом через «Я оплатил», затем отслеживайте статус расчёта в вашем заказе.