Начните с полного шага обучения
Ваш первый запуск должен охватывать чтение данных, прямой проход, вычисление градиентов и обновление оптимизатора. Измерьте этот полный цикл, прежде чем увеличивать батч. Веса — лишь часть занимаемой памяти: активации и состояния обучения также должны умещаться в 80 ГБ.
Сохраните репрезентативную последовательность входных данных, включая объёмные примеры. Так вы избежите расчёта всей кампании по первому особенно лёгкому батчу.
Смешанная точность и контролируемое сравнение
PyTorch позволяет выбрать подходящую точность для некоторых операций с помощью autocast. Проверьте эту настройку на вашей функции потерь и критериях валидации. Включённая опция не является доказательством численной стабильности: сохраняйте сравнительный запуск, метрики и точные параметры.
Для нескольких карт различайте батч на GPU и глобальный батч. Количество процессов и накопление градиентов — часть протокола, наравне со скоростью обучения.
SXM, PCIe или больше памяти
H100 PCIe сохраняет ёмкость 80 ГБ и заслуживает сравнения для преимущественно однокарточной работы. При частом обмене между GPU измерьте топологию, фактически используемую вашим приложением; название SXM не заменяет эту проверку. Предпочтите H200, если выявленная проблема — прежде всего нехватка памяти на карту.
Зарезервируйте период, включающий возобновление
Выберите 3 дня, чтобы проверить один цикл и один чекпоинт, 7 дней для серии абляций или 30 дней для длительных экспериментов. Включите в этот план оценку и экспорт, а не только эпохи обучения.
В конфигураторе выберите подготовку PyTorch или пользовательскую, ваши партии и длительность. Создайте аккаунт или войдите, прежде чем сохранять заказ и выбирать оплату в криптовалюте. Кнопка «Я оплатил» служит для отметки о переводе; статус оплаты остаётся виден в вашем аккаунте.