Две карты, явный план распределения
Начните с выбора одной из двух стратегий: копия модели на каждой карте для обработки разных данных или модель, действительно распределённая между GPU. Сам по себе параллелизм данных PyTorch не превращает две памяти в единый ресурс, пригодный для слишком объёмной модели.
180 ГБ принадлежат каждому B200. Чтобы использовать их совместно, задокументируйте разбиение модели, обмен между процессами и сохранение партиций. Короткий тест связи и восстановления должен предшествовать полной кампании.
Проверьте Blackwell перед оптимизацией
Подготовьте дистрибутив PyTorch и скомпилированные расширения, совместимые с B200. Библиотека Python, импортированная без ошибок, всё ещё может дать сбой на первом ядре CUDA: поэтому проверьте загрузку, прямой проход, вычисление градиентов и запись чекпоинта. Сохраните версии, которые прошли этот путь.
Затем разделите в своих измерениях начальную компиляцию и стабилизированное вычисление. Это различие помогает решить, стоит ли сохранять ту или иную оптимизацию для вашей собственной нагрузки.
Когда выбирать H200 или MI300X
Если вся ваша обработка укладывается в одну карту и не использует второй GPU, рассмотрите H200 SXM на 141 ГБ. Если ваш приоритет — большой объём памяти на карту с контролируемым окружением ROCm, MI300X на 192 ГБ представляет собой другой вариант. Выбор зависит прежде всего от программного обеспечения и плана вычислений.
Спланируйте лот и его результаты
Предусмотрите 3 дня для проверки распределённого запуска, 7 дней для сравнения нескольких настроек и 30 дней для кампании с регулярными чекпоинтами. Каждый заказанный лот содержит два B200; проверьте общее число карт в сводке.
Выберите длительность, лоты и подготовку, затем укажите имя, фамилию и email. Выберите вашу криптовалюту и её сеть; после перевода «Я оплатил» фиксирует ваше уведомление. Сохраните номер заказа вместе с манифестом запусков.