Дві карти, явний план розподілу
Почніть із вибору між двома стратегіями: копія моделі на кожній карті для обробки різних даних або модель, реально розподілена між GPU. Паралелізм даних PyTorch сам собою не перетворює дві пам'яті на один спільний ресурс, придатний для завеликої моделі.
180 ГБ належать кожному B200. Щоб використати їх разом, задокументуйте розбиття моделі, обмін між процесами та збереження розділів. Короткий тест зв'язку й відновлення має передувати повній кампанії.
Перевірте Blackwell перед оптимізацією
Підготуйте дистрибутив PyTorch і скомпільовані розширення, сумісні з B200. Бібліотека Python, імпортована без помилок, усе ще може зазнати збою на першому ядрі CUDA: тому перевірте завантаження, прямий прохід, обчислення градієнтів і запис чекпойнта. Збережіть версії, які виконали цей шлях.
Далі відокремте початкову компіляцію від стабілізованих обчислень у своїх вимірюваннях. Це розмежування допомагає вирішити, чи варто зберігати оптимізацію для власного навантаження.
Коли обрати H200 або MI300X
Якщо вся ваша обробка вміщується на одній карті й не використовує другий GPU, розгляньте H200 SXM на 141 ГБ. Якщо ваш пріоритет — велика пам'ять на карту з опанованим середовищем ROCm, MI300X на 192 ГБ є іншим варіантом. Вибір насамперед залежить від програмного забезпечення та плану обчислень.
Сплануйте лот і його результати
Передбачте 3 дні для перевірки розподіленого запуску, 7 днів для порівняння кількох налаштувань і 30 днів для кампанії з регулярними чекпойнтами. Кожен замовлений лот містить два B200; перевірте загальну кількість карт у підсумку.
Оберіть тривалість, лоти та підготовку, потім вкажіть ім'я, прізвище та email. Виберіть свою криптовалюту та її мережу; після переказу «Я оплатив» фіксує ваше повідомлення. Зберігайте номер замовлення разом із маніфестом запусків.