Почати з повного кроку тренування
Ваша перша спроба повинна охоплювати читання даних, прямий прохід, обчислення градієнтів і оновлення оптимізатора. Виміряйте цей повний цикл, перш ніж збільшувати пакет. Ваги — це лише частина зайнятої пам'яті: активації та стани тренування також повинні вміщуватися в 80 ГБ.
Збережіть репрезентативну послідовність вхідних даних, зокрема об'ємні приклади. Так ви уникнете розрахунку всієї кампанії на основі особливо легкого першого пакета.
Змішана точність і контрольоване порівняння
PyTorch дозволяє вибрати відповідну точність для певних операцій за допомогою autocast. Перевірте це налаштування на своїй функції втрат і критеріях валідації. Увімкнена опція не є доказом чисельної стабільності: збережіть порівняльний запуск, метрики та точні параметри.
Для кількох карт розрізняйте пакет на GPU та глобальний пакет. Кількість процесів і накопичення градієнтів є частиною протоколу так само, як і швидкість навчання.
SXM, PCIe або більше пам'яті
H100 PCIe зберігає потужність 80 ГБ і заслуговує порівняння для переважно однокарткової роботи. Для частих обмінів між GPU виміряйте топологію, яку фактично використовує ваш застосунок; назва SXM не замінює цієї перевірки. Віддайте перевагу H200, якщо виявлена проблема — це насамперед брак пам'яті на карту.
Зарезервувати період, що включає відновлення
Виберіть 3 дні, щоб перевірити цикл і контрольну точку, 7 днів для серії абляцій або 30 днів для тривалих експериментів. Включіть оцінювання та експорт у цей календар, а не лише епохи тренування.
У конфігураторі виберіть підготовку PyTorch або власну, ваші пакети та тривалість. Створіть обліковий запис або увійдіть, перш ніж зберегти замовлення та вибрати оплату криптовалютою. Кнопка «Я оплатив» слугує для позначення переказу; відстеження платежу залишається видимим у вашому обліковому записі.