Відновити проєкт із його параметрами
Відоме середовище зменшує кількість невідомих у новому експерименті. Візьміть версію коду, файл залежностей, параметри та невеликий набір для оцінювання. Спочатку перевірте перезавантаження моделі та формат даних, перш ніж змінювати batch або оптимізатор.
Відтворюваність будується на рівні проєкту. Однакове зерно не гарантує ідентичних результатів після зміни версії PyTorch, обладнання чи алгоритму; тому зберігайте умови та спостережувані розбіжності.
Використовуйте 80 ГБ для правильного етапу
Вимірюйте пам'ять у момент найбільшого навантаження циклу, а не лише після імпорту моделі. Навчання зберігає більше стану, ніж простий інференс. Накопичення градієнтів може допомогти працювати з меншими мікропартіями, але воно не усуває ваги чи стан оптимізатора.
A100 підтримує кілька форматів обчислень, зокрема BF16. Виберіть точність відповідно до операцій і очікуваної якості, а потім зберігайте однакові правила для порівняння двох експериментів.
Альтернатива має відповідати діагностиці
Якщо 80 ГБ достатньо, але ви хочете дослідити Hopper, порівняйте H100 SXM за точно таким самим протоколом. Якщо ваші алокації вже переповнюються, натомість розгляньте H200 на 141 ГБ. І навпаки, проєкт, який залишається значно нижче 48 ГБ, може виправдати спробу на RTX A6000, перш ніж виділяти більше місткості.
Зарезервувати та зберегти відновлення
Три дні підходять для відтворення цільового результату; 7 днів залишають місце для кількох варіантів; 30 днів дозволяють організувати довшу серію з точками відновлення. Пов'язуйте кожну контрольну точку з її етапом і перевіряйте її завантаження до закінчення терміну.
Оренда готується вибором A100, партій, тривалості та середовища, а потім ваших контактних даних. Після вибору крипти та переказу скористайтеся «Я оплатив». Зберігайте номер замовлення в журналі експерименту, щоб пов'язати обладнання, період і результати.