Partir d’une étape complète d’entraînement
Votre premier essai doit parcourir la lecture des données, la passe avant, le calcul des gradients et la mise à jour de l’optimiseur. Mesurez ce cycle complet avant d’augmenter le batch. Les poids ne sont qu’une partie de la mémoire occupée : activations et états d’entraînement doivent aussi tenir dans les 80 Go.
Conservez une séquence d’entrées représentative, y compris les exemples volumineux. Vous éviterez de dimensionner toute la campagne à partir d’un premier lot particulièrement facile.
Précision mixte et comparaison contrôlée
PyTorch permet de choisir une précision adaptée pour certaines opérations avec l’autocast. Testez ce réglage sur votre fonction de perte et vos critères de validation. Une option activée n’est pas une preuve de stabilité numérique : gardez une exécution de comparaison, des métriques et les paramètres exacts.
Pour plusieurs cartes, distinguez le batch par GPU du batch global. Le nombre de processus et l’accumulation des gradients font partie du protocole, au même titre que le taux d’apprentissage.
SXM, PCIe ou davantage de mémoire
Le H100 PCIe conserve une capacité de 80 Go et mérite d’être comparé pour un travail essentiellement monocarte. Pour des échanges fréquents entre GPU, mesurez la topologie effectivement utilisée par votre application ; le nom SXM ne remplace pas ce contrôle. Préférez le H200 si le problème identifié est d’abord le manque de mémoire par carte.
Réserver une période qui inclut la reprise
Choisissez 3 jours pour valider une boucle et un checkpoint, 7 jours pour une série d’ablation, ou 30 jours pour des expériences suivies. Faites figurer l’évaluation et l’export dans ce calendrier, pas seulement les époques d’entraînement.
Dans le configurateur, sélectionnez la préparation PyTorch ou personnalisée, vos lots et votre durée. Créez votre compte ou connectez-vous avant d’enregistrer la commande et de choisir le règlement crypto. Le bouton « J’ai payé » sert à signaler le transfert ; le suivi du paiement reste visible dans votre compte.