Partire da uno step di addestramento completo
Il tuo primo test deve percorrere la lettura dei dati, il passaggio in avanti, il calcolo dei gradienti e l'aggiornamento dell'optimizer. Misura questo ciclo completo prima di aumentare il batch. I pesi sono solo una parte della memoria occupata: anche le attivazioni e gli stati di addestramento devono rientrare negli 80 GB.
Conserva una sequenza di input rappresentativa, inclusi gli esempi voluminosi. Eviterai di dimensionare tutta la campagna a partire da un primo batch particolarmente facile.
Precisione mista e confronto controllato
PyTorch consente di scegliere una precisione adatta per alcune operazioni con l'autocast. Testa questa impostazione sulla tua funzione di perdita e sui tuoi criteri di validazione. Un'opzione attivata non è una prova di stabilità numerica: mantieni un'esecuzione di confronto, delle metriche e i parametri esatti.
Per più schede, distingui il batch per GPU dal batch globale. Il numero di processi e l'accumulo dei gradienti fanno parte del protocollo, al pari del tasso di apprendimento.
SXM, PCIe o più memoria
L'H100 PCIe mantiene una capacità di 80 GB e merita di essere confrontato per un lavoro essenzialmente su singola scheda. Per scambi frequenti tra GPU, misura la topologia effettivamente utilizzata dalla tua applicazione; il nome SXM non sostituisce questo controllo. Preferisci l'H200 se il problema identificato è innanzitutto la mancanza di memoria per scheda.
Prenotare un periodo che includa la ripresa
Scegli 3 giorni per validare un ciclo e un checkpoint, 7 giorni per una serie di ablation, oppure 30 giorni per esperimenti monitorati. Inserisci la valutazione e l'esportazione in questo calendario, non solo le epoche di addestramento.
Nel configuratore, seleziona la preparazione PyTorch o personalizzata, i tuoi lotti e la durata. Crea il tuo account o accedi prima di salvare l'ordine e scegliere il pagamento crypto. Il pulsante «Ho pagato» serve a segnalare il trasferimento; il monitoraggio del pagamento resta visibile nel tuo account.