Due schede, un piano di ripartizione esplicito
Inizia scegliendo tra due strategie: una copia del modello su ogni scheda per elaborare dati diversi, oppure un modello realmente ripartito tra le GPU. Il parallelismo dei dati di PyTorch non trasforma, da solo, due memorie in un'unica riserva utilizzabile da un modello troppo voluminoso.
I 180 GB appartengono a ciascuna B200. Per sfruttarli insieme, documenta la suddivisione del modello, gli scambi tra processi e il salvataggio delle partizioni. Un breve test di comunicazione e ripristino deve precedere la campagna completa.
Verifica Blackwell prima di ottimizzare
Prepara una distribuzione PyTorch e estensioni compilate compatibili con B200. Una libreria Python importata senza errori può ancora fallire al primo kernel CUDA: testa quindi il caricamento, un passaggio in avanti, il calcolo dei gradienti e la scrittura di un checkpoint. Conserva le versioni che hanno eseguito questo percorso.
Separa poi la compilazione iniziale dal calcolo stabilizzato nelle tue misurazioni. Questa distinzione aiuta a decidere se un'ottimizzazione merita di essere conservata per il tuo carico.
Quando scegliere H200 o MI300X
Se tutta la tua elaborazione sta su una sola scheda e non utilizza la seconda GPU, valuta l'H200 SXM da 141 GB. Se la tua priorità è una grande memoria per scheda con un ambiente ROCm sotto controllo, il MI300X da 192 GB rappresenta un'altra pista. La scelta dipende innanzitutto dal software e dal piano di calcolo.
Pianificare il lotto e i suoi deliverable
Prevedi 3 giorni per validare l'avvio distribuito, 7 giorni per confrontare più configurazioni e 30 giorni per una campagna accompagnata da checkpoint regolari. Ogni lotto ordinato contiene due B200; verifica il totale delle schede nel riepilogo.
Seleziona la durata, i lotti e la preparazione, poi inserisci nome, cognome ed email. Scegli la tua crypto e la sua rete; dopo il trasferimento, «Ho pagato» registra la tua segnalazione. Conserva il riferimento dell'ordine insieme al manifesto delle esecuzioni.