Vertrek vanuit een volledige trainingsstap
Je eerste test moet het lezen van de data, de forward pass, de gradiëntberekening en de update van de optimizer doorlopen. Meet deze volledige cyclus voordat je de batch vergroot. De gewichten zijn slechts een deel van het bezette geheugen: activaties en trainingsstatussen moeten ook binnen de 80 GB passen.
Bewaar een representatieve reeks invoer, inclusief de omvangrijke voorbeelden. Zo voorkom je dat je de hele campagne afstemt op een eerste bijzonder makkelijke batch.
Gemengde precisie en gecontroleerde vergelijking
Met PyTorch kun je via autocast een passende precisie kiezen voor bepaalde bewerkingen. Test deze instelling op je verliesfunctie en je validatiecriteria. Een ingeschakelde optie is geen bewijs van numerieke stabiliteit: houd een vergelijkingsrun, metrieken en de exacte parameters bij.
Onderscheid bij meerdere kaarten de batch per GPU van de globale batch. Het aantal processen en de accumulatie van gradiënten maken deel uit van het protocol, net als het leertempo.
SXM, PCIe of meer geheugen
De H100 PCIe behoudt een capaciteit van 80 GB en is het waard om te vergelijken voor werk dat in essentie singlecard is. Meet voor frequente uitwisselingen tussen GPU's de topologie die je applicatie daadwerkelijk gebruikt; de naam SXM vervangt die controle niet. Kies de H200 als het geïdentificeerde probleem in de eerste plaats een gebrek aan geheugen per kaart is.
Reserveer een periode die de hervatting omvat
Kies 3 dagen om een cyclus en een checkpoint te valideren, 7 dagen voor een reeks ablatie-experimenten, of 30 dagen voor langdurige experimenten. Neem de evaluatie en de export op in die planning, niet alleen de trainingsepochs.
Selecteer in de configurator de PyTorch- of aangepaste voorbereiding, je batches en je looptijd. Maak je account aan of log in voordat je de bestelling opslaat en de crypto-betaling kiest. Met de knop "Ik heb betaald" meld je de overschrijving; de betalingsstatus blijft zichtbaar in je account.