GPU's voor je projecten · crypto-betaling zonder KYC Hoe huren
Nederlands
Console openen
GPU-fiche / KERNODECK

A100 SXM: een Ampere-basis van 80 GB behouden

De A100 SXM levert 80 GB HBM2e-geheugen per GPU. Dit model is nuttig om een PyTorch-project dat al op Ampere is gekwalificeerd voort te zetten, trainingsvarianten te vergelijken of een uitgangspunt te leggen voor een migratie naar Hopper.

1 GPU's inbegrepenHBM2e
80GB per kaart

78 beschikbare kaarten.

Geheugen per GPU aangegeven. Kies de duur en daarna het aantal lots in de configurator.

3 jours

1 GPU per lot

US$ 120,00Huren 3 jours

7 jours

1 GPU per lot

US$ 280,00Huren 7 jours

30 jours

1 GPU per lot

US$ 990,00Huren 30 jours

Een project hervatten met zijn parameters

Een bekende omgeving vermindert de onbekenden van een nieuw experiment. Neem de codeversie, het afhankelijkhedenbestand, de parameters en een kleine evaluatieset mee. Test eerst het opnieuw laden van het model en het gegevensformaat voordat je de batch of de optimizer wijzigt.

Reproduceerbaarheid bouw je op projectniveau op. Dezelfde seed garandeert geen identieke resultaten na een wijziging van PyTorch-versie, hardware of algoritme; bewaar dus de omstandigheden en de waargenomen afwijkingen.

De 80 GB gebruiken voor de juiste stap

Meet het geheugen op het zwaarst belaste moment van de lus, niet alleen na het importeren van het model. Een training bewaart meer toestand dan een eenvoudige inferentie. Gradiëntaccumulatie kan helpen om met kleinere microbatchs te werken, maar ze schrapt de gewichten noch de toestand van de optimizer.

De A100 ondersteunt meerdere rekenformaten, waaronder BF16. Kies de precisie op basis van de bewerkingen en de verwachte kwaliteit, en houd dezelfde regels aan om twee experimenten te vergelijken.

Een alternatief moet op de diagnose inspelen

Als de 80 GB volstaan maar je Hopper wilt bestuderen, vergelijk dan de H100 SXM met exact hetzelfde protocol. Als je toewijzingen al overstromen, bekijk dan eerder de H200 met 141 GB. Omgekeerd kan een project dat ruim onder 48 GB blijft een test op RTX A6000 rechtvaardigen voordat je meer capaciteit toewijst.

Reserveren en de hervatting behouden

Drie dagen volstaan voor het reproduceren van een gericht resultaat; 7 dagen laten ruimte voor meerdere varianten; 30 dagen maken een langere reeks met hervatpunten mogelijk. Koppel elk checkpoint aan zijn stap en test het laden ervoor de deadline.

De huur bereid je voor door A100, de batches, de duur en de omgeving te kiezen, en daarna je gegevens. Na de crypto-keuze en de overdracht gebruik je 'Ik heb betaald'. Bewaar het ordernummer in het logboek van het experiment om hardware, periode en resultaten met elkaar te verbinden.