GPU's voor je projecten · crypto-betaling zonder KYC Hoe huren
Nederlands
Console openen
GPU-fiche / KERNODECK

H200 SXM: 141 GB om je inferentieruimte te vergroten

De H200 SXM biedt 141 GB HBM3e-geheugen per GPU binnen het NVIDIA Hopper-ecosysteem. Het is een optie om te overwegen wanneer gewichten, context of gelijktijdige verzoeken een kaart van 80 GB krap maken.

1 GPU's inbegrepenHBM3e
141GB per kaart

19 beschikbare kaarten.

Geheugen per GPU aangegeven. Kies de duur en daarna het aantal lots in de configurator.

3 jours

1 GPU per lot

US$ 274,29Huren 3 jours

7 jours

1 GPU per lot

US$ 640,00Huren 7 jours

30 jours

1 GPU per lot

US$ 2.290,00Huren 30 jours

Dimensioneren voorbij het gewichtenbestand

Voor een generatieservice beschrijft de grootte van het model op schijf niet al het benodigde geheugen. Tel de werkbuffers en de cache die tijdens de generatie worden gebruikt erbij op. Stel een set verzoeken samen met je lange invoer en meerdere niveaus van gelijktijdigheid, en meet vervolgens de resulterende piek.

Gebruik deze marge om een expliciete contextlimiet en wachtrij te kiezen. Een geslaagd geïsoleerd verzoek is niet voldoende om de capaciteit van een service die door meerdere klanten wordt gebruikt vast te stellen.

Een traceerbaar CUDA-pad behouden

Zet Python, PyTorch, de inference-engine en zijn extensies samen vast. Als je de precisie of de attention-engine wijzigt, speel dan dezelfde voorbeelden opnieuw af en vergelijk ook de kwaliteit van de uitvoer. De H200 levert geheugencapaciteit; hij kiest niet voor jou welke generatieparameters acceptabel zijn.

Archiveer de tokenizer, de modelrevisie en de serviceconfiguratie samen met je resultaten. Zo kun je een softwarewijziging onderscheiden van een hardwarewijziging.

Het juiste motief om het geheugen op te schalen

Als je workload al binnen 80 GB past met voldoende marge, vergelijk dan het H100 PCIe-forfait voordat je voor de H200 kiest. Als één proces meer dan 141 GB nodig heeft, bekijk dan de MI300X en ROCm-compatibiliteit, of bereid een verdeling over meerdere kaarten op B200 voor. Meer batches toevoegen vergroot niet automatisch het geheugen van een proces.

Van loadtest naar forfait

Focus je bij 3 dagen op een beperkte matrix van context en gelijktijdigheid. Een week biedt ruimte om fouten, herstarts en exports toe te voegen; 30 dagen zijn geschikt voor een al georganiseerde iteratiecampagne. Reserveer tijd om de resultaten en het definitieve manifest op te halen.

De configuratie vraagt om het aantal batches, de voorbereiding en je contactgegevens. Crypto-betaling wordt aangeboden zonder KYC of identiteitsbewijs. Meld de betaling na de overdracht met 'Ik heb betaald' en bekijk daarna de status van de betaling in je bestelling.