Bepaal het resultaat dat je huur rechtvaardigt
Definieer voor bestandsverwerking het volume dat doorlopen moet worden, het uitvoerformaat en de herstartregel. Een voltooid bestand moet herkend kunnen worden zonder de hele uitvoering opnieuw te lezen. Definieer voor een interactieve service de maximale aanvraaggrootte, de acceptabele latentie en het gedrag wanneer de capaciteit is bereikt. Hetzelfde model kan twee heel verschillende organisaties vereisen, afhankelijk van deze beperkingen.
Bewaar een representatieve steekproef met korte, gebruikelijke gevallen en gevallen dicht bij je limieten. Koppel in een embeddings-pipeline elke vector aan de identificatie en de versie van zijn input. Registreer bij tekstgeneratie de generatieparameters die voor de evaluatie zijn gebruikt. Je moet een verschil in resultaat kunnen verklaren zonder het meteen aan de GPU toe te schrijven.
Kies het geheugen voor de volledige inferentiebelasting
De bestandsgrootte van de modelgewichten beschrijft niet al het geheugen dat tijdens de inferentie wordt gebruikt. Er moet ook rekening worden gehouden met tijdelijke tensors, inputs, bewaarde outputs en, voor de betrokken modellen, de sleutel- en waardecache van de attention. Deze cache kan aanzienlijk worden wanneer de sequenties langer worden of meerdere aanvragen samen worden verwerkt.
Begin met een kaart waarvan het geheugen je representatieve test mogelijk maakt met een gemeten marge. Modellen van 24, 32, 48, 80 GB en meer beantwoorden aan verschillende behoeften; geen enkele capaciteit garandeert dat een bepaald model met al zijn instellingen zal werken. Het verlagen van de precisie of kwantiseren kan de voetafdruk veranderen, maar vereist dat je de softwareondersteuning en de kwaliteit van de outputs op je eigen inputs controleert.
Kies de GPU die compatibel is met je softwareketen
Maak een lijst van de inferentie-engine, zijn specifieke operatoren en de extensies waarvan je afhankelijk bent voordat je de hardware kiest. Een PyTorch-applicatie kan meerdere uitvoeringspaden bieden, terwijl een gespecialiseerde extensie er slechts één ondersteunt. Controleer de volledige keten op CUDA voor NVIDIA of op ROCm voor AMD, inclusief het laden van het model en de voorverwerking ervan.
Houd een minimale opdracht aan die de pipeline doorloopt tot het wegschrijven van een resultaat. Schakel daarna pas je optimalisaties één voor één in. Elke wijziging in precisie, compilatie of engine moet een vergelijkbare kwaliteitscontrole behouden. Een geslaagde laadtijd toont aan dat de gewichten leesbaar zijn; het toont niet aan dat alle benodigde rekentrajecten werken.
Stel de batch af op je verwerkingsdoel
Voorbeeld van een methode: stel drie groepen teksten samen op basis van lengte en verwerk ze elk met een batch van 1, 2 en 4 inputs. Deze groottes dienen als testpunten, niet als universele aanbeveling. Noteer voor elke combinatie de voltooide inputs, de totale tijd, het maximale waargenomen geheugen en de fouten. Stop de voortgang wanneer een limiet optreedt in plaats van fouten te verbergen in een gemiddelde.
Voeg voor een interactieve service de tijd toe die in de wachtrij wordt doorgebracht. Een grotere batch kan de doorvoer en de door een aanvraag ervaren latentie veranderen; één enkel gemiddelde volstaat niet om te kiezen. Zorg er bij offlineverwerking voor dat het groeperen de volgorde van de resultaten niet door elkaar haalt. Kies uiteindelijk een configuratie die voldoet aan je kwaliteitscriterium en je latentiebeperking.
Schakel over op meerdere GPU's als je applicatie het werk kan verdelen
Als elk exemplaar van het model op één kaart past, kun je meerdere workers organiseren die afzonderlijke partities van de inputs verwerken. Dan moeten de identificaties, herstartpunten en het verzamelen van de outputs worden gecoördineerd. Als het model over kaarten verdeeld moet worden, gebruik dan een parallellismestrategie die door je engine wordt ondersteund en controleer de communicatievereisten ervan.
De bestelde lots beschrijven de hoeveelheid hardware, niet de applicatiebatch of een samengevoegde geheugenruimte. Voor B200 omvat één lot twee kaarten; voor de andere aanbiedingen omvat één lot één kaart. Vermeld in je dossier het aantal geplande workers, het deel van de inputs dat aan elk wordt toevertrouwd en hoe je vaststelt dat een taak daadwerkelijk is voltooid.
Kies een periode die de controles en de export omvat
Voor een eerste huurperiode van 3 dagen stel je een beperkt doel: installeren, de pipeline valideren en een eerste bruikbaar resultaat produceren. Een periode van 7 dagen kan dienen om meer varianten te verkennen; 30 dagen om een verwerking te herhalen en het gebruik ervan te consolideren. Dit zijn manieren om het werk te organiseren, geen beloftes over de uitvoeringstijd.
Bewaar bij de oplevering de gewichten of hun versie, de configuratie, de kwaliteitscontroles, de werkelijk behaalde metingen en de geëxporteerde resultaten. Je kiest je software en verwerkingen zelfstandig; Kernodeck inspecteert de inhoud ervan niet. Regel zelf je toegangen, je back-ups en de benodigde machtigingen voor het gebruik van de modellen en de data.