GPU's voor je projecten · crypto-betaling zonder KYC Hoe huren
Nederlands
Console openen
KERNODECK / VOTRE APPLICATION

Kies de GPU voor je inferentieapplicatie.

Batch-embeddings, beeldclassificatie of een interactieve applicatie: huur bij Kernodeck de GPU die past bij je eigen inferentie. Begin met de RTX 4090 van 24 GB voor 110,00 USD voor een lot van 1 GPU gedurende 7 dagen. Kies de capaciteit op basis van je gemeten geheugen en je CUDA-keten; jij houdt de voorbereiding en het beheer van de applicatie in handen.

  • Batch- of interactieve verwerkingen
  • Drie budgetten over 7 dagen
  • Jouw engine en jouw instellingen
Bij Kernodeck is er geen identiteitsbewijs of KYC-procedure in dit GPU-huurproces. Account vereist: voornaam, achternaam, e-mail en wachtwoord; dat betekent geen anonimiteit. Accountgegevens ↗
DRIE CAPACITEITEN · ÉÉN WEEK

Koppel je workload aan een concreet budget.

Model, invoer, tijdelijk geheugen en gelijktijdigheid bepalen de keuze. De versies en toegangen die je applicatie nodig heeft, moeten nog worden bevestigd.

Voor je batchverwerkingen: vertrek van de behoefte, dan van het forfait

Wil je embeddings produceren voor een verzameling documenten of een reeks afbeeldingen classificeren? De RTX 4090 is een kandidaat voor 110,00 USD voor een lot van 1 GPU van 24 GB gedurende 7 dagen als je CUDA-pipeline binnen dat geheugen past met zijn invoer, zijn tijdelijke gegevens en een gemeten marge. Dit forfait kadert je hardwarebudget; jij bepaalt het aantal bestanden, de hervattingsregel en de resultaten die je wilt bewaren.

Als de geheugenpiek van je verwerking deze capaciteit overschrijdt, vergelijk dan de L40S: 148,00 USD voor een pakket van 1 GPU van 48 GB gedurende 7 dagen. Die biedt meer ruimte per kaart voor de belasting die je hebt gemeten. De keuze tussen beide gaat over die capaciteit en de compatibiliteit van je softwareketen, niet over een beloofd documentvolume.

Voor onafhankelijke partities biedt de B200 een andere organisatie: 2.071,00 USD voor een pakket van 2 GPU's van elk 180 GB gedurende 7 dagen, waarbij beide kaarten al in die prijs zijn inbegrepen. Vergelijk deze optie wanneer je applicatie de verwerkingen over meerdere workers kan verdelen. Ze verandert de twee geheugens niet in één enkele ruimte van 360 GB.

Voor een interactieve applicatie: kies het geheugen voor je volledige belasting

Een assistent of interne tool moet rekening houden met gelijktijdige verzoeken, hun lengte en de caches die eigen zijn aan de engine. De L40S tegen 148,00 USD voor een pakket van 1 GPU van 48 GB gedurende 7 dagen is een kandidaat als deze volledige belasting in het geheugen past en je engine de CUDA-keten ondersteunt. Je meting van de wachtrij en de antwoorden blijft het criterium om de configuratie te kiezen.

Als je meer geheugen op één kaart nodig hebt, vergelijk dan de H100 SXM: 475,00 USD voor een pakket van 1 GPU van 80 GB gedurende 7 dagen. Die voegt capaciteit per GPU toe; dat is niet voldoende om de latency of doorvoer van je applicatie te garanderen. Als je behoefte al in 24 GB past, blijft de RTX 4090 het vergelijken waard voordat je een hoger pakket vastlegt.

Dit aanbod is een GPU-huur voor je applicatie. Een beheerde inferentie-API vormt een andere servicecategorie: die kan passen als je in de eerste plaats een voor jou beheerd toegangspunt zoekt. Bij Kernodeck voorzie je je eigen engine, zijn afhankelijkheden en het beheer ervan; de voorbereiding en de toegangsvoorwaarden die je project nodig heeft, moeten nog worden bevestigd voordat je je omgeving kiest.

JOUW BETALING

Je pakket, direct betaalbaar in crypto.

Betaal je Kernodeck-verhuur rechtstreeks in crypto, zonder verplichte opwaardering: BTC op Bitcoin en USDT op Tron (TRC-20), onder andere. Het traject vraagt geen identiteitsbewijs of KYC-procedure; account met voornaam, achternaam, e-mail en wachtwoord vereist, zonder belofte van anonimiteit.

Vergelijk de acht geaccepteerde activa en netwerken ↗

De voorwaarden die nuttig zijn voor jouw project

Beschikbaarheid. Opgegeven hoeveelheden per model in de aanbiedingen. Ze reserveren geen toekomstige beschikbaarheid of leverdatum. Land van hosting en bediend gebied te bevestigen vóór aankoop als je project dat vereist.

Voorbereiding. Ubuntu, PyTorch, Blender of een aangepaste aanvraag. Versies, CPU, RAM, opslag, netwerk en toegangswijze te bevestigen per project; hun inbegrip valt niet af te leiden uit het GPU-model.

Prijzen en voorwaarden. Bedragen in USD voor het lot en de volledige periode. Fiscale status en eventuele kosten te bevestigen in de geldende voorwaarden.

Lees de huurvoorwaarden ↗
AVANT DE CHOISIR

Welke capaciteit huur je voor je inferentie?

Welk pakket kiezen voor een eerste inferentieverwerking?

Als je CUDA-pipeline en een representatieve batch binnen 24 GB passen met een gemeten marge, begin dan de vergelijking met de RTX 4090: 110,00 USD voor een pakket van 1 GPU gedurende 7 dagen. Het pakket dekt die huurperiode, zonder het aantal bestanden vast te leggen dat je applicatie kan verwerken. Houd in je planning rekening met de installatie, de controle van de uitvoer en de export; de pakketten van 3 en 30 dagen laten je een andere periode kiezen.

Wanneer betaal je meer voor een L40S of een H100 SXM?

Vergelijk de L40S van 48 GB wanneer de volledige belasting de beschikbare marge op 24 GB overschrijdt, en daarna de H100 SXM van 80 GB als je meer geheugen op één kaart zoekt. De pakketten van 7 dagen kosten respectievelijk 148,00 USD en 475,00 USD, elk voor een pakket van 1 GPU. Neem het model, de invoer, de tijdelijke bestanden en de caches op in je meting; een hogere capaciteit garandeert op zichzelf geen beter antwoord voor je applicatie.

Omvat de huur een kant-en-klare inferentie-API om aan te roepen?

Het aanbod dat hier wordt gepresenteerd is een GPU-huur voor je eigen applicatie, en omvat geen beheerde inferentie-API die als kant-en-klaar wordt aangekondigd. Jij kiest de engine, de modellen, de afhankelijkheden en de instellingen, en organiseert vervolgens het beheer ervan. Als jouw prioriteit een beheerde dienst is, vergelijk dan deze aanbodcategorie apart. Om bij Kernodeck te huren, laat je de voorbereiding en de toegangsvoorwaarden die je project vereist bevestigen.

Is de B200 de logische keuze voor meerdere gelijktijdige verwerkingen?

Hij wordt een optie om te bekijken als je applicatie onafhankelijke partities aan meerdere workers kan toevertrouwen of een expliciete verdeling ondersteunt. Voor 2.071,00 USD gedurende 7 dagen omvat een B200-pakket al 2 GPU's van elk 180 GB. De geheugens worden niet automatisch samengevoegd; een verdeeld model vraagt een strategie die compatibel is met je engine. Vergelijk ook de kost van één enkele kaart als die volstaat voor de geplande belasting.

OM JE WERK VOOR TE BEREIDEN

Van de pakketkeuze tot je applicatie.

Invoer en reactietijd controleren

Gegevens valideren vóór de GPUTypes, vormen en waarden controleren om ongeldige inputs te isoleren.Een PyTorch-stap profilerenDe meting afbakenen en een CPU/GPU-trace lezen zonder te snel conclusies te trekken.

Bepaal het resultaat dat je huur rechtvaardigt

Definieer voor bestandsverwerking het volume dat doorlopen moet worden, het uitvoerformaat en de herstartregel. Een voltooid bestand moet herkend kunnen worden zonder de hele uitvoering opnieuw te lezen. Definieer voor een interactieve service de maximale aanvraaggrootte, de acceptabele latentie en het gedrag wanneer de capaciteit is bereikt. Hetzelfde model kan twee heel verschillende organisaties vereisen, afhankelijk van deze beperkingen.

Bewaar een representatieve steekproef met korte, gebruikelijke gevallen en gevallen dicht bij je limieten. Koppel in een embeddings-pipeline elke vector aan de identificatie en de versie van zijn input. Registreer bij tekstgeneratie de generatieparameters die voor de evaluatie zijn gebruikt. Je moet een verschil in resultaat kunnen verklaren zonder het meteen aan de GPU toe te schrijven.

Kies het geheugen voor de volledige inferentiebelasting

De bestandsgrootte van de modelgewichten beschrijft niet al het geheugen dat tijdens de inferentie wordt gebruikt. Er moet ook rekening worden gehouden met tijdelijke tensors, inputs, bewaarde outputs en, voor de betrokken modellen, de sleutel- en waardecache van de attention. Deze cache kan aanzienlijk worden wanneer de sequenties langer worden of meerdere aanvragen samen worden verwerkt.

Begin met een kaart waarvan het geheugen je representatieve test mogelijk maakt met een gemeten marge. Modellen van 24, 32, 48, 80 GB en meer beantwoorden aan verschillende behoeften; geen enkele capaciteit garandeert dat een bepaald model met al zijn instellingen zal werken. Het verlagen van de precisie of kwantiseren kan de voetafdruk veranderen, maar vereist dat je de softwareondersteuning en de kwaliteit van de outputs op je eigen inputs controleert.

Kies de GPU die compatibel is met je softwareketen

Maak een lijst van de inferentie-engine, zijn specifieke operatoren en de extensies waarvan je afhankelijk bent voordat je de hardware kiest. Een PyTorch-applicatie kan meerdere uitvoeringspaden bieden, terwijl een gespecialiseerde extensie er slechts één ondersteunt. Controleer de volledige keten op CUDA voor NVIDIA of op ROCm voor AMD, inclusief het laden van het model en de voorverwerking ervan.

Houd een minimale opdracht aan die de pipeline doorloopt tot het wegschrijven van een resultaat. Schakel daarna pas je optimalisaties één voor één in. Elke wijziging in precisie, compilatie of engine moet een vergelijkbare kwaliteitscontrole behouden. Een geslaagde laadtijd toont aan dat de gewichten leesbaar zijn; het toont niet aan dat alle benodigde rekentrajecten werken.

Stel de batch af op je verwerkingsdoel

Voorbeeld van een methode: stel drie groepen teksten samen op basis van lengte en verwerk ze elk met een batch van 1, 2 en 4 inputs. Deze groottes dienen als testpunten, niet als universele aanbeveling. Noteer voor elke combinatie de voltooide inputs, de totale tijd, het maximale waargenomen geheugen en de fouten. Stop de voortgang wanneer een limiet optreedt in plaats van fouten te verbergen in een gemiddelde.

Voeg voor een interactieve service de tijd toe die in de wachtrij wordt doorgebracht. Een grotere batch kan de doorvoer en de door een aanvraag ervaren latentie veranderen; één enkel gemiddelde volstaat niet om te kiezen. Zorg er bij offlineverwerking voor dat het groeperen de volgorde van de resultaten niet door elkaar haalt. Kies uiteindelijk een configuratie die voldoet aan je kwaliteitscriterium en je latentiebeperking.

Schakel over op meerdere GPU's als je applicatie het werk kan verdelen

Als elk exemplaar van het model op één kaart past, kun je meerdere workers organiseren die afzonderlijke partities van de inputs verwerken. Dan moeten de identificaties, herstartpunten en het verzamelen van de outputs worden gecoördineerd. Als het model over kaarten verdeeld moet worden, gebruik dan een parallellismestrategie die door je engine wordt ondersteund en controleer de communicatievereisten ervan.

De bestelde lots beschrijven de hoeveelheid hardware, niet de applicatiebatch of een samengevoegde geheugenruimte. Voor B200 omvat één lot twee kaarten; voor de andere aanbiedingen omvat één lot één kaart. Vermeld in je dossier het aantal geplande workers, het deel van de inputs dat aan elk wordt toevertrouwd en hoe je vaststelt dat een taak daadwerkelijk is voltooid.

Kies een periode die de controles en de export omvat

Voor een eerste huurperiode van 3 dagen stel je een beperkt doel: installeren, de pipeline valideren en een eerste bruikbaar resultaat produceren. Een periode van 7 dagen kan dienen om meer varianten te verkennen; 30 dagen om een verwerking te herhalen en het gebruik ervan te consolideren. Dit zijn manieren om het werk te organiseren, geen beloftes over de uitvoeringstijd.

Bewaar bij de oplevering de gewichten of hun versie, de configuratie, de kwaliteitscontroles, de werkelijk behaalde metingen en de geëxporteerde resultaten. Je kiest je software en verwerkingen zelfstandig; Kernodeck inspecteert de inhoud ervan niet. Regel zelf je toegangen, je back-ups en de benodigde machtigingen voor het gebruik van de modellen en de data.

Deze pagina lezen in Markdown ↗