GPU per i tuoi progetti · pagamento crypto senza KYC Come noleggiare
Italiano
Apri la console
KERNODECK / VOTRE APPLICATION

Scegli il GPU della tua applicazione di inferenza.

Embedding in batch, classificazione di immagini o applicazione interattiva: noleggia su Kernodeck il GPU adatto alla tua inferenza. Inizia con la RTX 4090 da 24 GB a 110,00 USD per un lotto di 1 GPU per 7 giorni. Scegli la capacità in base alla tua memoria misurata e alla tua catena CUDA; la preparazione e la gestione dell'applicazione restano a te.

  • Trattamenti in batch o interattivi
  • Tre budget su 7 giorni
  • Il tuo motore e le tue impostazioni
Con Kernodeck, nessun documento d'identità né procedura KYC in questo percorso di noleggio GPU. Account richiesto: nome, cognome, email e password; questo non significa anonimato. Dati dell'account ↗
TRE CAPACITÀ · UNA SETTIMANA

Collega il tuo carico a un budget concreto.

Modello, input, memoria temporanea e concorrenza orientano la scelta. Le versioni e gli accessi necessari alla tua applicazione restano da confermare.

Per i tuoi trattamenti in batch: partire dall'esigenza, poi dal forfait

Vuoi produrre embedding per una collezione di documenti o classificare un insieme di immagini? La RTX 4090 è una candidata a 110,00 USD per un lotto di 1 GPU da 24 GB su 7 giorni se la tua pipeline CUDA rientra in questa memoria con i suoi input, i suoi temporanei e un margine misurato. Questo forfait inquadra il tuo budget hardware; sei tu a stabilire il numero di file, la regola di ripresa e i risultati da conservare.

Se il picco di memoria della tua elaborazione supera questa capacità, confronta la L40S: 148,00 USD per un lotto di 1 GPU da 48 GB su 7 giorni. Offre più spazio per scheda per il carico che hai misurato. La scelta tra le due riguarda questa capacità e la compatibilità della tua pipeline software, non un volume di documenti promesso.

Per partizioni indipendenti, B200 apre un'altra organizzazione: 2071,00 USD per un lotto di 2 GPU da 180 GB ciascuna su 7 giorni, entrambe le schede già incluse in questo prezzo. Confronta questa opzione quando la tua applicazione sa distribuire le elaborazioni tra più worker. Non trasforma le due memorie in uno spazio unico da 360 GB.

Per un'applicazione interattiva: scegliere la memoria del tuo carico completo

Un assistente o uno strumento interno deve tenere conto delle richieste simultanee, della loro lunghezza e delle cache proprie del motore. La L40S a 148,00 USD per un lotto di 1 GPU da 48 GB su 7 giorni è una candidata se questo carico completo rientra nella sua memoria e se il tuo motore supporta la sua catena CUDA. La tua misura della coda e delle risposte resta il criterio per scegliere la configurazione.

Se hai bisogno di più memoria su una singola scheda, confronta la H100 SXM: 475,00 USD per un lotto di 1 GPU da 80 GB su 7 giorni. Aggiunge capacità per GPU; non basta a garantire la latenza o il throughput della tua applicazione. Se il tuo fabbisogno rientra già in 24 GB, la RTX 4090 resta da confrontare prima di impegnare un piano superiore.

Questa offerta è un noleggio GPU per la tua applicazione. Un'API di inferenza gestita costituisce un'altra categoria di servizio: può essere adatta se cerchi innanzitutto un endpoint gestito per te. Su Kernodeck, prevedi il tuo motore, le sue dipendenze e la sua gestione; la preparazione e le modalità di accesso necessarie al tuo progetto restano da confermare prima di scegliere il tuo ambiente.

IL TUO PAGAMENTO

Il tuo piano, pagabile direttamente in crypto.

Paga il tuo noleggio Kernodeck direttamente in crypto, senza ricariche imposte: BTC su Bitcoin e USDT su Tron (TRC-20), tra gli altri. Il percorso non richiede né documento d'identità né procedura KYC; sono richiesti un account con nome, cognome, email e password, senza promessa di anonimato.

Confronta gli otto asset e reti accettati ↗

Le condizioni utili al tuo progetto

Disponibilità. Quantità dichiarate per modello nelle offerte. Non riservano una disponibilità futura né una data di messa a disposizione. Paese di hosting e zona servita da confermare prima dell'acquisto se il tuo progetto li richiede.

Preparazione. Ubuntu, PyTorch, Blender o richiesta personalizzata. Versioni, CPU, RAM, storage, rete e modalità di accesso da confermare in base al progetto; la loro inclusione non si deduce dal modello GPU.

Prezzi e condizioni. Importi in USD per il lotto e per l'intero periodo. Status fiscale ed eventuali costi da confermare nelle condizioni applicabili.

Leggi le condizioni di noleggio ↗
AVANT DE CHOISIR

Quale capacità noleggiare per la tua inferenza?

Quale piano scegliere per una prima elaborazione di inferenza?

Se la tua pipeline CUDA e un batch rappresentativo rientrano in 24 GB con un margine misurato, inizia il confronto dalla RTX 4090: 110,00 USD per un lotto di 1 GPU per 7 giorni. Il piano copre questo periodo di noleggio, senza fissare il numero di file che la tua applicazione potrà elaborare. Tieni nella tua pianificazione l'installazione, il controllo degli output e l'export; i piani da 3 e 30 giorni permettono di scegliere un altro periodo.

Quando pagare di più per una L40S o una H100 SXM?

Confronta la L40S da 48 GB quando il carico completo supera il margine disponibile su 24 GB, poi la H100 SXM da 80 GB se cerchi più memoria su una singola scheda. I piani da 7 giorni costano rispettivamente 148,00 USD e 475,00 USD, ciascuno per un lotto di 1 GPU. Includi nel tuo calcolo il modello, gli input, i file temporanei e le cache; una capacità superiore non garantisce da sola una risposta migliore per la tua applicazione.

Il noleggio include un'API di inferenza pronta all'uso?

L'offerta presentata qui è un noleggio GPU per la tua applicazione e non comprende un'API di inferenza gestita dichiarata pronta all'uso. Scegli tu il motore, i modelli, le dipendenze e le impostazioni, poi ne organizzi la gestione. Se la tua priorità è un servizio gestito, confronta questa categoria di offerta separatamente. Per noleggiare su Kernodeck, fai confermare la preparazione e le modalità di accesso richieste dal tuo progetto.

B200 è la scelta logica per più elaborazioni simultanee?

Diventa un'opzione da esaminare se la tua applicazione può affidare partizioni indipendenti a più worker o supporta una distribuzione esplicita. A 2071,00 USD su 7 giorni, un lotto B200 comprende già 2 GPU da 180 GB ciascuna. Le memorie non si fondono automaticamente; un modello distribuito richiede una strategia compatibile con il tuo motore. Confronta anche il costo di una singola scheda se basta al carico previsto.

PER PREPARARE IL TUO LAVORO

Dalla scelta del piano alla tua applicazione.

Verificare gli input e il tempo di risposta

Validare i dati prima della GPUControllare tipi, forme e valori per isolare gli input non validi.Profilare una fase PyTorchDelimitare la misurazione e leggere una traccia CPU/GPU senza concludere troppo in fretta.

Definisci il deliverable che giustifica il tuo noleggio

Per l'elaborazione di file, definisci il volume da elaborare, il formato di output e la regola di ripresa. Un file completato deve poter essere riconosciuto senza rileggere tutta l'esecuzione. Per un servizio interattivo, definisci la dimensione massima delle richieste, il tempo di risposta accettabile e il comportamento quando la capacità è raggiunta. Uno stesso modello può richiedere due organizzazioni molto diverse a seconda di questi vincoli.

Conserva un campione rappresentativo con casi brevi, abituali e vicini ai tuoi limiti. In una pipeline di embeddings, associa ogni vettore all'identificativo e alla versione del suo input. In una generazione di testo, registra i parametri di generazione usati per la valutazione. Devi poter spiegare una differenza di risultato senza attribuirla immediatamente alla GPU.

Scegli la memoria per tutto il carico di inferenza

Il peso dei file del modello non descrive tutta la memoria utilizzata durante l'inferenza. Bisogna considerare anche i tensori temporanei, gli input, gli output conservati e, per i modelli interessati, la cache delle chiavi e dei valori dell'attenzione. Questa cache può diventare importante quando le sequenze si allungano o quando più richieste vengono elaborate insieme.

Inizia con una scheda la cui memoria permetta la tua prova rappresentativa con un margine misurato. I modelli da 24, 32, 48, 80 GB e oltre rispondono a esigenze diverse; nessuna capacità garantisce che un dato modello funzioni con tutte le sue impostazioni. Ridurre la precisione o quantizzare può cambiare l'impronta, ma impone di verificare il supporto del software e la qualità degli output sui tuoi input.

Scegli la GPU compatibile con la tua pipeline software

Elenca il motore di inferenza, i suoi operatori particolari e le estensioni da cui dipendi prima di scegliere l'hardware. Un'applicazione PyTorch può offrire diversi percorsi di esecuzione, mentre un'estensione specializzata ne supporta uno solo. Verifica la catena completa su CUDA per NVIDIA o su ROCm per AMD, incluso il caricamento del modello e il suo preprocessing.

Mantieni un comando minimale che attraversi la pipeline fino alla scrittura di un risultato. Solo dopo, attiva le tue ottimizzazioni una alla volta. Ogni cambiamento di precisione, compilazione o motore deve conservare un controllo di qualità comparabile. Un caricamento riuscito dimostra che i pesi sono leggibili; non dimostra che tutti i percorsi di calcolo necessari funzionino.

Regola il batch in base al tuo obiettivo di elaborazione

Esempio di metodo: costituisci tre gruppi di testi per lunghezza, poi elabora ciascuno con un batch di 1, 2 e 4 input. Queste dimensioni servono come punti di prova, non come raccomandazione universale. Per ogni combinazione, annota gli input completati, il tempo totale, la memoria massima osservata e gli errori. Ferma la progressione quando compare un limite invece di mascherare i fallimenti in una media.

Per un servizio interattivo, aggiungi il tempo trascorso nella coda di attesa. Un batch più grande può cambiare il throughput e il tempo di risposta percepito da una richiesta; una sola media non basta per scegliere. Per l'elaborazione offline, assicurati che il raggruppamento non mescoli l'ordine dei risultati. Scegli infine una configurazione che rispetti il tuo criterio di qualità e il tuo vincolo di tempo di risposta.

Passa a più GPU se la tua applicazione sa distribuire il lavoro

Se ogni istanza del modello sta su una scheda, puoi organizzare più worker che consumano partizioni distinte degli input. Occorre allora coordinare gli identificativi, le riprese e la raccolta degli output. Se il modello deve essere distribuito tra schede, usa una strategia di parallelismo supportata dal tuo motore e verifica i suoi requisiti di comunicazione.

I lotti ordinati descrivono la quantità di hardware, non il batch applicativo né uno spazio di memoria unificato. Per B200, un lotto comprende due schede; per le altre offerte, un lotto comprende una scheda. Indica nel tuo dossier il numero di worker previsti, la quota di input affidata a ciascuno e il modo per verificare che un lavoro sia effettivamente completato.

Scegli un periodo che includa i controlli e l'export

Per un primo noleggio di 3 giorni, definisci un obiettivo limitato: installare, validare la pipeline e produrre un primo risultato utilizzabile. Una durata di 7 giorni può servire a esplorare più varianti; 30 giorni a ripetere un trattamento e consolidarne l'esercizio. Sono modi per organizzare il lavoro, non promesse di tempi di esecuzione.

Alla consegna, conserva i pesi o la loro versione, la configurazione, i controlli di qualità, le misure realmente ottenute e i risultati esportati. Scegli i tuoi software e i tuoi trattamenti in autonomia; Kernodeck non ispeziona il loro contenuto. Prepara tu stesso i tuoi accessi, i tuoi backup e le autorizzazioni necessarie all'uso dei modelli e dei dati.

Leggi questa pagina in Markdown ↗