Definisci il deliverable che giustifica il tuo noleggio
Per l'elaborazione di file, definisci il volume da elaborare, il formato di output e la regola di ripresa. Un file completato deve poter essere riconosciuto senza rileggere tutta l'esecuzione. Per un servizio interattivo, definisci la dimensione massima delle richieste, il tempo di risposta accettabile e il comportamento quando la capacità è raggiunta. Uno stesso modello può richiedere due organizzazioni molto diverse a seconda di questi vincoli.
Conserva un campione rappresentativo con casi brevi, abituali e vicini ai tuoi limiti. In una pipeline di embeddings, associa ogni vettore all'identificativo e alla versione del suo input. In una generazione di testo, registra i parametri di generazione usati per la valutazione. Devi poter spiegare una differenza di risultato senza attribuirla immediatamente alla GPU.
Scegli la memoria per tutto il carico di inferenza
Il peso dei file del modello non descrive tutta la memoria utilizzata durante l'inferenza. Bisogna considerare anche i tensori temporanei, gli input, gli output conservati e, per i modelli interessati, la cache delle chiavi e dei valori dell'attenzione. Questa cache può diventare importante quando le sequenze si allungano o quando più richieste vengono elaborate insieme.
Inizia con una scheda la cui memoria permetta la tua prova rappresentativa con un margine misurato. I modelli da 24, 32, 48, 80 GB e oltre rispondono a esigenze diverse; nessuna capacità garantisce che un dato modello funzioni con tutte le sue impostazioni. Ridurre la precisione o quantizzare può cambiare l'impronta, ma impone di verificare il supporto del software e la qualità degli output sui tuoi input.
Scegli la GPU compatibile con la tua pipeline software
Elenca il motore di inferenza, i suoi operatori particolari e le estensioni da cui dipendi prima di scegliere l'hardware. Un'applicazione PyTorch può offrire diversi percorsi di esecuzione, mentre un'estensione specializzata ne supporta uno solo. Verifica la catena completa su CUDA per NVIDIA o su ROCm per AMD, incluso il caricamento del modello e il suo preprocessing.
Mantieni un comando minimale che attraversi la pipeline fino alla scrittura di un risultato. Solo dopo, attiva le tue ottimizzazioni una alla volta. Ogni cambiamento di precisione, compilazione o motore deve conservare un controllo di qualità comparabile. Un caricamento riuscito dimostra che i pesi sono leggibili; non dimostra che tutti i percorsi di calcolo necessari funzionino.
Regola il batch in base al tuo obiettivo di elaborazione
Esempio di metodo: costituisci tre gruppi di testi per lunghezza, poi elabora ciascuno con un batch di 1, 2 e 4 input. Queste dimensioni servono come punti di prova, non come raccomandazione universale. Per ogni combinazione, annota gli input completati, il tempo totale, la memoria massima osservata e gli errori. Ferma la progressione quando compare un limite invece di mascherare i fallimenti in una media.
Per un servizio interattivo, aggiungi il tempo trascorso nella coda di attesa. Un batch più grande può cambiare il throughput e il tempo di risposta percepito da una richiesta; una sola media non basta per scegliere. Per l'elaborazione offline, assicurati che il raggruppamento non mescoli l'ordine dei risultati. Scegli infine una configurazione che rispetti il tuo criterio di qualità e il tuo vincolo di tempo di risposta.
Passa a più GPU se la tua applicazione sa distribuire il lavoro
Se ogni istanza del modello sta su una scheda, puoi organizzare più worker che consumano partizioni distinte degli input. Occorre allora coordinare gli identificativi, le riprese e la raccolta degli output. Se il modello deve essere distribuito tra schede, usa una strategia di parallelismo supportata dal tuo motore e verifica i suoi requisiti di comunicazione.
I lotti ordinati descrivono la quantità di hardware, non il batch applicativo né uno spazio di memoria unificato. Per B200, un lotto comprende due schede; per le altre offerte, un lotto comprende una scheda. Indica nel tuo dossier il numero di worker previsti, la quota di input affidata a ciascuno e il modo per verificare che un lavoro sia effettivamente completato.
Scegli un periodo che includa i controlli e l'export
Per un primo noleggio di 3 giorni, definisci un obiettivo limitato: installare, validare la pipeline e produrre un primo risultato utilizzabile. Una durata di 7 giorni può servire a esplorare più varianti; 30 giorni a ripetere un trattamento e consolidarne l'esercizio. Sono modi per organizzare il lavoro, non promesse di tempi di esecuzione.
Alla consegna, conserva i pesi o la loro versione, la configurazione, i controlli di qualità, le misure realmente ottenute e i risultati esportati. Scegli i tuoi software e i tuoi trattamenti in autonomia; Kernodeck non ispeziona il loro contenuto. Prepara tu stesso i tuoi accessi, i tuoi backup e le autorizzazioni necessarie all'uso dei modelli e dei dati.