Dimensionare oltre il file dei pesi
Per un servizio di generazione, la dimensione del modello su disco non descrive tutta la memoria necessaria. Aggiungi i buffer di lavoro e la cache utilizzata durante la generazione. Costruisci un set di richieste che comprenda i tuoi input lunghi e più livelli di concorrenza, poi misura il picco ottenuto.
Usa questo margine per scegliere un limite di contesto e una coda espliciti. Una singola richiesta riuscita non basta a fissare la capacità di un servizio utilizzato da più clienti.
Mantenere un percorso CUDA tracciabile
Fissa insieme Python, PyTorch, il motore di inferenza e le sue estensioni. Se cambi la precisione o il motore di attenzione, riesegui gli stessi esempi e confronta anche la qualità degli output. L'H200 offre capacità di memoria; non sceglie al posto tuo i parametri di generazione accettabili.
Archivia il tokenizer, la revisione del modello e la configurazione del servizio insieme ai tuoi risultati. Potrai così distinguere una modifica software da un cambio di hardware.
Il motivo giusto per salire di memoria
Se il tuo carico rientra già in 80 GB con un margine sufficiente, confronta il piano H100 PCIe prima di scegliere l'H200. Se un singolo processo necessita di più di 141 GB, valuta il MI300X e la compatibilità ROCm, oppure prepara una suddivisione multi-scheda su B200. Aggiungere batch non aumenta automaticamente la memoria di un processo.
Dal test di carico al piano
Su 3 giorni, concentrati su una matrice contesto/concorrenza limitata. Una settimana permette di aggiungere errori, riavvii ed export; 30 giorni sono adatti a una campagna di iterazioni già organizzata. Riserva del tempo per recuperare i risultati e il manifest finale.
La configurazione richiede il numero di batch, la preparazione e i tuoi dati di contatto. Il pagamento in crypto è proposto senza KYC né documento d'identità. Dopo il trasferimento, segnalalo con «Ho pagato», poi consulta lo stato del pagamento nel tuo ordine.