Inferenza: passare dal modello caricato al servizio utile
Vuoi generare risposte, estrarre rappresentazioni o elaborare un corpus. Inizia definendo il formato di input, la sua dimensione e la frequenza delle richieste. Un test con un input breve non descrive un servizio che deve accettare più richieste lunghe in parallelo.
Il percorso di inferenza ti aiuta a preparare un set di richieste, un controllo di disponibilità e una lettura dei risultati. Puoi poi confrontare la GPU e i parametri senza cambiare contemporaneamente il carico da misurare. I risultati attesi sono un profilo di richieste, una procedura di avvio e un insieme di misure conservato con la sua configurazione.
Adattamento: organizzare un esperimento che si può riprendere
Adattare un modello richiede di collegare i dati di addestramento, il metodo e i criteri di valutazione. Prima di un'esecuzione lunga, verifica una fase di calcolo, la scrittura di un checkpoint e la sua rilettura. Avrai una base concreta per scegliere la durata del piano e il ritmo di salvataggio.
Il percorso di adattamento propone un'organizzazione per esperimento: ipotesi, parametri, output e decisione successiva. Riserva un insieme di valutazione al confronto, poi conserva i risultati anche quando l'esperimento non dà il miglioramento atteso. Capire un risultato negativo può evitare di ripetere lo stesso lavoro.
Più lotti per lavori ben separati
Quando gli esperimenti sono indipendenti, assegna a ciascuno la sua configurazione, i suoi input e la sua destinazione dei risultati. Definisci poi quale attività utilizza quale scheda. Questa organizzazione è adatta ad esempio a un confronto di parametri o all'elaborazione di partizioni di un corpus.
Per un singolo modello distribuito, prepara invece il meccanismo di ripartizione e gli scambi necessari al programma. Il numero di GPU è quindi un elemento dell'architettura software. Le schede hardware e la guida degli ambienti ti aiutano a raccordare questa decisione con il tuo ordine.