Inferência: do modelo carregado ao serviço útil
Você quer gerar respostas, extrair representações ou processar um corpus. Comece definindo o formato de entrada, seu tamanho e a frequência das requisições. Um teste com uma entrada curta não descreve um serviço que deve aceitar várias requisições longas em paralelo.
O percurso de inferência ajuda você a preparar um conjunto de requisições, um controle de disponibilidade e uma leitura dos resultados. Em seguida, você pode comparar a GPU e os parâmetros sem alterar simultaneamente a carga a medir. As saídas esperadas são um perfil de requisições, um procedimento de inicialização e um conjunto de medições mantido junto com sua configuração.
Adaptação: organizar um experimento que possa ser retomado
Adaptar um modelo exige relacionar os dados de treinamento, o método e os critérios de avaliação. Antes de uma execução longa, verifique uma etapa de cálculo, a gravação de um checkpoint e sua releitura. Você terá uma base concreta para escolher a duração do plano e o ritmo de salvamento.
O percurso de adaptação propõe uma organização por experimento: hipótese, parâmetros, saídas e decisão seguinte. Reserve um conjunto de avaliação para a comparação e depois conserve os resultados mesmo quando o experimento não traz a melhoria esperada. Entender um resultado negativo pode evitar repetir o mesmo trabalho.
Vários lotes para trabalhos bem separados
Quando os experimentos são independentes, atribua a cada um a sua configuração, as suas entradas e o seu destino de resultados. Depois, defina qual tarefa usa qual placa. Essa organização é adequada, por exemplo, para uma comparação de parâmetros ou para o processamento de partições de um corpus.
Para um único modelo distribuído, prepare, ao contrário, o mecanismo de distribuição e as trocas necessárias ao programa. O número de GPUs passa então a ser um elemento da arquitetura de software. As fichas de hardware e o guia de ambientes ajudam a aproximar essa decisão do seu pedido.