Partir de uma etapa completa de treinamento
Seu primeiro teste deve percorrer a leitura dos dados, a passagem direta, o cálculo dos gradientes e a atualização do otimizador. Meça esse ciclo completo antes de aumentar o batch. Os pesos são apenas uma parte da memória ocupada: ativações e estados de treinamento também precisam caber nos 80 GB.
Mantenha uma sequência de entradas representativa, incluindo os exemplos volumosos. Assim você evita dimensionar toda a campanha a partir de um primeiro lote particularmente fácil.
Precisão mista e comparação controlada
O PyTorch permite escolher uma precisão adequada para certas operações com o autocast. Teste esse ajuste na sua função de perda e nos seus critérios de validação. Uma opção ativada não é prova de estabilidade numérica: mantenha uma execução de comparação, métricas e os parâmetros exatos.
Para várias placas, diferencie o batch por GPU do batch global. O número de processos e a acumulação de gradientes fazem parte do protocolo, assim como a taxa de aprendizado.
SXM, PCIe ou mais memória
O H100 PCIe mantém uma capacidade de 80 GB e merece ser comparado para um trabalho essencialmente monocartão. Para trocas frequentes entre GPUs, meça a topologia efetivamente usada pela sua aplicação; o nome SXM não substitui essa verificação. Prefira o H200 se o problema identificado for, antes de tudo, a falta de memória por placa.
Reservar um período que inclua a retomada
Escolha 3 dias para validar um loop e um checkpoint, 7 dias para uma série de ablação, ou 30 dias para experimentos acompanhados. Inclua a avaliação e a exportação nesse calendário, não apenas as épocas de treinamento.
No configurador, selecione a preparação PyTorch ou personalizada, seus lotes e sua duração. Crie sua conta ou faça login antes de salvar o pedido e escolher o pagamento em criptomoeda. O botão « J'ai payé » serve para sinalizar a transferência; o acompanhamento do pagamento permanece visível na sua conta.