Uma aplicação em placa única legível
Comece com um processo que carrega seu modelo, processa um lote e exporta um resultado. Defina o tamanho das entradas e o número de requisições. Esse cenário simples permite identificar se o próximo esforço deve recair sobre a memória da GPU, os dados ou a lógica Python.
Com 80 GB, você pode explorar cargas mais volumosas do que com uma placa de 24 ou 48 GB, mantendo um único domínio de memória para gerenciar. Preveja, no entanto, uma margem para as alocações temporárias do seu motor.
Observar as transferências tanto quanto o kernel
Um programa que recarrega os mesmos dados entre duas chamadas pode passar boa parte do tempo fora do cálculo útil. Cronometre separadamente a preparação na CPU, a transferência, a execução e a recuperação do resultado. Para medições CUDA, leve em conta a execução assíncrona para não medir apenas a submissão do trabalho.
Valide o funcionamento com sua versão do PyTorch e as bibliotecas compiladas do projeto. Mantenha um teste sem otimização como ponto de comparação antes de modificar o caminho de execução.
Comparar sem confundir os formatos H100
O H100 SXM e o H100 PCIe não descrevem a mesma configuração de hardware. Opte pelo SXM se seu estudo justificar medir seu comportamento para trocas distribuídas. Opte antes pelo H200 quando sua carga em placa única ultrapassa os 80 GB. O A100 SXM continua sendo uma alternativa a examinar para um ambiente Ampere já qualificado.
Alugar para produzir uma decisão
Um pacote de 3 dias pode servir para estabelecer o perfil inicial. Em 7 dias, teste vários tamanhos de lotes e mantenha um relatório comparativo; em 30 dias, organize as execuções e seu acompanhamento com identificadores estáveis.
Escolha a duração, o número de lotes e a preparação no configurador, depois crie sua conta ou faça login. O pagamento segue o ativo e a rede selecionados. Após sua transferência, « J'ai payé » adiciona uma sinalização ao pedido, que você encontra na sua conta Kernodeck.