Duas placas, um plano de distribuição explícito
Comece escolhendo entre duas estratégias: uma cópia do modelo em cada placa para processar dados diferentes, ou um modelo realmente distribuído entre as GPUs. O paralelismo de dados do PyTorch não transforma, por si só, duas memórias em uma única reserva utilizável por um modelo grande demais.
Os 180 GB pertencem a cada B200. Para aproveitá-los juntos, documente a divisão do modelo, as trocas entre processos e o salvamento das partições. Um teste curto de comunicação e restauração deve preceder a campanha completa.
Verificar Blackwell antes de otimizar
Prepare uma distribuição PyTorch e extensões compiladas compatíveis com B200. Uma biblioteca Python importada sem erro ainda pode falhar no primeiro kernel CUDA: portanto, teste o carregamento, uma passada para frente, o cálculo dos gradientes e a escrita de um checkpoint. Guarde as versões que executaram esse percurso.
Em seguida, separe a compilação inicial e o cálculo estabilizado em suas medições. Essa distinção ajuda a decidir se uma otimização merece ser mantida para sua própria carga.
Quando escolher H200 ou MI300X
Se todo o seu processamento couber em uma única placa e não usar a segunda GPU, examine o H200 SXM de 141 GB. Se sua prioridade for uma grande memória por placa com um ambiente ROCm controlado, o MI300X de 192 GB é outro caminho. A escolha depende primeiro do software e do plano de cálculo.
Planejar o lote e seus entregáveis
Preveja 3 dias para validar a inicialização distribuída, 7 dias para comparar vários ajustes e 30 dias para uma campanha acompanhada de checkpoints regulares. Cada lote solicitado contém dois B200; verifique o total de placas no resumo.
Selecione a duração, os lotes e a preparação, depois preencha nome, sobrenome e email. Escolha sua cripto e sua rede; após a transferência, «J'ai payé» registra seu aviso. Guarde a referência do pedido com o manifesto das execuções.