Testar o pipeline, não só o modelo
Para uma aplicação multimodal, use arquivos que representem seus usos: formatos, dimensões e durações variados. Cronometre leitura, preparação, cálculo e exportação. Uma etapa de decodificação ou transformação na CPU pode limitar o conjunto mesmo quando a GPU termina rápido sua parte.
Defina também o que constitui uma saída válida: número de resultados, formato, dimensões e associação com a entrada. Você obterá uma medida útil para o deploy em vez de um tempo de cálculo isolado.
Manter margem dentro dos 48 GB
Reserve espaço para as entradas e os estados temporários além dos pesos. Para um serviço que processa várias requisições, aumente a concorrência gradualmente e observe o pico de memória. Teste separadamente um arquivo grande e vários arquivos comuns; os dois casos podem produzir restrições diferentes.
Valide a pilha PyTorch/CUDA e as bibliotecas de mídia realmente utilizadas. O L40S não oferece NVLink: para multiplicar as placas, preveja um software que distribua explicitamente o trabalho sem supor uma memória unificada.
Escolher conforme o caminho da aplicação
A L4 de 24 GB merece um teste se seu modelo e suas entradas couberem nela. A RTX 6000 Ada também oferece 48 GB e pode ser comparada quando seu projeto associa cálculo e ferramentas de visualização. Se a necessidade de memória ultrapassar essa capacidade, examine as ofertas de 80 GB antes de complicar a divisão.
Um plano para validar seu serviço
Dedique 3 dias à cadeia mínima, 7 dias aos formatos difíceis e aos testes de concorrência, ou 30 dias a uma campanha repetida com configurações arquivadas. Guarde os exemplos que revelaram um erro: eles se tornarão seus testes de não regressão.
Escolha sua preparação, os lotes e a duração, depois preencha os dados do pedido. Você gerencia seus softwares e processamentos de forma autônoma; a Kernodeck não inspeciona o conteúdo dos seus arquivos, prompts ou cálculos. A transferência crypto é sinalizada em seguida com “Já paguei”.