Defina o entregável que justifica sua locação
Para um processamento de arquivos, defina o volume a percorrer, o formato de saída e a regra de retomada. Um arquivo concluído deve poder ser reconhecido sem reler toda a execução. Para um serviço interativo, defina o tamanho máximo das requisições, o tempo de resposta aceitável e o comportamento quando a capacidade é atingida. Um mesmo modelo pode exigir duas organizações bem diferentes conforme essas restrições.
Mantenha uma amostra representativa com casos curtos, habituais e próximos dos seus limites. Em um pipeline de embeddings, associe cada vetor ao identificador e à versão da sua entrada. Em uma geração de texto, registre os parâmetros de geração usados para a avaliação. Você deve poder explicar uma diferença de resultado sem atribuí-la imediatamente à GPU.
Escolha a memória para toda a carga de inferência
O tamanho dos arquivos do modelo não descreve toda a memória usada durante a inferência. É preciso considerar também os tensores temporários, as entradas, as saídas mantidas e, para os modelos em questão, o cache de chaves e valores da atenção. Esse cache pode se tornar importante quando as sequências se alongam ou quando várias requisições são processadas juntas.
Comece por uma placa cuja memória permita seu teste representativo com uma margem medida. Os modelos de 24, 32, 48, 80 GB e acima atendem a necessidades diferentes; nenhuma capacidade garante que um determinado modelo passará com todos os seus ajustes. Reduzir a precisão ou quantizar pode mudar a pegada de memória, mas exige verificar o suporte do software e a qualidade das saídas nas suas próprias entradas.
Escolha o GPU compatível com sua cadeia de software
Liste o motor de inferência, seus operadores específicos e as extensões das quais você depende antes de escolher o hardware. Uma aplicação PyTorch pode oferecer vários caminhos de execução, enquanto uma extensão especializada só suporta um. Verifique a cadeia completa em CUDA para NVIDIA ou em ROCm para AMD, incluindo o carregamento do modelo e seu pré-processamento.
Mantenha um comando mínimo que percorra o pipeline até a gravação de um resultado. Só então ative suas otimizações uma a uma. Cada mudança de precisão, de compilação ou de motor deve manter um controle de qualidade comparável. Um carregamento bem-sucedido demonstra que os pesos são legíveis; não demonstra que todos os caminhos de cálculo necessários funcionam.
Ajuste o batch de acordo com seu objetivo de processamento
Exemplo de método: monte três grupos de textos por comprimento, depois processe cada um com um batch de 1, de 2 e de 4 entradas. Esses tamanhos servem como pontos de teste, não como recomendação universal. Para cada combinação, anote as entradas concluídas, o tempo total, a memória máxima observada e os erros. Pare a progressão quando um limite aparecer em vez de mascarar as falhas em uma média.
Para um serviço interativo, adicione o tempo gasto na fila de espera. Um batch maior pode mudar a vazão e o tempo de resposta percebido por uma requisição; uma única média não basta para escolher. Para um processamento offline, certifique-se de que o agrupamento não misture a ordem dos resultados. Escolha, por fim, uma configuração que respeite seu critério de qualidade e sua restrição de prazo.
Passe para várias GPUs se sua aplicação souber distribuir o trabalho
Se cada exemplar do modelo cabe em uma placa, você pode organizar vários workers que consomem partições distintas das entradas. É preciso então coordenar os identificadores, as retomadas e a coleta das saídas. Se o modelo tiver de ser distribuído entre placas, use uma estratégia de paralelismo suportada pelo seu motor e verifique suas exigências de comunicação.
Os lotes solicitados descrevem a quantidade de hardware, não o batch da aplicação nem um espaço de memória unificado. Para B200, um lote inclui duas placas; para as demais ofertas, um lote inclui uma placa. Indique no seu dossiê o número de workers previsto, a parcela de entradas confiada a cada um e a forma de constatar que um trabalho foi realmente concluído.
Escolha um período que inclua os controles e a exportação
Para uma primeira locação de 3 dias, defina um objetivo limitado: instalar, validar o pipeline e produzir um primeiro resultado utilizável. Uma duração de 7 dias pode servir para percorrer mais variantes; 30 dias, para repetir um processamento e consolidar sua operação. Essas são formas de organizar o trabalho, não promessas de prazo de execução.
Na saída, conserve os pesos ou sua versão, a configuração, os controles de qualidade, as métricas realmente obtidas e os resultados exportados. Você escolhe seus softwares e processamentos com autonomia; a Kernodeck não realiza inspeção do conteúdo deles. Prepare você mesmo seus acessos, seus backups e as autorizações necessárias para o uso dos modelos e dos dados.