1. Definir um resultado antes de escolher a placa
Escolha uma amostra que percorra todo o seu aplicativo. Para inferência, parta de algumas entradas representativas e de um formato de saída esperado. Para o ajuste de um modelo, preveja uma execução curta que leia os dados, faça uma atualização e escreva um checkpoint. O objetivo é verificar o caminho completo antes de confiar a ele o volume final.
Vejamos um exemplo didático: você quer classificar documentos. Prepare doze documentos identificados, com vários comprimentos e um caso que o programa deve recusar corretamente. Fixe as categorias permitidas e o destino dos resultados. Os doze identificadores deverão aparecer exatamente uma vez no balanço, com um resultado aceito ou um erro explícito. Esse cenário deve ser adaptado ao seu aplicativo; ele não pressupõe nenhum modelo ou taxa específica.
Role a tabela para ler todas as colunas.| Ponto a verificar | Critério preparado antes do lançamento |
|---|---|
| Entradas | 12 identificadores únicos; arquivos legíveis; um caso inválido previsto. |
| Resultados | Uma categoria permitida por documento aceito; nenhum identificador inventado. |
| Falhas | Um motivo associado a cada documento recusado; nenhum desaparecimento silencioso. |
| Fim do teste | Aceitos + recusados = 12; relatório e resultados revisados a partir de uma cópia. |
2. Escolher o backend, a memória e o plano
Comece pelas bibliotecas do projeto. Uma dependência CUDA o orienta para uma cadeia NVIDIA; uma oferta MI300X exige examinar o suporte a ROCm, em especial o das extensões. O seletor oficial do PyTorch distingue sistema e plataforma de computação: copiar um comando de outra máquina não constitui uma verificação de compatibilidade.
Em seguida, compare a memória necessária para uma tarefa representativa: pesos, entradas, cálculos intermediários e estados próprios do seu método. O tamanho do arquivo do modelo não basta. Se você ainda não conhece o pico, mantenha esse ponto como objetivo do piloto, sem afirmar que um modelo vai caber a partir do seu número de parâmetros apenas.
Escolha 3, 7 ou 30 dias e de 1 a 10 lotes. Um lote contém uma placa, exceto a B200, que contém duas. Várias placas não distribuem automaticamente o programa e não unificam a memória delas. Preveja na duração a instalação, as verificações, o cálculo e a exportação; os doze documentos do piloto servem para verificar o procedimento, não para prever mecanicamente a duração de toda a campanha.
3. Preparar um diretório que sobreviva à troca de máquina
Reúna a revisão do código, as dependências, a referência dos dados e do modelo, os parâmetros e o comando de entrada. Indique como fornecer os acessos necessários separadamente. Um caminho para o seu diretório pessoal não é um procedimento de transferência: substitua as suposições implícitas por parâmetros e verifique os caminhos a partir do diretório do projeto.
A preparação Ubuntu, PyTorch, Blender ou personalizada escolhida na configuração expressa a sua necessidade. Ela não prova que o seu projeto, suas extensões ou suas licenças já estão instalados. Descreva o que deve estar presente e depois verifique o ambiente efetivamente recebido antes de começar o processamento.
Para o nosso lote de documentos, mantenha uma entrada piloto imutável, um arquivo de parâmetros e um diretório de resultados distinto por teste. Escreva também como revisar o balanço. Esse diretório não precisa ser volumoso; ele deve evitar que o sucesso dependa de uma célula esquecida, de um terminal antigo ou de um arquivo não copiado.
projeto/
README.md # instalação, execução, verificação
requirements-rebuild.txt # dependências e origem documentadas
config/pilote.json # parâmetros sem segredos
data/pilote/ # as 12 entradas permitidas
src/ # seu aplicativo
runs/ # um subdiretório por teste4. Revise o pedido e siga as etapas do serviço
O resumo deve corresponder à sua escolha: modelo, duração, lotes, número total de placas, preparação e valor em USD. O total é o preço do lote pela duração, multiplicado pelo número de lotes. O preço do lote B200 já inclui suas duas placas: não multiplique uma segunda vez pelo número de GPUs.
Para um primeiro pedido, crie sua conta com nome, sobrenome, e-mail e senha. Se você já tem uma conta, faça login; se já estiver conectado, os dados estarão preenchidos. A conta permite consultar os pedidos e o saldo de outro navegador. O processo não exige KYC nem documento de identidade.
Para pagar em cripto, use o ativo, a rede, o endereço, o valor e o prazo exibidos para o pagamento em questão. Após a transferência, "Já paguei" registra sua notificação. Ele não confirma o recebimento dos fundos nem a disponibilização. Um saldo em USD suficiente também pode pagar integralmente a locação. Em seguida, siga as informações de preparação e os acessos efetivamente comunicados.
5. Controlar a inicialização antes do volume final
Quando o recurso for disponibilizado, identifique o interpretador realmente utilizado e o ambiente carregado. Execute o diagnóstico mínimo antes da sua aplicação. Um import do PyTorch bem-sucedido não demonstra um cálculo em GPU; um cálculo simples bem-sucedido não valida todas as extensões do modelo. A pasta de diagnóstico descreve essa progressão e fornece um recurso para download.
Em seguida, execute seu piloto em um diretório de saída novo. Para os documentos, verifique os identificadores, as categorias, o número de sucessos e as recusas esperadas. Examine vários resultados com suas entradas: uma saída sintaticamente válida pode permanecer incorreta para o uso. Só passe ao corpus completo depois de registrar o que foi aceito e o que ainda precisa ser corrigido.
Se a inicialização falhar, anote o primeiro erro e a etapa alcançada. Verifique o interpretador antes de reinstalar; os caminhos antes de recopiar; o tamanho das entradas antes de aumentar o batch. Altere um fator por vez. Se o processo for longo, organize seu acompanhamento separadamente da conexão interativa usada para iniciá-lo.
6. Recuperar uma prova utilizável e decidir o próximo passo
Copie os resultados e seu balanço para um local que você controla e revise essa cópia. Verifique se ela contém os parâmetros e referências necessários para entender o resultado. Não considere um arquivo presente no ambiente de cálculo como seu único backup. Faça essa verificação durante o piloto, sem esperar o vencimento da locação.
Para um treinamento, adicione um teste de retomada em um novo processo. O mini-projeto Kernodeck demonstra um método em CPU; sua aplicação ainda precisa qualificar seus próprios estados, precisão e dados. Para documentos independentes, a retomada consiste antes em identificar os elementos concluídos e os que precisam ser reprocessados.
Sua decisão final pode ser iniciar o volume previsto, corrigir o ambiente ou rever a configuração. Guarde essa decisão com seu motivo. Um piloto que revela uma incompatibilidade é útil: ele transforma um problema vago em uma condição precisa a resolver antes de empregar mais cálculo.