Dimensionar além do arquivo de pesos
Para um serviço de geração, o tamanho do modelo em disco não descreve toda a memória necessária. Some os buffers de trabalho e o cache usado durante a geração. Monte um conjunto de requisições que inclua suas entradas longas e vários níveis de concorrência, depois meça o pico obtido.
Use essa margem para escolher um limite de contexto e uma fila explícitos. Uma requisição isolada bem-sucedida não basta para definir a capacidade de um serviço usado por vários clientes.
Manter um caminho CUDA rastreável
Fixe em conjunto o Python, o PyTorch, o motor de inferência e suas extensões. Se você mudar a precisão ou o motor de atenção, rode os mesmos exemplos novamente e compare também a qualidade das saídas. O H200 traz capacidade de memória; ele não escolhe por você os parâmetros de geração aceitáveis.
Arquive o tokenizer, a revisão do modelo e a configuração de serviço junto com seus resultados. Assim você poderá distinguir uma mudança de software de uma mudança de hardware.
O motivo certo para aumentar a memória
Se sua carga já cabe em 80 GB com margem suficiente, compare o plano H100 PCIe antes de escolher o H200. Se um único processo precisar de mais que 141 GB, examine o MI300X e a compatibilidade com ROCm, ou prepare um particionamento multicartão em B200. Adicionar lotes não aumenta automaticamente a memória de um processo.
Do teste de carga ao plano
Em 3 dias, concentre-se em uma matriz contexto/concorrência limitada. Uma semana permite adicionar os erros, as reinicializações e as exportações; 30 dias são adequados a uma campanha de iterações já organizada. Reserve tempo para recuperar os resultados e o manifesto final.
A configuração pede o número de lotes, a preparação e seus dados de contato. O pagamento em crypto é oferecido sem KYC nem documento de identidade. Após a transferência, informe com "Já paguei" e depois consulte o status do pagamento no seu pedido.