[Página de referência](<https://kernodeck.com/pt/usages/inference>)

# Escolha a GPU da sua aplicação de inferência.

Embeddings em lote, classificação de imagens ou aplicação interativa: alugue na Kernodeck a GPU adaptada à sua própria inferência. Comece com a RTX 4090 de 24 GB por 110,00 USD para um lote de 1 GPU durante 7 dias. Escolha a capacidade de acordo com a sua memória medida e sua cadeia CUDA; você mantém a preparação e a operação da aplicação.

- Processamentos em lote ou interativos
- Três orçamentos em 7 dias
- Seu motor e seus ajustes

[Escolher uma RTX 4090 · 7 dias](<https://kernodeck.com/pt/compute/configure?config=rtx-4090&days=7>)

Na Kernodeck, nenhum documento de identidade nem procedimento KYC nesse fluxo de locação de GPU. Conta necessária: nome, sobrenome, e-mail e senha; isso não significa anonimato.

Locação para inferência

Um forfait para a sua aplicação, uma capacidade escolhida de acordo com sua carga: compare 24, 48 e 80 GB antes de alugar.

## Fatos essenciais

| Fato | Detalhe |
| --- | --- |
| Período e unidade | Pacote de 3, 7 ou 30 dias para um lote. Um lote contém 1 GPU, exceto a B200: 2 GPU, já incluídas no preço. |
| Disponibilidade | Quantidades declaradas por modelo nas ofertas. Elas não reservam disponibilidade futura nem data de disponibilização. País de hospedagem e zona atendida a confirmar antes da compra, caso o seu projeto os exija. |
| Sem KYC | Na Kernodeck, nenhum documento de identidade nem procedimento KYC nesse fluxo de locação de GPU. Conta necessária: nome, sobrenome, e-mail e senha; isso não significa anonimato. |
| Preparação | Ubuntu, PyTorch, Blender ou solicitação personalizada. Versões, CPU, RAM, armazenamento, rede e modo de acesso a confirmar conforme o projeto; sua inclusão não se deduz do modelo de GPU. |
| Preço e condições | Valores em USD para o lote e todo o período. Situação fiscal e eventuais taxas a confirmar nos termos aplicáveis. |

## Pacotes disponíveis

Preço total em USD para um lote e todo o período. A memória é indicada por GPU; o estoque declarado é expresso em lotes.

| Modelo | Memória por GPU | GPU por lote | Duração | Lotes | Preço total | Estoque declarado em lotes | Situação | Configuração |
| --- | --- | --- | --- | --- | --- | --- | --- | --- |
| [NVIDIA GeForce RTX 4090 24GB](<https://kernodeck.com/pt/compute/rtx-4090>) | 24 Go | 1 | 7 dias | 1 | 110,00 USD | 265 | Para um processamento em lote cuja carga caiba em 24 GB por placa. | [Configurar este pacote](<https://kernodeck.com/pt/compute/configure?config=rtx-4090&days=7>) |
| [NVIDIA L40S 48GB](<https://kernodeck.com/pt/compute/l40s>) | 48 Go | 1 | 7 dias | 1 | 148,00 USD | 74 | Para examinar uma carga interativa ou multimodal com 48 GB por placa. | [Configurar este pacote](<https://kernodeck.com/pt/compute/configure?config=l40s&days=7>) |
| [NVIDIA H100 SXM 80GB](<https://kernodeck.com/pt/compute/h100-sxm>) | 80 Go | 1 | 7 dias | 1 | 475,00 USD | 63 | Para uma necessidade de memória além de 48 GB, com uma pilha CUDA qualificada. | [Configurar este pacote](<https://kernodeck.com/pt/compute/configure?config=h100-sxm&days=7>) |
| [NVIDIA B200 SXM](<https://kernodeck.com/pt/compute/b200>) | 180 Go | 2 | 7 dias | 1 | 2.071,00 USD | 4 | Duas GPUs de 180 GB cada para uma aplicação que organiza seu uso. | [Configurar este pacote](<https://kernodeck.com/pt/compute/configure?config=b200&days=7>) |

## Para seus processamentos em lote: partir da necessidade, depois do forfait

Você quer produzir embeddings para uma coleção de documentos ou classificar um conjunto de imagens? A RTX 4090 é uma candidata a 110,00 USD para um lote de 1 GPU de 24 GB por 7 dias se o seu pipeline CUDA couber nessa memória com suas entradas, seus temporários e uma margem medida. Esse forfait delimita seu orçamento de hardware; você define o número de arquivos, a regra de retomada e os resultados a manter.

Se o pico de memória do seu processamento ultrapassar essa capacidade, compare a L40S: 148,00 USD para um lote de 1 GPU de 48 GB por 7 dias. Ela oferece mais espaço por placa para a carga que você mediu. A escolha entre as duas se baseia nessa capacidade e na compatibilidade da sua cadeia de software, não em um volume de documentos prometido.

Para partições independentes, a B200 abre outra organização: 2.071,00 USD para um lote de 2 GPUs de 180 GB cada por 7 dias, com as duas placas já incluídas nesse preço. Compare essa opção quando sua aplicação souber distribuir os processamentos entre vários workers. Ela não transforma as duas memórias em um espaço único de 360 GB.

- [Escolher 7 dias na RTX 4090 — 110,00 USD](<https://kernodeck.com/pt/compute/configure?config=rtx-4090&days=7>)
- [Escolher 7 dias na L40S — 148,00 USD](<https://kernodeck.com/pt/compute/configure?config=l40s&days=7>)
- [Examinar o lote B200 para processamentos distribuídos](<https://kernodeck.com/pt/compute/b200>)

## Para uma aplicação interativa: escolher a memória da sua carga completa

Um assistente ou uma ferramenta interna precisa levar em conta as requisições simultâneas, seu comprimento e os caches próprios do motor. A L40S a 148,00 USD para um lote de 1 GPU de 48 GB por 7 dias é uma candidata se essa carga completa couber na memória dela e se seu motor oferecer suporte à sua cadeia CUDA. Sua medição da fila de espera e das respostas continua sendo o critério para escolher a configuração.

Se você precisar de mais memória em uma única placa, compare a H100 SXM: 475,00 USD para um lote de 1 GPU de 80 GB por 7 dias. Ela adiciona capacidade por GPU; não basta para garantir a latência ou a vazão da sua aplicação. Se sua necessidade já couber em 24 GB, a RTX 4090 continua sendo uma opção a comparar antes de contratar um plano superior.

Esta oferta é uma locação de GPU para sua aplicação. Uma API de inferência gerenciada constitui outra categoria de serviço: ela pode ser adequada se você busca primeiro um endpoint operado para você. Na Kernodeck, você provê seu motor, suas dependências e sua operação; a preparação e as modalidades de acesso necessárias ao seu projeto ainda precisam ser confirmadas antes de escolher seu ambiente.

- [Escolher 7 dias na H100 SXM — 475,00 USD](<https://kernodeck.com/pt/compute/configure?config=h100-sxm&days=7>)
- [Comparar a L40S e seus planos](<https://kernodeck.com/pt/compute/l40s>)
- [Voltar a 24 GB com a RTX 4090](<https://kernodeck.com/pt/compute/rtx-4090>)
- [Preparar a cadeia de software da sua aplicação](<https://kernodeck.com/pt/docs/environnements-reproductibles>)
- [Comparar os planos de 3, 7 e 30 dias](<https://kernodeck.com/pt/pricing>)

## Seu plano, pagável diretamente em cripto.

Pague seu aluguel Kernodeck diretamente em cripto, sem recarga obrigatória: BTC na Bitcoin e USDT na Tron (TRC-20), entre outros. O processo não exige documento de identidade nem procedimento KYC; conta com nome, sobrenome, email e senha obrigatórios, sem promessa de anonimato.

- [Comparar os oito ativos e redes aceitos](<https://kernodeck.com/pt/docs/crypto-payments>)

## Defina o entregável que justifica sua locação

Para um processamento de arquivos, defina o volume a percorrer, o formato de saída e a regra de retomada. Um arquivo concluído deve poder ser reconhecido sem reler toda a execução. Para um serviço interativo, defina o tamanho máximo das requisições, o tempo de resposta aceitável e o comportamento quando a capacidade é atingida. Um mesmo modelo pode exigir duas organizações bem diferentes conforme essas restrições.

Mantenha uma amostra representativa com casos curtos, habituais e próximos dos seus limites. Em um pipeline de embeddings, associe cada vetor ao identificador e à versão da sua entrada. Em uma geração de texto, registre os parâmetros de geração usados para a avaliação. Você deve poder explicar uma diferença de resultado sem atribuí-la imediatamente à GPU.

## Escolha a memória para toda a carga de inferência

O tamanho dos arquivos do modelo não descreve toda a memória usada durante a inferência. É preciso considerar também os tensores temporários, as entradas, as saídas mantidas e, para os modelos em questão, o cache de chaves e valores da atenção. Esse cache pode se tornar importante quando as sequências se alongam ou quando várias requisições são processadas juntas.

Comece por uma placa cuja memória permita seu teste representativo com uma margem medida. Os modelos de 24, 32, 48, 80 GB e acima atendem a necessidades diferentes; nenhuma capacidade garante que um determinado modelo passará com todos os seus ajustes. Reduzir a precisão ou quantizar pode mudar a pegada de memória, mas exige verificar o suporte do software e a qualidade das saídas nas suas próprias entradas.

- [Comparar as capacidades de memória do catálogo](<https://kernodeck.com/pt/compute>)
- [Identificar a fase que consome memória](<https://kernodeck.com/pt/docs/observer-un-lancement>)

## Escolha o GPU compatível com sua cadeia de software

Liste o motor de inferência, seus operadores específicos e as extensões das quais você depende antes de escolher o hardware. Uma aplicação PyTorch pode oferecer vários caminhos de execução, enquanto uma extensão especializada só suporta um. Verifique a cadeia completa em CUDA para NVIDIA ou em ROCm para AMD, incluindo o carregamento do modelo e seu pré-processamento.

Mantenha um comando mínimo que percorra o pipeline até a gravação de um resultado. Só então ative suas otimizações uma a uma. Cada mudança de precisão, de compilação ou de motor deve manter um controle de qualidade comparável. Um carregamento bem-sucedido demonstra que os pesos são legíveis; não demonstra que todos os caminhos de cálculo necessários funcionam.

## Ajuste o batch de acordo com seu objetivo de processamento

Exemplo de método: monte três grupos de textos por comprimento, depois processe cada um com um batch de 1, de 2 e de 4 entradas. Esses tamanhos servem como pontos de teste, não como recomendação universal. Para cada combinação, anote as entradas concluídas, o tempo total, a memória máxima observada e os erros. Pare a progressão quando um limite aparecer em vez de mascarar as falhas em uma média.

Para um serviço interativo, adicione o tempo gasto na fila de espera. Um batch maior pode mudar a vazão e o tempo de resposta percebido por uma requisição; uma única média não basta para escolher. Para um processamento offline, certifique-se de que o agrupamento não misture a ordem dos resultados. Escolha, por fim, uma configuração que respeite seu critério de qualidade e sua restrição de prazo.

## Passe para várias GPUs se sua aplicação souber distribuir o trabalho

Se cada exemplar do modelo cabe em uma placa, você pode organizar vários workers que consomem partições distintas das entradas. É preciso então coordenar os identificadores, as retomadas e a coleta das saídas. Se o modelo tiver de ser distribuído entre placas, use uma estratégia de paralelismo suportada pelo seu motor e verifique suas exigências de comunicação.

Os lotes solicitados descrevem a quantidade de hardware, não o batch da aplicação nem um espaço de memória unificado. Para B200, um lote inclui duas placas; para as demais ofertas, um lote inclui uma placa. Indique no seu dossiê o número de workers previsto, a parcela de entradas confiada a cada um e a forma de constatar que um trabalho foi realmente concluído.

## Escolha um período que inclua os controles e a exportação

Para uma primeira locação de 3 dias, defina um objetivo limitado: instalar, validar o pipeline e produzir um primeiro resultado utilizável. Uma duração de 7 dias pode servir para percorrer mais variantes; 30 dias, para repetir um processamento e consolidar sua operação. Essas são formas de organizar o trabalho, não promessas de prazo de execução.

Na saída, conserve os pesos ou sua versão, a configuração, os controles de qualidade, as métricas realmente obtidas e os resultados exportados. Você escolhe seus softwares e processamentos com autonomia; a Kernodeck não realiza inspeção do conteúdo deles. Prepare você mesmo seus acessos, seus backups e as autorizações necessárias para o uso dos modelos e dos dados.

## Perguntas antes da compra

### Qual plano escolher para um primeiro processamento de inferência?

Se seu pipeline CUDA e um batch representativo couberem em 24 GB com uma margem medida, comece a comparação pela RTX 4090: 110,00 USD para um lote de 1 GPU por 7 dias. O plano cobre esse período de locação, sem fixar o número de arquivos que sua aplicação poderá processar. Inclua no seu planejamento a instalação, a conferência das saídas e a exportação; os planos de 3 e 30 dias permitem escolher outro período.

### Quando pagar mais por uma L40S ou uma H100 SXM?

Compare a L40S de 48 GB quando a carga completa ultrapassar a margem disponível em 24 GB, e depois a H100 SXM de 80 GB se você buscar mais memória em uma única placa. Os planos de 7 dias custam respectivamente 148,00 USD e 475,00 USD, cada um para um lote de 1 GPU. Inclua o modelo, as entradas, os temporários e os caches na sua medição; uma capacidade maior não garante por si só uma resposta melhor para sua aplicação.

### A locação inclui uma API de inferência pronta para chamar?

A oferta apresentada aqui é uma locação de GPU para sua própria aplicação e não inclui uma API de inferência gerenciada anunciada como pronta para chamar. Você escolhe o motor, os modelos, as dependências e os ajustes, e depois organiza a operação deles. Se sua prioridade é um serviço gerenciado, compare essa categoria de oferta separadamente. Para alugar na Kernodeck, faça confirmar a preparação e as modalidades de acesso exigidas pelo seu projeto.

### A B200 é a escolha lógica para vários processamentos simultâneos?

Ela se torna uma opção a examinar se sua aplicação puder confiar partições independentes a vários workers ou oferecer suporte a uma distribuição explícita. A 2.071,00 USD por 7 dias, um lote B200 já inclui 2 GPUs de 180 GB cada. As memórias não se fundem automaticamente; um modelo distribuído exige uma estratégia compatível com seu motor. Compare também o custo de uma única placa se ela bastar para a carga prevista.

## Escolher e configurar

- [Preparar um ambiente de inferência reprodutível](<https://kernodeck.com/pt/docs/environnements-reproductibles>)
- [Examinar uma opção NVIDIA de 48 GB](<https://kernodeck.com/pt/compute/l40s>)
- [Examinar uma opção AMD para uma cadeia ROCm](<https://kernodeck.com/pt/compute/mi300x>)
- [Escolher uma duração de 3, 7 ou 30 dias](<https://kernodeck.com/pt/pricing>)
- [Os oito pares de cripto aceitos](<https://kernodeck.com/pt/docs/crypto-payments>)
- [Escolher uma capacidade para a inferência](<https://kernodeck.com/pt/usages/inference>)
