[Page de référence](<https://kernodeck.com/usages/inference>)

# Choisissez le GPU de votre application d’inférence.

Embeddings par lots, classement d’images ou application interactive : louez chez Kernodeck le GPU adapté à votre propre inférence. Commencez avec la RTX 4090 de 24 Go à 110,00 USD pour un lot de 1 GPU pendant 7 jours. Choisissez la capacité selon votre mémoire mesurée et votre chaîne CUDA ; vous gardez la préparation et l’exploitation de l’application.

- Traitements par lots ou interactifs
- Trois budgets sur 7 jours
- Votre moteur et vos réglages

[Choisir une RTX 4090 · 7 jours](<https://kernodeck.com/compute/configure?config=rtx-4090&days=7>)

Chez Kernodeck, aucune pièce d’identité ni procédure KYC dans ce parcours de location GPU. Compte requis : prénom, nom, email et mot de passe ; cela ne signifie pas anonymat.

Location pour inférence

Un forfait pour votre application, une capacité choisie selon sa charge : comparez 24, 48 et 80 Go avant de louer.

## Faits essentiels

| Fait | Détail |
| --- | --- |
| Période et unité | Forfait de 3, 7 ou 30 jours pour un lot. Un lot contient 1 GPU, sauf B200 : 2 GPU, déjà compris dans son prix. |
| Disponibilité | Quantités déclarées par modèle dans les offres. Elles ne réservent pas une disponibilité future ni une date de mise à disposition. Pays d’hébergement et zone desservie à confirmer avant achat si votre projet les impose. |
| Sans KYC | Chez Kernodeck, aucune pièce d’identité ni procédure KYC dans ce parcours de location GPU. Compte requis : prénom, nom, email et mot de passe ; cela ne signifie pas anonymat. |
| Préparation | Ubuntu, PyTorch, Blender ou demande personnalisée. Versions, CPU, RAM, stockage, réseau et mode d’accès à confirmer selon le projet ; leur inclusion ne se déduit pas du modèle GPU. |
| Prix et conditions | Montants USD pour le lot et toute la période. Statut fiscal et frais éventuels à confirmer dans les conditions applicables. |

## Forfaits disponibles

Prix total en USD pour un lot et toute la période. La mémoire est indiquée par GPU ; le stock déclaré est exprimé en lots.

| Modèle | Mémoire par GPU | GPU par lot | Durée | Lots | Prix total | Stock déclaré en lots | Situation | Configuration |
| --- | --- | --- | --- | --- | --- | --- | --- | --- |
| [NVIDIA GeForce RTX 4090 24GB](<https://kernodeck.com/compute/rtx-4090>) | 24 Go | 1 | 7 jours | 1 | 110,00 USD | 265 | Pour un traitement par lots dont la charge tient dans 24 Go par carte. | [Configurer ce forfait](<https://kernodeck.com/compute/configure?config=rtx-4090&days=7>) |
| [NVIDIA L40S 48GB](<https://kernodeck.com/compute/l40s>) | 48 Go | 1 | 7 jours | 1 | 148,00 USD | 74 | Pour examiner une charge interactive ou multimodale avec 48 Go par carte. | [Configurer ce forfait](<https://kernodeck.com/compute/configure?config=l40s&days=7>) |
| [NVIDIA H100 SXM 80GB](<https://kernodeck.com/compute/h100-sxm>) | 80 Go | 1 | 7 jours | 1 | 475,00 USD | 63 | Pour un besoin de mémoire allant au-delà de 48 Go, avec une pile CUDA qualifiée. | [Configurer ce forfait](<https://kernodeck.com/compute/configure?config=h100-sxm&days=7>) |
| [NVIDIA B200 SXM](<https://kernodeck.com/compute/b200>) | 180 Go | 2 | 7 jours | 1 | 2 071,00 USD | 4 | Deux GPU de 180 Go chacun pour une application qui organise leur utilisation. | [Configurer ce forfait](<https://kernodeck.com/compute/configure?config=b200&days=7>) |

## Pour vos traitements par lots : partir du besoin, puis du forfait

Vous voulez produire des embeddings pour une collection de documents ou classer un ensemble d’images ? La RTX 4090 est une candidate à 110,00 USD pour un lot de 1 GPU de 24 Go sur 7 jours si votre pipeline CUDA tient dans cette mémoire avec ses entrées, ses temporaires et une marge mesurée. Ce forfait cadre votre budget matériel ; vous fixez le nombre de fichiers, la règle de reprise et les résultats à conserver.

Si le pic de mémoire de votre traitement dépasse cette capacité, comparez la L40S : 148,00 USD pour un lot de 1 GPU de 48 Go sur 7 jours. Elle donne davantage d’espace par carte pour la charge que vous avez mesurée. Le choix entre les deux porte sur cette capacité et la compatibilité de votre chaîne logicielle, pas sur un volume de documents promis.

Pour des partitions indépendantes, B200 ouvre une autre organisation : 2 071,00 USD pour un lot de 2 GPU de 180 Go chacun sur 7 jours, les deux cartes étant déjà comprises dans ce prix. Comparez cette option lorsque votre application sait répartir les traitements entre plusieurs travailleurs. Elle ne transforme pas les deux mémoires en un espace unique de 360 Go.

- [Choisir 7 jours sur RTX 4090 — 110,00 USD](<https://kernodeck.com/compute/configure?config=rtx-4090&days=7>)
- [Choisir 7 jours sur L40S — 148,00 USD](<https://kernodeck.com/compute/configure?config=l40s&days=7>)
- [Examiner le lot B200 pour des traitements répartis](<https://kernodeck.com/compute/b200>)

## Pour une application interactive : choisir la mémoire de votre charge complète

Un assistant ou un outil interne doit prendre en compte les requêtes simultanées, leur longueur et les caches propres au moteur. La L40S à 148,00 USD pour un lot de 1 GPU de 48 Go sur 7 jours est une candidate si cette charge complète tient dans sa mémoire et si votre moteur prend en charge sa chaîne CUDA. Votre mesure de la file d’attente et des réponses reste le critère pour retenir la configuration.

Si vous avez besoin de davantage de mémoire sur une seule carte, comparez le H100 SXM : 475,00 USD pour un lot de 1 GPU de 80 Go sur 7 jours. Il ajoute de la capacité par GPU ; il ne suffit pas à garantir la latence ou le débit de votre application. Si votre besoin tient déjà dans 24 Go, la RTX 4090 reste à comparer avant d’engager un forfait supérieur.

Cette offre est une location GPU pour votre application. Une API d’inférence gérée constitue une autre catégorie de service : elle peut convenir si vous cherchez d’abord un point d’appel exploité pour vous. Chez Kernodeck, prévoyez votre moteur, ses dépendances et son exploitation ; la préparation et les modalités d’accès nécessaires à votre projet restent à confirmer avant de choisir votre environnement.

- [Choisir 7 jours sur H100 SXM — 475,00 USD](<https://kernodeck.com/compute/configure?config=h100-sxm&days=7>)
- [Comparer la L40S et ses forfaits](<https://kernodeck.com/compute/l40s>)
- [Revenir à 24 Go avec la RTX 4090](<https://kernodeck.com/compute/rtx-4090>)
- [Préparer la chaîne logicielle de votre application](<https://kernodeck.com/docs/environnements-reproductibles>)
- [Comparer les forfaits de 3, 7 et 30 jours](<https://kernodeck.com/pricing>)

## Votre forfait, payable directement en crypto.

Payez votre location Kernodeck directement en crypto, sans recharge imposée : BTC sur Bitcoin et USDT sur Tron (TRC-20), notamment. Le parcours ne demande ni pièce d’identité ni procédure KYC ; compte avec prénom, nom, email et mot de passe requis, sans promesse d’anonymat.

- [Comparer les huit actifs et réseaux acceptés](<https://kernodeck.com/docs/crypto-payments>)

## Définissez le livrable qui justifie votre location

Pour un traitement de fichiers, définissez le volume à parcourir, le format de sortie et la règle de reprise. Un fichier terminé doit pouvoir être reconnu sans relire toute l’exécution. Pour un service interactif, définissez la taille maximale des requêtes, le délai acceptable et le comportement lorsque la capacité est atteinte. Un même modèle peut demander deux organisations très différentes selon ces contraintes.

Conservez un échantillon représentatif avec des cas courts, habituels et proches de vos limites. Dans un pipeline d’embeddings, associez chaque vecteur à l’identifiant et à la version de son entrée. Dans une génération de texte, enregistrez les paramètres de génération utilisés pour l’évaluation. Vous devez pouvoir expliquer une différence de résultat sans l’attribuer immédiatement au GPU.

## Choisissez la mémoire pour toute la charge d’inférence

Le poids des fichiers du modèle ne décrit pas toute la mémoire utilisée pendant l’inférence. Il faut aussi considérer les tenseurs temporaires, les entrées, les sorties conservées et, pour les modèles concernés, le cache des clés et valeurs de l’attention. Ce cache peut devenir important lorsque les séquences s’allongent ou que plusieurs requêtes sont traitées ensemble.

Commencez par une carte dont la mémoire permet votre essai représentatif avec une marge mesurée. Les modèles de 24, 32, 48, 80 Go et au-delà répondent à des besoins différents ; aucune capacité ne garantit qu’un modèle donné passera avec tous ses réglages. Réduire la précision ou quantifier peut changer l’empreinte, mais impose de vérifier le support du logiciel et la qualité des sorties sur vos propres entrées.

- [Comparer les capacités de mémoire du catalogue](<https://kernodeck.com/compute>)
- [Identifier la phase qui consomme la mémoire](<https://kernodeck.com/docs/observer-un-lancement>)

## Retenez le GPU compatible avec votre chaîne logicielle

Listez le moteur d’inférence, ses opérateurs particuliers et les extensions dont vous dépendez avant de choisir le matériel. Une application PyTorch peut proposer plusieurs chemins d’exécution, alors qu’une extension spécialisée n’en prend en charge qu’un. Vérifiez la chaîne complète sur CUDA pour NVIDIA ou sur ROCm pour AMD, y compris le chargement du modèle et son prétraitement.

Gardez une commande minimale qui traverse le pipeline jusqu’à l’écriture d’un résultat. Ensuite seulement, activez vos optimisations une à une. Chaque changement de précision, de compilation ou de moteur doit conserver un contrôle de qualité comparable. Un chargement réussi démontre que les poids sont lisibles ; il ne démontre pas que tous les chemins de calcul nécessaires fonctionnent.

## Réglez le batch selon votre objectif de traitement

Exemple de méthode : constituez trois groupes de textes par longueur, puis traitez chacun avec un batch de 1, de 2 et de 4 entrées. Ces tailles servent de points d’essai, pas de recommandation universelle. Pour chaque combinaison, notez les entrées terminées, le temps total, la mémoire maximale observée et les erreurs. Arrêtez la progression lorsqu’une limite apparaît au lieu de masquer les échecs dans une moyenne.

Pour un service interactif, ajoutez le temps passé dans la file d’attente. Un batch plus grand peut changer le débit et le délai ressenti par une requête ; une seule moyenne ne suffit pas à choisir. Pour un traitement hors ligne, assurez-vous que le regroupement ne mélange pas l’ordre des résultats. Choisissez finalement une configuration qui respecte votre critère de qualité et votre contrainte de délai.

## Passez à plusieurs GPU si votre application sait répartir le travail

Si chaque exemplaire du modèle tient sur une carte, vous pouvez organiser plusieurs travailleurs qui consomment des partitions distinctes des entrées. Il faut alors coordonner les identifiants, les reprises et la collecte des sorties. Si le modèle doit être réparti entre cartes, utilisez une stratégie de parallélisme prise en charge par votre moteur et vérifiez ses exigences de communication.

Les lots commandés décrivent la quantité de matériel, pas le batch applicatif ni un espace mémoire fusionné. Pour B200, un lot comprend deux cartes ; pour les autres offres, un lot comprend une carte. Faites apparaître dans votre dossier le nombre de travailleurs prévu, la part d’entrées confiée à chacun et la manière de constater qu’un travail est effectivement terminé.

## Choisissez une période qui inclut les contrôles et l’export

Pour une première location de 3 jours, cadrez un objectif limité : installer, valider le pipeline et produire un premier résultat exploitable. Une durée de 7 jours peut servir à parcourir davantage de variantes ; 30 jours à répéter un traitement et consolider son exploitation. Ce sont des façons d’organiser le travail, pas des promesses de délai d’exécution.

À la sortie, conservez les poids ou leur version, la configuration, les contrôles de qualité, les mesures réellement obtenues et les résultats exportés. Vous choisissez vos logiciels et vos traitements en autonomie ; Kernodeck ne procède pas à une inspection de leur contenu. Préparez vous-même vos accès, vos sauvegardes et les autorisations nécessaires à l’utilisation des modèles et des données.

## Questions avant achat

### Quel forfait choisir pour un premier traitement d’inférence ?

Si votre pipeline CUDA et un batch représentatif tiennent dans 24 Go avec une marge mesurée, commencez la comparaison par la RTX 4090 : 110,00 USD pour un lot de 1 GPU pendant 7 jours. Le forfait couvre cette période de location, sans fixer le nombre de fichiers que votre application pourra traiter. Gardez dans votre planning l’installation, le contrôle des sorties et l’export ; les forfaits de 3 et 30 jours permettent de choisir une autre période.

### Quand payer davantage pour une L40S ou un H100 SXM ?

Comparez la L40S de 48 Go lorsque la charge complète dépasse la marge disponible sur 24 Go, puis le H100 SXM de 80 Go si vous cherchez davantage de mémoire sur une seule carte. Les forfaits de 7 jours coûtent respectivement 148,00 USD et 475,00 USD, chacun pour un lot de 1 GPU. Incluez le modèle, les entrées, les temporaires et les caches dans votre mesure ; une capacité supérieure ne garantit pas à elle seule une meilleure réponse pour votre application.

### La location comprend-elle une API d’inférence prête à appeler ?

L’offre présentée ici est une location GPU pour votre propre application, et ne comprend pas une API d’inférence gérée annoncée comme prête à appeler. Vous choisissez le moteur, les modèles, les dépendances et les réglages, puis vous organisez leur exploitation. Si votre priorité est un service géré, comparez cette catégorie d’offre séparément. Pour louer chez Kernodeck, faites confirmer la préparation et les modalités d’accès requises par votre projet.

### B200 est-il le choix logique pour plusieurs traitements simultanés ?

Il devient une option à examiner si votre application peut confier des partitions indépendantes à plusieurs travailleurs ou prend en charge une répartition explicite. À 2 071,00 USD sur 7 jours, un lot B200 comprend déjà 2 GPU de 180 Go chacun. Les mémoires ne fusionnent pas automatiquement ; un modèle réparti demande une stratégie compatible avec votre moteur. Comparez aussi le coût d’une seule carte si elle suffit à la charge prévue.

## Choisir et configurer

- [Préparer un environnement d’inférence reproductible](<https://kernodeck.com/docs/environnements-reproductibles>)
- [Examiner une option NVIDIA de 48 Go](<https://kernodeck.com/compute/l40s>)
- [Examiner une option AMD pour une chaîne ROCm](<https://kernodeck.com/compute/mi300x>)
- [Choisir une durée de 3, 7 ou 30 jours](<https://kernodeck.com/pricing>)
- [Les huit couples crypto acceptés](<https://kernodeck.com/docs/crypto-payments>)
- [Choisir une capacité pour l’inférence](<https://kernodeck.com/usages/inference>)
