Définissez le livrable qui justifie votre location
Pour un traitement de fichiers, définissez le volume à parcourir, le format de sortie et la règle de reprise. Un fichier terminé doit pouvoir être reconnu sans relire toute l’exécution. Pour un service interactif, définissez la taille maximale des requêtes, le délai acceptable et le comportement lorsque la capacité est atteinte. Un même modèle peut demander deux organisations très différentes selon ces contraintes.
Conservez un échantillon représentatif avec des cas courts, habituels et proches de vos limites. Dans un pipeline d’embeddings, associez chaque vecteur à l’identifiant et à la version de son entrée. Dans une génération de texte, enregistrez les paramètres de génération utilisés pour l’évaluation. Vous devez pouvoir expliquer une différence de résultat sans l’attribuer immédiatement au GPU.
Choisissez la mémoire pour toute la charge d’inférence
Le poids des fichiers du modèle ne décrit pas toute la mémoire utilisée pendant l’inférence. Il faut aussi considérer les tenseurs temporaires, les entrées, les sorties conservées et, pour les modèles concernés, le cache des clés et valeurs de l’attention. Ce cache peut devenir important lorsque les séquences s’allongent ou que plusieurs requêtes sont traitées ensemble.
Commencez par une carte dont la mémoire permet votre essai représentatif avec une marge mesurée. Les modèles de 24, 32, 48, 80 Go et au-delà répondent à des besoins différents ; aucune capacité ne garantit qu’un modèle donné passera avec tous ses réglages. Réduire la précision ou quantifier peut changer l’empreinte, mais impose de vérifier le support du logiciel et la qualité des sorties sur vos propres entrées.
Retenez le GPU compatible avec votre chaîne logicielle
Listez le moteur d’inférence, ses opérateurs particuliers et les extensions dont vous dépendez avant de choisir le matériel. Une application PyTorch peut proposer plusieurs chemins d’exécution, alors qu’une extension spécialisée n’en prend en charge qu’un. Vérifiez la chaîne complète sur CUDA pour NVIDIA ou sur ROCm pour AMD, y compris le chargement du modèle et son prétraitement.
Gardez une commande minimale qui traverse le pipeline jusqu’à l’écriture d’un résultat. Ensuite seulement, activez vos optimisations une à une. Chaque changement de précision, de compilation ou de moteur doit conserver un contrôle de qualité comparable. Un chargement réussi démontre que les poids sont lisibles ; il ne démontre pas que tous les chemins de calcul nécessaires fonctionnent.
Réglez le batch selon votre objectif de traitement
Exemple de méthode : constituez trois groupes de textes par longueur, puis traitez chacun avec un batch de 1, de 2 et de 4 entrées. Ces tailles servent de points d’essai, pas de recommandation universelle. Pour chaque combinaison, notez les entrées terminées, le temps total, la mémoire maximale observée et les erreurs. Arrêtez la progression lorsqu’une limite apparaît au lieu de masquer les échecs dans une moyenne.
Pour un service interactif, ajoutez le temps passé dans la file d’attente. Un batch plus grand peut changer le débit et le délai ressenti par une requête ; une seule moyenne ne suffit pas à choisir. Pour un traitement hors ligne, assurez-vous que le regroupement ne mélange pas l’ordre des résultats. Choisissez finalement une configuration qui respecte votre critère de qualité et votre contrainte de délai.
Passez à plusieurs GPU si votre application sait répartir le travail
Si chaque exemplaire du modèle tient sur une carte, vous pouvez organiser plusieurs travailleurs qui consomment des partitions distinctes des entrées. Il faut alors coordonner les identifiants, les reprises et la collecte des sorties. Si le modèle doit être réparti entre cartes, utilisez une stratégie de parallélisme prise en charge par votre moteur et vérifiez ses exigences de communication.
Les lots commandés décrivent la quantité de matériel, pas le batch applicatif ni un espace mémoire fusionné. Pour B200, un lot comprend deux cartes ; pour les autres offres, un lot comprend une carte. Faites apparaître dans votre dossier le nombre de travailleurs prévu, la part d’entrées confiée à chacun et la manière de constater qu’un travail est effectivement terminé.
Choisissez une période qui inclut les contrôles et l’export
Pour une première location de 3 jours, cadrez un objectif limité : installer, valider le pipeline et produire un premier résultat exploitable. Une durée de 7 jours peut servir à parcourir davantage de variantes ; 30 jours à répéter un traitement et consolider son exploitation. Ce sont des façons d’organiser le travail, pas des promesses de délai d’exécution.
À la sortie, conservez les poids ou leur version, la configuration, les contrôles de qualité, les mesures réellement obtenues et les résultats exportés. Vous choisissez vos logiciels et vos traitements en autonomie ; Kernodeck ne procède pas à une inspection de leur contenu. Préparez vous-même vos accès, vos sauvegardes et les autorisations nécessaires à l’utilisation des modèles et des données.