Dimensionner au-delà du fichier de poids
Pour un service de génération, la taille du modèle sur disque ne décrit pas toute la mémoire nécessaire. Ajoutez les buffers de travail et le cache utilisé pendant la génération. Construisez un jeu de requêtes qui comprend vos entrées longues et plusieurs niveaux de concurrence, puis mesurez le pic obtenu.
Utilisez cette marge pour choisir une limite de contexte et une file d’attente explicites. Une requête isolée réussie ne suffit pas à fixer la capacité d’un service utilisé par plusieurs clients.
Garder un chemin CUDA traçable
Figez ensemble Python, PyTorch, le moteur d’inférence et ses extensions. Si vous changez la précision ou le moteur d’attention, rejouez les mêmes exemples et comparez aussi la qualité des sorties. Le H200 apporte de la capacité mémoire ; il ne choisit pas à votre place les paramètres de génération acceptables.
Archivez le tokenizer, la révision du modèle et la configuration de service avec vos résultats. Vous pourrez alors distinguer un changement logiciel d’un changement de matériel.
Le bon motif pour monter en mémoire
Si votre charge tient déjà sur 80 Go avec une marge suffisante, comparez le forfait H100 PCIe avant de retenir le H200. Si un seul processus a besoin de davantage que 141 Go, examinez le MI300X et la compatibilité ROCm, ou préparez un découpage multicarte sur B200. Ajouter des lots n’agrandit pas automatiquement la mémoire d’un processus.
Du test de charge au forfait
Sur 3 jours, concentrez-vous sur une matrice contexte/concurrence limitée. Une semaine permet d’ajouter les erreurs, les redémarrages et les exports ; 30 jours conviennent à une campagne d’itérations déjà organisée. Réservez du temps pour récupérer les résultats et le manifeste final.
La configuration demande le nombre de lots, la préparation et vos coordonnées. Le règlement crypto est proposé sans KYC ni pièce d’identité. Après le transfert, signalez-le avec « J’ai payé », puis retrouvez le statut du règlement dans votre commande.