Dimensionar más allá del archivo de pesos
Para un servicio de generación, el tamaño del modelo en disco no describe toda la memoria necesaria. Añade los búferes de trabajo y la caché que se usa durante la generación. Construye un conjunto de solicitudes que incluya tus entradas largas y varios niveles de concurrencia, y luego mide el pico obtenido.
Usa ese margen para elegir un límite de contexto y una cola explícitos. Una solicitud aislada exitosa no basta para fijar la capacidad de un servicio que usan varios clientes.
Mantener una ruta CUDA trazable
Fija en conjunto Python, PyTorch, el motor de inferencia y sus extensiones. Si cambias la precisión o el motor de atención, vuelve a ejecutar los mismos ejemplos y compara también la calidad de las salidas. El H200 aporta capacidad de memoria; no elige por ti los parámetros de generación aceptables.
Archiva el tokenizer, la revisión del modelo y la configuración del servicio junto con tus resultados. Así podrás distinguir un cambio de software de un cambio de hardware.
El motivo correcto para subir de memoria
Si tu carga ya cabe en 80 GB con margen suficiente, compara el plan H100 PCIe antes de decantarte por el H200. Si un solo proceso necesita más de 141 GB, examina el MI300X y la compatibilidad con ROCm, o prepara un reparto multitarjeta sobre B200. Añadir lotes no agranda automáticamente la memoria de un proceso.
Del test de carga al plan
En 3 días, céntrate en una matriz contexto/concurrencia limitada. Una semana permite añadir los errores, los reinicios y las exportaciones; 30 días encajan para una campaña de iteraciones ya organizada. Reserva tiempo para recuperar los resultados y el manifiesto final.
La configuración pide el número de lotes, la preparación y tus datos de contacto. El pago en cripto se ofrece sin KYC ni documento de identidad. Después de la transferencia, indícalo con «He pagado» y luego consulta el estado del pago en tu pedido.