Partir de un paso de entrenamiento completo
Tu primer ensayo debe recorrer la lectura de datos, la pasada hacia delante, el cálculo de los gradientes y la actualización del optimizador. Mide este ciclo completo antes de aumentar el lote. Los pesos son solo una parte de la memoria ocupada: las activaciones y los estados de entrenamiento también deben caber en los 80 GB.
Conserva una secuencia de entradas representativa, incluidos los ejemplos voluminosos. Así evitarás dimensionar toda la campaña a partir de un primer lote especialmente fácil.
Precisión mixta y comparación controlada
PyTorch permite elegir una precisión adecuada para ciertas operaciones con autocast. Prueba este ajuste en tu función de pérdida y tus criterios de validación. Una opción activada no es prueba de estabilidad numérica: conserva una ejecución de comparación, métricas y los parámetros exactos.
Para varias tarjetas, distingue el lote por GPU del lote global. El número de procesos y la acumulación de gradientes forman parte del protocolo, igual que la tasa de aprendizaje.
SXM, PCIe o más memoria
El H100 PCIe mantiene una capacidad de 80 GB y merece compararse para un trabajo esencialmente de una sola tarjeta. Para intercambios frecuentes entre GPU, mide la topología que usa realmente tu aplicación; el nombre SXM no sustituye esa comprobación. Prefiere el H200 si el problema identificado es ante todo la falta de memoria por tarjeta.
Reservar un periodo que incluya la reanudación
Elige 3 días para validar un bucle y un checkpoint, 7 días para una serie de ablación, o 30 días para experimentos continuados. Incluye la evaluación y la exportación en ese calendario, no solo las épocas de entrenamiento.
En el configurador, selecciona la preparación PyTorch o personalizada, tus lotes y tu duración. Crea tu cuenta o inicia sesión antes de guardar el pedido y elegir el pago en cripto. El botón «He pagado» sirve para notificar la transferencia; el seguimiento del pago sigue visible en tu cuenta.