Retomar un proyecto con sus parámetros
Un entorno conocido reduce las incógnitas de un nuevo experimento. Trae la versión del código, el archivo de dependencias, los parámetros y un pequeño conjunto de evaluación. Prueba primero la recarga del modelo y el formato de los datos antes de modificar el batch o el optimizador.
La reproducibilidad se construye a nivel de proyecto. Una misma semilla no garantiza resultados idénticos tras un cambio de versión de PyTorch, de hardware o de algoritmo; por eso conviene conservar las condiciones y las diferencias observadas.
Usar los 80 GB para la etapa correcta
Mide la memoria en el momento de mayor carga del bucle, no solo después de importar el modelo. Un entrenamiento conserva más estado que una simple inferencia. La acumulación de gradientes puede servir para trabajar con micro-lotes más pequeños, pero no elimina los pesos ni el estado del optimizador.
La A100 admite varios formatos de cálculo, entre ellos BF16. Elige la precisión en función de las operaciones y de la calidad esperada, y luego mantén las mismas reglas para comparar dos experimentos.
Una alternativa debe responder al diagnóstico
Si los 80 GB bastan pero quieres estudiar Hopper, compara la H100 SXM con exactamente el mismo protocolo. Si tus asignaciones ya se desbordan, examina más bien la H200 de 141 GB. Por el contrario, un proyecto que se mantiene muy por debajo de 48 GB puede justificar una prueba en RTX A6000 antes de asignar más capacidad.
Reservar y conservar la reanudación
Tres días bastan para reproducir un resultado concreto; 7 días dejan espacio a varias variantes; 30 días permiten organizar una serie más larga con puntos de reanudación. Asocia cada checkpoint a su etapa y prueba su carga antes del vencimiento.
El alquiler se prepara eligiendo la A100, los lotes, la duración y el entorno, y luego tus datos de contacto. Tras elegir la cripto y hacer la transferencia, usa «He pagado». Conserva el número de pedido en el registro del experimento para vincular hardware, periodo y resultados.