Dos tarjetas, un plan de reparto explícito
Empieza por elegir entre dos estrategias: una copia del modelo en cada tarjeta para procesar datos diferentes, o un modelo realmente repartido entre las GPU. El paralelismo de datos de PyTorch no convierte, por sí solo, dos memorias en una única reserva utilizable por un modelo demasiado voluminoso.
Los 180 GB pertenecen a cada B200. Para explotarlos juntos, documenta el fraccionamiento del modelo, los intercambios entre procesos y el guardado de las particiones. Una prueba corta de comunicación y de restauración debe preceder a la campaña completa.
Verificar Blackwell antes de optimizar
Prepara una distribución de PyTorch y extensiones compiladas compatibles con B200. Una biblioteca de Python importada sin errores puede fallar aún en el primer núcleo CUDA: por eso, prueba la carga, una pasada hacia delante, el cálculo de gradientes y la escritura de un checkpoint. Conserva las versiones que ejecutaron este recorrido.
Separa después la compilación inicial y el cálculo estabilizado en tus mediciones. Esta distinción ayuda a decidir si una optimización merece conservarse para tu propia carga.
Cuándo elegir H200 o MI300X
Si todo tu procesamiento cabe en una sola tarjeta y no utiliza la segunda GPU, examina el H200 SXM de 141 GB. Si tu prioridad es una gran memoria por tarjeta con un entorno ROCm controlado, el MI300X de 192 GB constituye otra opción. La elección depende primero del software y del plan de cálculo.
Planificar el lote y sus entregables
Prevén 3 días para validar el lanzamiento distribuido, 7 días para comparar varios ajustes y 30 días para una campaña acompañada de checkpoints regulares. Cada lote pedido contiene dos B200; verifica el total de tarjetas en el resumen.
Selecciona la duración, los lotes y la preparación, y luego rellena nombre, apellidos y email. Elige tu cripto y su red; tras la transferencia, «He pagado» registra tu notificación. Guarda la referencia del pedido junto con el manifiesto de las ejecuciones.