Inferencia: del modelo cargado al servicio útil
Quieres generar respuestas, extraer representaciones o procesar un corpus. Empieza por definir el formato de entrada, su tamaño y la frecuencia de las solicitudes. Una prueba con una entrada corta no describe un servicio que debe aceptar varias solicitudes largas en paralelo.
El recorrido de inferencia te ayuda a preparar un conjunto de solicitudes, una comprobación de disponibilidad y una lectura de los resultados. Después puedes comparar la GPU y los parámetros sin cambiar a la vez la carga que vas a medir. Los resultados esperados son un perfil de solicitudes, un procedimiento de lanzamiento y un conjunto de mediciones conservado junto con su configuración.
Ajuste: organizar un experimento que se pueda retomar
Ajustar un modelo exige relacionar los datos de entrenamiento, el método y los criterios de evaluación. Antes de una ejecución larga, comprueba un paso de cálculo, la escritura de un checkpoint y su relectura. Tendrás una base concreta para elegir la duración del plan y el ritmo de guardado.
El recorrido de ajuste propone una organización por experimento: hipótesis, parámetros, salidas y siguiente decisión. Reserva un conjunto de evaluación para la comparación y conserva los resultados incluso cuando el experimento no dé la mejora esperada. Entender un resultado negativo puede evitar repetir el mismo trabajo.
Varios lotes para trabajos bien separados
Cuando los experimentos son independientes, asigna a cada uno su configuración, sus entradas y su destino de resultados. Define después qué tarea utiliza qué tarjeta. Esta organización conviene, por ejemplo, a una comparación de parámetros o al procesamiento de particiones de un corpus.
Para un solo modelo distribuido, prepara por el contrario el mecanismo de reparto y los intercambios necesarios para el programa. El número de GPU es entonces un elemento de la arquitectura del software. Las fichas de hardware y la guía de entornos te ayudan a acercar esta decisión a tu pedido.