Definir una petición representativa
Un servicio de embeddings, de clasificación o de transcripción no tienen las mismas entradas. Fija la longitud de los documentos, las dimensiones de imagen o la duración de audio, y luego constituye un pequeño conjunto que cubra su diversidad. Para cada caso, define una salida esperada y la forma de señalar un error.
Mide la carga del modelo por separado. El tiempo de una primera llamada y el de un proceso ya listo responden a dos preguntas distintas para el usuario de tu aplicación.
Repartir los 24 GB entre las peticiones
Empieza con una petición y luego aumenta la concurrencia manteniendo las mismas entradas. Vigila la memoria y la cola: aceptar más llamadas a la vez no significa que vayan a terminar antes. Fija un límite y un comportamiento claro cuando se alcance.
Valida el entorno CUDA, PyTorch y las bibliotecas de preparación de medios si tu servicio las usa. Las funciones de vídeo de la L4 solo se emplean si tu software activa la ruta compatible; la presencia del hardware no modifica automáticamente un script Python.
Cuándo elegir otra capacidad
Si tus casos difíciles no caben en 24 GB, el L40S abre una opción de 48 GB dentro de la misma familia Ada. Para un prototipo centrado en el cálculo del modelo, compara también la RTX 4090. Si necesitas estudiar 80 GB en un solo dominio de memoria, pasa a la A100 en lugar de multiplicar los lotes L4 sin una estrategia de software.
Construir una prueba que termine limpiamente
En 3 días, cualifica la carga y las consultas. En 7 días, añade concurrencia, entradas inválidas y reinicio. Un plan de 30 días puede servir para una campaña de iteraciones con informes diarios que conservas.
El pedido solicita modelo, lotes, duración y preparación, y luego la creación de una cuenta o el inicio de sesión. Después eliges el activo y la red cripto, sin procedimiento KYC ni documento de identidad. Tras tu transferencia, «J'ai payé» registra el aviso. Encontrarás el expediente y su liquidación desde tu cuenta de Kernodeck.