GPU para tus proyectos · pago en cripto sin KYC Cómo alquilar
Español
Abrir la consola
KERNODECK / VOTRE APPLICATION

Elige la GPU de tu aplicación de inferencia.

Embeddings por lotes, clasificación de imágenes o aplicación interactiva: alquila en Kernodeck la GPU adaptada a tu propia inferencia. Empieza con la RTX 4090 de 24 GB a 110,00 USD por un lote de 1 GPU durante 7 días. Elige la capacidad según tu memoria medida y tu cadena CUDA; tú conservas la preparación y la explotación de la aplicación.

  • Procesamientos por lotes o interactivos
  • Tres presupuestos a 7 días
  • Tu motor y tus ajustes
En Kernodeck, ninguna pieza de identidad ni procedimiento KYC en este recorrido de renta de GPU. Cuenta requerida: nombre, apellidos, email y contraseña; esto no significa anonimato. Datos de cuenta ↗
TRES CAPACIDADES · UNA SEMANA

Vincula tu carga a un presupuesto concreto.

El modelo, las entradas, la memoria temporal y la concurrencia orientan la elección. Las versiones y los accesos necesarios para tu aplicación quedan por confirmar.

7 DÍAS · 1 LOTE

NVIDIA L40S 48GB

48 Go por GPU · 1 GPU incluidos

Para examinar una carga interactiva o multimodal con 48 GB por tarjeta.

148,00 USDpor el lote completo y los 7 joursConfigurar este plan ↗

Para tus procesamientos por lotes: partir de la necesidad y luego de la tarifa

¿Quieres producir embeddings para una colección de documentos o clasificar un conjunto de imágenes? La RTX 4090 es una candidata a 110,00 USD por un lote de 1 GPU de 24 GB durante 7 días si tu pipeline CUDA cabe en esa memoria con sus entradas, sus temporales y un margen medido. Esta tarifa encuadra tu presupuesto de hardware; tú fijas el número de archivos, la regla de reanudación y los resultados que conservar.

Si el pico de memoria de tu procesamiento supera esta capacidad, compara la L40S: 148,00 USD para un lote de 1 GPU de 48 GB durante 7 días. Ofrece más espacio por tarjeta para la carga que hayas medido. La elección entre ambas se basa en esa capacidad y en la compatibilidad de tu cadena de software, no en un volumen de documentos prometido.

Para particiones independientes, B200 abre otra organización: 2071,00 USD para un lote de 2 GPU de 180 GB cada una durante 7 días, con ambas tarjetas ya incluidas en ese precio. Compara esta opción cuando tu aplicación sepa repartir los procesamientos entre varios trabajadores. No convierte las dos memorias en un espacio único de 360 GB.

Para una aplicación interactiva: elegir la memoria de tu carga completa

Un asistente o una herramienta interna debe tener en cuenta las solicitudes simultáneas, su longitud y las cachés propias del motor. La L40S a 148,00 USD para un lote de 1 GPU de 48 GB durante 7 días es una candidata si esa carga completa cabe en su memoria y si tu motor admite su cadena CUDA. Tu medición de la cola de espera y de las respuestas sigue siendo el criterio para quedarte con la configuración.

Si necesitas más memoria en una sola tarjeta, compara la H100 SXM: 475,00 USD para un lote de 1 GPU de 80 GB durante 7 días. Añade capacidad por GPU; no basta para garantizar la latencia o el rendimiento de tu aplicación. Si tu necesidad ya cabe en 24 GB, la RTX 4090 sigue siendo una opción a comparar antes de contratar un plan superior.

Esta oferta es un alquiler de GPU para tu aplicación. Una API de inferencia gestionada constituye otra categoría de servicio: puede convenirte si buscas ante todo un punto de llamada operado por otro. En Kernodeck, tú te encargas de tu motor, sus dependencias y su explotación; la preparación y las modalidades de acceso necesarias para tu proyecto quedan por confirmar antes de elegir tu entorno.

TU PAGO

Tu plan, pagable directamente en cripto.

Paga tu alquiler de Kernodeck directamente en cripto, sin recarga obligatoria: BTC en Bitcoin y USDT en Tron (TRC-20), entre otros. El proceso no exige documento de identidad ni procedimiento KYC; se requiere una cuenta con nombre, apellidos, email y contraseña, sin promesa de anonimato.

Comparar los ocho activos y redes aceptados ↗

Las condiciones útiles para tu proyecto

Disponibilidad. Cantidades declaradas por modelo en las ofertas. No reservan una disponibilidad futura ni una fecha de puesta a disposición. País de alojamiento y zona cubierta a confirmar antes de la compra si tu proyecto los exige.

Preparación. Ubuntu, PyTorch, Blender o solicitud personalizada. Versiones, CPU, RAM, almacenamiento, red y modo de acceso a confirmar según el proyecto; su inclusión no se deduce del modelo de GPU.

Precio y condiciones. Importes en USD para el lote y todo el periodo. Estatus fiscal y gastos eventuales a confirmar en las condiciones aplicables.

Leer las condiciones de alquiler ↗
AVANT DE CHOISIR

¿Qué capacidad alquilar para tu inferencia?

¿Qué plan elegir para un primer procesamiento de inferencia?

Si tu pipeline CUDA y un batch representativo caben en 24 GB con un margen medido, empieza la comparación por la RTX 4090: 110,00 USD para un lote de 1 GPU durante 7 días. El plan cubre ese periodo de alquiler, sin fijar el número de archivos que tu aplicación podrá procesar. Ten en cuenta en tu planificación la instalación, el control de las salidas y la exportación; los planes de 3 y 30 días permiten elegir otro periodo.

¿Cuándo pagar más por una L40S o una H100 SXM?

Compara la L40S de 48 GB cuando la carga completa supere el margen disponible en 24 GB, y luego la H100 SXM de 80 GB si buscas más memoria en una sola tarjeta. Los planes de 7 días cuestan respectivamente 148,00 USD y 475,00 USD, cada uno para un lote de 1 GPU. Incluye el modelo, las entradas, los temporales y las cachés en tu medición; una capacidad superior no garantiza por sí sola una mejor respuesta para tu aplicación.

¿El alquiler incluye una API de inferencia lista para llamar?

La oferta presentada aquí es un alquiler de GPU para tu propia aplicación, y no incluye una API de inferencia gestionada anunciada como lista para llamar. Tú eliges el motor, los modelos, las dependencias y los ajustes, y luego organizas su explotación. Si tu prioridad es un servicio gestionado, compara esa categoría de oferta por separado. Para alquilar en Kernodeck, haz que te confirmen la preparación y las modalidades de acceso que requiere tu proyecto.

¿Es B200 la opción lógica para varios procesamientos simultáneos?

Se convierte en una opción a examinar si tu aplicación puede repartir particiones independientes entre varios trabajadores o admite una distribución explícita. A 2071,00 USD durante 7 días, un lote B200 ya incluye 2 GPU de 180 GB cada una. Las memorias no se fusionan automáticamente; un modelo repartido exige una estrategia compatible con tu motor. Compara también el coste de una sola tarjeta si basta para la carga prevista.

PARA PREPARAR TU TRABAJO

Desde la elección del plan hasta tu aplicación.

Verificar las entradas y el tiempo de respuesta

Validar los datos antes de la GPUControlar tipos, formas y valores para aislar las entradas no válidas.Perfilar una etapa de PyTorchDelimitar la medición y leer una traza de CPU/GPU sin sacar conclusiones precipitadas.

Define el entregable que justifica tu alquiler

Para un procesamiento de archivos, define el volumen que hay que recorrer, el formato de salida y la regla de reanudación. Un archivo terminado debe poder reconocerse sin releer toda la ejecución. Para un servicio interactivo, define el tamaño máximo de las solicitudes, el tiempo de espera aceptable y el comportamiento cuando se alcanza la capacidad. Un mismo modelo puede exigir dos organizaciones muy distintas según estas restricciones.

Conserva una muestra representativa con casos cortos, habituales y cercanos a tus límites. En un pipeline de embeddings, asocia cada vector al identificador y a la versión de su entrada. En una generación de texto, registra los parámetros de generación usados para la evaluación. Debes poder explicar una diferencia de resultado sin atribuirla de inmediato a la GPU.

Elige la memoria para toda la carga de inferencia

El peso de los archivos del modelo no describe toda la memoria utilizada durante la inferencia. También hay que considerar los tensores temporales, las entradas, las salidas conservadas y, en los modelos correspondientes, la caché de claves y valores de la atención. Esta caché puede volverse importante cuando las secuencias se alargan o cuando se procesan varias solicitudes a la vez.

Empieza por una tarjeta cuya memoria permita tu prueba representativa con un margen medido. Los modelos de 24, 32, 48, 80 GB y más responden a necesidades distintas; ninguna capacidad garantiza que un modelo dado funcione con todos sus ajustes. Reducir la precisión o cuantificar puede cambiar la huella, pero obliga a verificar el soporte del software y la calidad de las salidas con tus propias entradas.

Quédate con la GPU compatible con tu cadena de software

Enumera el motor de inferencia, sus operadores particulares y las extensiones de las que dependes antes de elegir el hardware. Una aplicación PyTorch puede ofrecer varias rutas de ejecución, mientras que una extensión especializada solo admite una. Verifica la cadena completa en CUDA para NVIDIA o en ROCm para AMD, incluida la carga del modelo y su preprocesamiento.

Mantén un comando mínimo que recorra el pipeline hasta escribir un resultado. Solo después activa tus optimizaciones una a una. Cada cambio de precisión, de compilación o de motor debe conservar un control de calidad comparable. Una carga exitosa demuestra que los pesos son legibles; no demuestra que todas las rutas de cálculo necesarias funcionen.

Ajusta el batch según tu objetivo de procesamiento

Ejemplo de método: forma tres grupos de textos por longitud y procesa cada uno con un batch de 1, de 2 y de 4 entradas. Estos tamaños sirven como puntos de prueba, no como recomendación universal. Para cada combinación, anota las entradas terminadas, el tiempo total, la memoria máxima observada y los errores. Detén la progresión cuando aparezca un límite en lugar de ocultar los fallos en un promedio.

Para un servicio interactivo, añade el tiempo pasado en la cola de espera. Un batch más grande puede cambiar el rendimiento y el tiempo de respuesta percibido por una solicitud; un solo promedio no basta para elegir. Para un procesamiento sin conexión, asegúrate de que la agrupación no altere el orden de los resultados. Elige finalmente una configuración que respete tu criterio de calidad y tu restricción de tiempo.

Pasa a varias GPU si tu aplicación sabe repartir el trabajo

Si cada ejemplar del modelo cabe en una tarjeta, puedes organizar varios trabajadores que consuman particiones distintas de las entradas. Entonces hay que coordinar los identificadores, las reanudaciones y la recogida de las salidas. Si el modelo debe repartirse entre tarjetas, usa una estrategia de paralelismo compatible con tu motor y verifica sus requisitos de comunicación.

Los lotes solicitados describen la cantidad de hardware, no el batch de la aplicación ni un espacio de memoria fusionado. Para B200, un lote comprende dos tarjetas; para las demás ofertas, un lote comprende una tarjeta. Indica en tu expediente el número de trabajadores previsto, la parte de entradas confiada a cada uno y la manera de constatar que un trabajo ha finalizado realmente.

Elige un periodo que incluya las verificaciones y la exportación

Para un primer alquiler de 3 días, plantea un objetivo limitado: instalar, validar el pipeline y producir un primer resultado aprovechable. Una duración de 7 días puede servir para recorrer más variantes; 30 días para repetir un procesamiento y consolidar su explotación. Son formas de organizar el trabajo, no promesas de plazos de ejecución.

A la salida, conserva los pesos o su versión, la configuración, los controles de calidad, las métricas realmente obtenidas y los resultados exportados. Tú eliges tus programas y tus procesamientos con autonomía; Kernodeck no inspecciona su contenido. Prepara tú mismo tus accesos, tus copias de seguridad y las autorizaciones necesarias para el uso de los modelos y los datos.

Leer esta página en Markdown ↗