[Referenzseite](<https://kernodeck.com/de/usages/inference>)

# Wählen Sie die GPU für Ihre Inferenzanwendung.

Batch-Embeddings, Bildklassifizierung oder interaktive Anwendung: Mieten Sie bei Kernodeck die GPU, die zu Ihrer eigenen Inferenz passt. Beginnen Sie mit der RTX 4090 mit 24 GB für 110,00 USD für ein Los von 1 GPU über 7 Tage. Wählen Sie die Kapazität nach Ihrem gemessenen Speicherbedarf und Ihrer CUDA-Kette; die Vorbereitung und den Betrieb der Anwendung behalten Sie selbst.

- Batch- oder interaktive Verarbeitung
- Drei Budgets über 7 Tage
- Ihre Engine und Ihre Einstellungen

[Eine RTX 4090 wählen · 7 Tage](<https://kernodeck.com/de/compute/configure?config=rtx-4090&days=7>)

Bei Kernodeck gibt es in diesem GPU-Mietablauf weder einen Ausweis noch ein KYC-Verfahren. Erforderliches Konto: Vorname, Nachname, E-Mail und Passwort; das bedeutet keine Anonymität.

Miete für Inferenz

Ein Tarif für Ihre Anwendung, eine nach ihrer Last gewählte Kapazität: Vergleichen Sie 24, 48 und 80 GB, bevor Sie mieten.

## Wichtige Fakten

| Fakt | Detail |
| --- | --- |
| Zeitraum und Einheit | Paket für 3, 7 oder 30 Tage für ein Los. Ein Los enthält 1 GPU, außer B200: 2 GPU, bereits im Preis enthalten. |
| Verfügbarkeit | Deklarierte Mengen pro Modell in den Angeboten. Sie reservieren weder eine künftige Verfügbarkeit noch ein Bereitstellungsdatum. Hosting-Land und bedientes Gebiet sind vor dem Kauf zu bestätigen, falls Ihr Projekt darauf angewiesen ist. |
| Ohne KYC | Bei Kernodeck gibt es in diesem GPU-Mietablauf weder einen Ausweis noch ein KYC-Verfahren. Erforderliches Konto: Vorname, Nachname, E-Mail und Passwort; das bedeutet keine Anonymität. |
| Vorbereitung | Ubuntu, PyTorch, Blender oder eine individuelle Anfrage. Versionen, CPU, RAM, Speicher, Netzwerk und Zugriffsart sind je nach Projekt zu bestätigen; ihre Einbeziehung ergibt sich nicht aus dem GPU-Modell. |
| Preis und Bedingungen | USD-Beträge für das Los und den gesamten Zeitraum. Steuerstatus und eventuelle Gebühren sind in den geltenden Bedingungen zu bestätigen. |

## Verfügbare Pakete

Gesamtpreis in USD für ein Los und den gesamten Zeitraum. Der Speicher wird pro GPU angegeben; der deklarierte Bestand wird in Losen ausgedrückt.

| Modell | Speicher pro GPU | GPU pro Los | Dauer | Lose | Gesamtpreis | Deklarierter Bestand in Losen | Situation | Konfiguration |
| --- | --- | --- | --- | --- | --- | --- | --- | --- |
| [NVIDIA GeForce RTX 4090 24GB](<https://kernodeck.com/de/compute/rtx-4090>) | 24 Go | 1 | 7 Tage | 1 | 110,00 USD | 265 | Für eine Batch-Verarbeitung, deren Last in 24 GB pro Karte passt. | [Dieses Paket konfigurieren](<https://kernodeck.com/de/compute/configure?config=rtx-4090&days=7>) |
| [NVIDIA L40S 48GB](<https://kernodeck.com/de/compute/l40s>) | 48 Go | 1 | 7 Tage | 1 | 148,00 USD | 74 | Für die Untersuchung einer interaktiven oder multimodalen Last mit 48 GB pro Karte. | [Dieses Paket konfigurieren](<https://kernodeck.com/de/compute/configure?config=l40s&days=7>) |
| [NVIDIA H100 SXM 80GB](<https://kernodeck.com/de/compute/h100-sxm>) | 80 Go | 1 | 7 Tage | 1 | 475,00 USD | 63 | Für einen Speicherbedarf über 48 GB hinaus, mit einem qualifizierten CUDA-Stack. | [Dieses Paket konfigurieren](<https://kernodeck.com/de/compute/configure?config=h100-sxm&days=7>) |
| [NVIDIA B200 SXM](<https://kernodeck.com/de/compute/b200>) | 180 Go | 2 | 7 Tage | 1 | 2.071,00 USD | 4 | Zwei GPUs mit je 180 GB für eine Anwendung, die deren Nutzung organisiert. | [Dieses Paket konfigurieren](<https://kernodeck.com/de/compute/configure?config=b200&days=7>) |

## Für Ihre Batch-Verarbeitung: vom Bedarf zum Tarif

Sie möchten Embeddings für eine Dokumentsammlung erzeugen oder eine Bildmenge klassifizieren? Die RTX 4090 ist ein Kandidat für 110,00 USD für ein Los von 1 GPU mit 24 GB über 7 Tage, wenn Ihre CUDA-Pipeline mit ihren Eingaben, ihren temporären Daten und einer gemessenen Reserve in diesen Speicher passt. Dieser Tarif rahmt Ihr Hardware-Budget ein; Sie legen die Anzahl der Dateien, die Wiederaufnahmeregel und die aufzubewahrenden Ergebnisse fest.

Wenn der Speicherbedarf Ihrer Verarbeitung diese Kapazität übersteigt, vergleichen Sie die L40S: 148,00 USD für ein Paket mit 1 GPU mit 48 GB für 7 Tage. Sie bietet mehr Platz pro Karte für die von Ihnen gemessene Last. Die Wahl zwischen beiden hängt von dieser Kapazität und der Kompatibilität Ihrer Softwarekette ab, nicht von einem versprochenen Dokumentvolumen.

Für unabhängige Partitionen eröffnet die B200 eine andere Organisation: 2.071,00 USD für ein Paket mit 2 GPUs mit je 180 GB für 7 Tage, wobei beide Karten bereits in diesem Preis enthalten sind. Vergleichen Sie diese Option, wenn Ihre Anwendung die Verarbeitung auf mehrere Worker verteilen kann. Sie verwandelt die beiden Speicher nicht in einen einzigen gemeinsamen Speicher von 360 GB.

- [7 Tage auf RTX 4090 wählen — 110,00 USD](<https://kernodeck.com/de/compute/configure?config=rtx-4090&days=7>)
- [7 Tage auf L40S wählen — 148,00 USD](<https://kernodeck.com/de/compute/configure?config=l40s&days=7>)
- [B200-Paket für verteilte Verarbeitung prüfen](<https://kernodeck.com/de/compute/b200>)

## Für eine interaktive Anwendung: den Speicher Ihrer vollständigen Last wählen

Ein Assistent oder ein internes Tool muss gleichzeitige Anfragen, deren Länge und die enginespezifischen Caches berücksichtigen. Die L40S zu 148,00 USD für ein Paket mit 1 GPU mit 48 GB für 7 Tage ist ein Kandidat, wenn diese vollständige Last in ihren Speicher passt und Ihre Engine ihre CUDA-Kette unterstützt. Ihre Messung der Warteschlange und der Antworten bleibt das Kriterium für die Wahl der Konfiguration.

Wenn Sie mehr Speicher auf einer einzigen Karte benötigen, vergleichen Sie die H100 SXM: 475,00 USD für ein Paket mit 1 GPU mit 80 GB für 7 Tage. Sie fügt Kapazität pro GPU hinzu; sie allein garantiert jedoch nicht die Latenz oder den Durchsatz Ihrer Anwendung. Wenn Ihr Bedarf bereits in 24 GB passt, bleibt die RTX 4090 zum Vergleich, bevor Sie ein höheres Paket abschließen.

Dieses Angebot ist eine GPU-Miete für Ihre Anwendung. Eine verwaltete Inferenz-API ist eine andere Dienstleistungskategorie: Sie kann passen, wenn Sie in erster Linie einen für Sie betriebenen Aufrufendpunkt suchen. Bei Kernodeck planen Sie Ihre Engine, ihre Abhängigkeiten und ihren Betrieb ein; die Vorbereitung und die für Ihr Projekt erforderlichen Zugangsmodalitäten sind vor der Wahl Ihrer Umgebung noch zu bestätigen.

- [7 Tage auf H100 SXM wählen — 475,00 USD](<https://kernodeck.com/de/compute/configure?config=h100-sxm&days=7>)
- [L40S und ihre Pakete vergleichen](<https://kernodeck.com/de/compute/l40s>)
- [Zurück zu 24 GB mit der RTX 4090](<https://kernodeck.com/de/compute/rtx-4090>)
- [Die Softwarekette Ihrer Anwendung vorbereiten](<https://kernodeck.com/de/docs/environnements-reproductibles>)
- [Die Pakete für 3, 7 und 30 Tage vergleichen](<https://kernodeck.com/de/pricing>)

## Ihr Paket, direkt in Krypto zahlbar.

Bezahlen Sie Ihre Kernodeck-Miete direkt in Krypto, ohne vorgeschriebenes Aufladen: BTC auf Bitcoin und USDT auf Tron (TRC-20), unter anderem. Der Ablauf verlangt weder Ausweis noch KYC-Verfahren; erforderlich sind ein Konto mit Vorname, Nachname, E-Mail und Passwort, ohne Anonymitätsversprechen.

- [Die acht akzeptierten Assets und Netzwerke vergleichen](<https://kernodeck.com/de/docs/crypto-payments>)

## Legen Sie das Ergebnis fest, das Ihre Miete rechtfertigt

Definieren Sie für eine Dateiverarbeitung das zu durchlaufende Volumen, das Ausgabeformat und die Wiederaufnahmeregel. Eine abgeschlossene Datei muss erkennbar sein, ohne den gesamten Lauf erneut zu lesen. Definieren Sie für einen interaktiven Dienst die maximale Anfragegröße, die akzeptable Latenz und das Verhalten bei erreichter Kapazität. Dasselbe Modell kann je nach diesen Vorgaben zwei sehr unterschiedliche Organisationen erfordern.

Behalten Sie eine repräsentative Stichprobe mit kurzen, gewöhnlichen und nahe an Ihren Grenzen liegenden Fällen. Verknüpfen Sie in einer Embedding-Pipeline jeden Vektor mit der Kennung und der Version seiner Eingabe. Speichern Sie bei einer Textgenerierung die für die Bewertung verwendeten Generierungsparameter. Sie müssen eine Ergebnisabweichung erklären können, ohne sie sofort der GPU zuzuschreiben.

## Wählen Sie den Speicher für die gesamte Inferenzlast

Das Gewicht der Modelldateien beschreibt nicht den gesamten während der Inferenz genutzten Speicher. Zu berücksichtigen sind auch temporäre Tensoren, Eingaben, aufbewahrte Ausgaben und, bei den betreffenden Modellen, der Key-Value-Cache der Attention. Dieser Cache kann erheblich werden, wenn die Sequenzen länger werden oder mehrere Anfragen gemeinsam verarbeitet werden.

Beginnen Sie mit einer Karte, deren Speicher Ihren repräsentativen Test mit einer gemessenen Reserve ermöglicht. Modelle mit 24, 32, 48, 80 GB und darüber hinaus decken unterschiedliche Anforderungen ab; keine Kapazität garantiert, dass ein bestimmtes Modell mit allen seinen Einstellungen läuft. Das Reduzieren der Präzision oder Quantisieren kann den Speicherbedarf ändern, erfordert aber die Prüfung der Softwareunterstützung und der Ausgabequalität mit Ihren eigenen Eingaben.

- [Die Speicherkapazitäten des Katalogs vergleichen](<https://kernodeck.com/de/compute>)
- [Die Phase identifizieren, die den Speicher verbraucht](<https://kernodeck.com/de/docs/observer-un-lancement>)

## Wählen Sie die mit Ihrer Softwarekette kompatible GPU

Listen Sie die Inferenz-Engine, ihre besonderen Operatoren und die Erweiterungen, auf die Sie angewiesen sind, auf, bevor Sie die Hardware wählen. Eine PyTorch-Anwendung kann mehrere Ausführungspfade anbieten, während eine spezialisierte Erweiterung nur einen unterstützt. Prüfen Sie die vollständige Kette auf CUDA für NVIDIA oder auf ROCm für AMD, einschließlich des Ladens des Modells und seiner Vorverarbeitung.

Behalten Sie einen minimalen Befehl, der die Pipeline bis zum Schreiben eines Ergebnisses durchläuft. Erst danach aktivieren Sie Ihre Optimierungen eine nach der anderen. Jede Änderung an Präzision, Kompilierung oder Engine muss eine vergleichbare Qualitätskontrolle beibehalten. Ein erfolgreiches Laden belegt, dass die Gewichte lesbar sind; es belegt nicht, dass alle erforderlichen Berechnungspfade funktionieren.

## Stellen Sie den Batch passend zu Ihrem Verarbeitungsziel ein

Beispielmethode: Bilden Sie drei Textgruppen nach Länge und verarbeiten Sie jede mit einem Batch von 1, 2 und 4 Eingaben. Diese Größen dienen als Testpunkte, nicht als allgemeine Empfehlung. Notieren Sie für jede Kombination die abgeschlossenen Eingaben, die Gesamtzeit, den beobachteten Spitzenspeicher und die Fehler. Brechen Sie den Fortschritt ab, wenn eine Grenze auftritt, statt Fehlschläge in einem Mittelwert zu verbergen.

Fügen Sie bei einem interaktiven Dienst die in der Warteschlange verbrachte Zeit hinzu. Ein größerer Batch kann den Durchsatz und die von einer Anfrage wahrgenommene Latenz verändern; ein einzelner Mittelwert reicht für die Wahl nicht aus. Stellen Sie bei einer Offline-Verarbeitung sicher, dass die Gruppierung die Reihenfolge der Ergebnisse nicht vermischt. Wählen Sie schließlich eine Konfiguration, die Ihr Qualitätskriterium und Ihre Latenzvorgabe einhält.

## Wechseln Sie zu mehreren GPUs, wenn Ihre Anwendung die Arbeit aufteilen kann

Wenn jede Instanz des Modells auf eine Karte passt, können Sie mehrere Worker organisieren, die getrennte Partitionen der Eingaben verarbeiten. Dann müssen Kennungen, Wiederaufnahmen und das Einsammeln der Ausgaben koordiniert werden. Muss das Modell auf Karten aufgeteilt werden, verwenden Sie eine von Ihrer Engine unterstützte Parallelisierungsstrategie und prüfen Sie deren Kommunikationsanforderungen.

Die bestellten Lose beschreiben die Menge an Hardware, nicht den Anwendungs-Batch oder einen zusammengeführten Speicherbereich. Bei B200 umfasst ein Los zwei Karten; bei den anderen Angeboten umfasst ein Los eine Karte. Führen Sie in Ihrer Unterlage die geplante Anzahl an Workern auf, den Anteil der Eingaben, der jedem zugewiesen wird, und wie festgestellt wird, dass eine Arbeit tatsächlich abgeschlossen ist.

## Wählen Sie einen Zeitraum, der die Kontrollen und den Export einschließt

Für eine erste Miete von 3 Tagen stecken Sie ein begrenztes Ziel ab: installieren, die Pipeline validieren und ein erstes nutzbares Ergebnis erzeugen. Eine Dauer von 7 Tagen kann dazu dienen, mehr Varianten durchzugehen; 30 Tage, um eine Verarbeitung zu wiederholen und ihren Betrieb zu festigen. Das sind Arten, die Arbeit zu organisieren, keine Zusagen zur Ausführungsdauer.

Bewahren Sie am Ende die Gewichte oder deren Version, die Konfiguration, die Qualitätskontrollen, die tatsächlich erzielten Messwerte und die exportierten Ergebnisse auf. Sie wählen Ihre Software und Ihre Verarbeitungen eigenständig; Kernodeck nimmt keine Prüfung von deren Inhalt vor. Bereiten Sie Ihre Zugänge, Ihre Sicherungen und die für die Nutzung der Modelle und Daten erforderlichen Berechtigungen selbst vor.

## Fragen vor dem Kauf

### Welches Paket für eine erste Inferenzverarbeitung wählen?

Wenn Ihre CUDA-Pipeline und ein repräsentativer Batch mit gemessener Reserve in 24 GB passen, beginnen Sie den Vergleich mit der RTX 4090: 110,00 USD für ein Paket mit 1 GPU für 7 Tage. Das Paket deckt diesen Mietzeitraum ab, ohne die Anzahl der Dateien festzulegen, die Ihre Anwendung verarbeiten kann. Planen Sie Installation, Prüfung der Ausgaben und Export ein; die Pakete für 3 und 30 Tage ermöglichen die Wahl eines anderen Zeitraums.

### Wann mehr für eine L40S oder eine H100 SXM zahlen?

Vergleichen Sie die L40S mit 48 GB, wenn die vollständige Last die auf 24 GB verfügbare Reserve übersteigt, und dann die H100 SXM mit 80 GB, wenn Sie mehr Speicher auf einer einzigen Karte suchen. Die 7-Tage-Pakete kosten jeweils 148,00 USD und 475,00 USD, jedes für ein Paket mit 1 GPU. Beziehen Sie Modell, Eingaben, temporäre Dateien und Caches in Ihre Messung ein; eine höhere Kapazität allein garantiert keine bessere Antwort für Ihre Anwendung.

### Umfasst die Miete eine aufrufbereite Inferenz-API?

Das hier vorgestellte Angebot ist eine GPU-Miete für Ihre eigene Anwendung und umfasst keine als aufrufbereit angekündigte verwaltete Inferenz-API. Sie wählen die Engine, die Modelle, die Abhängigkeiten und die Einstellungen und organisieren anschließend deren Betrieb. Wenn Ihre Priorität ein verwalteter Dienst ist, vergleichen Sie diese Angebotskategorie separat. Für eine Miete bei Kernodeck lassen Sie die Vorbereitung und die von Ihrem Projekt benötigten Zugangsmodalitäten bestätigen.

### Ist die B200 die logische Wahl für mehrere gleichzeitige Verarbeitungen?

Sie wird zu einer zu prüfenden Option, wenn Ihre Anwendung unabhängige Partitionen an mehrere Worker vergeben kann oder eine explizite Aufteilung unterstützt. Zu 2.071,00 USD für 7 Tage umfasst ein B200-Paket bereits 2 GPUs mit je 180 GB. Die Speicher werden nicht automatisch zusammengeführt; ein verteiltes Modell erfordert eine mit Ihrer Engine kompatible Strategie. Vergleichen Sie auch die Kosten einer einzigen Karte, wenn diese für die geplante Last ausreicht.

## Auswählen und konfigurieren

- [Eine reproduzierbare Inferenzumgebung vorbereiten](<https://kernodeck.com/de/docs/environnements-reproductibles>)
- [Eine NVIDIA-Option mit 48 GB prüfen](<https://kernodeck.com/de/compute/l40s>)
- [Eine AMD-Option für eine ROCm-Kette prüfen](<https://kernodeck.com/de/compute/mi300x>)
- [Eine Dauer von 3, 7 oder 30 Tagen wählen](<https://kernodeck.com/de/pricing>)
- [Die acht akzeptierten Krypto-Paare](<https://kernodeck.com/de/docs/crypto-payments>)
- [Eine Kapazität für die Inferenz wählen](<https://kernodeck.com/de/usages/inference>)
