Legen Sie das Ergebnis fest, das Ihre Miete rechtfertigt
Definieren Sie für eine Dateiverarbeitung das zu durchlaufende Volumen, das Ausgabeformat und die Wiederaufnahmeregel. Eine abgeschlossene Datei muss erkennbar sein, ohne den gesamten Lauf erneut zu lesen. Definieren Sie für einen interaktiven Dienst die maximale Anfragegröße, die akzeptable Latenz und das Verhalten bei erreichter Kapazität. Dasselbe Modell kann je nach diesen Vorgaben zwei sehr unterschiedliche Organisationen erfordern.
Behalten Sie eine repräsentative Stichprobe mit kurzen, gewöhnlichen und nahe an Ihren Grenzen liegenden Fällen. Verknüpfen Sie in einer Embedding-Pipeline jeden Vektor mit der Kennung und der Version seiner Eingabe. Speichern Sie bei einer Textgenerierung die für die Bewertung verwendeten Generierungsparameter. Sie müssen eine Ergebnisabweichung erklären können, ohne sie sofort der GPU zuzuschreiben.
Wählen Sie den Speicher für die gesamte Inferenzlast
Das Gewicht der Modelldateien beschreibt nicht den gesamten während der Inferenz genutzten Speicher. Zu berücksichtigen sind auch temporäre Tensoren, Eingaben, aufbewahrte Ausgaben und, bei den betreffenden Modellen, der Key-Value-Cache der Attention. Dieser Cache kann erheblich werden, wenn die Sequenzen länger werden oder mehrere Anfragen gemeinsam verarbeitet werden.
Beginnen Sie mit einer Karte, deren Speicher Ihren repräsentativen Test mit einer gemessenen Reserve ermöglicht. Modelle mit 24, 32, 48, 80 GB und darüber hinaus decken unterschiedliche Anforderungen ab; keine Kapazität garantiert, dass ein bestimmtes Modell mit allen seinen Einstellungen läuft. Das Reduzieren der Präzision oder Quantisieren kann den Speicherbedarf ändern, erfordert aber die Prüfung der Softwareunterstützung und der Ausgabequalität mit Ihren eigenen Eingaben.
Wählen Sie die mit Ihrer Softwarekette kompatible GPU
Listen Sie die Inferenz-Engine, ihre besonderen Operatoren und die Erweiterungen, auf die Sie angewiesen sind, auf, bevor Sie die Hardware wählen. Eine PyTorch-Anwendung kann mehrere Ausführungspfade anbieten, während eine spezialisierte Erweiterung nur einen unterstützt. Prüfen Sie die vollständige Kette auf CUDA für NVIDIA oder auf ROCm für AMD, einschließlich des Ladens des Modells und seiner Vorverarbeitung.
Behalten Sie einen minimalen Befehl, der die Pipeline bis zum Schreiben eines Ergebnisses durchläuft. Erst danach aktivieren Sie Ihre Optimierungen eine nach der anderen. Jede Änderung an Präzision, Kompilierung oder Engine muss eine vergleichbare Qualitätskontrolle beibehalten. Ein erfolgreiches Laden belegt, dass die Gewichte lesbar sind; es belegt nicht, dass alle erforderlichen Berechnungspfade funktionieren.
Stellen Sie den Batch passend zu Ihrem Verarbeitungsziel ein
Beispielmethode: Bilden Sie drei Textgruppen nach Länge und verarbeiten Sie jede mit einem Batch von 1, 2 und 4 Eingaben. Diese Größen dienen als Testpunkte, nicht als allgemeine Empfehlung. Notieren Sie für jede Kombination die abgeschlossenen Eingaben, die Gesamtzeit, den beobachteten Spitzenspeicher und die Fehler. Brechen Sie den Fortschritt ab, wenn eine Grenze auftritt, statt Fehlschläge in einem Mittelwert zu verbergen.
Fügen Sie bei einem interaktiven Dienst die in der Warteschlange verbrachte Zeit hinzu. Ein größerer Batch kann den Durchsatz und die von einer Anfrage wahrgenommene Latenz verändern; ein einzelner Mittelwert reicht für die Wahl nicht aus. Stellen Sie bei einer Offline-Verarbeitung sicher, dass die Gruppierung die Reihenfolge der Ergebnisse nicht vermischt. Wählen Sie schließlich eine Konfiguration, die Ihr Qualitätskriterium und Ihre Latenzvorgabe einhält.
Wechseln Sie zu mehreren GPUs, wenn Ihre Anwendung die Arbeit aufteilen kann
Wenn jede Instanz des Modells auf eine Karte passt, können Sie mehrere Worker organisieren, die getrennte Partitionen der Eingaben verarbeiten. Dann müssen Kennungen, Wiederaufnahmen und das Einsammeln der Ausgaben koordiniert werden. Muss das Modell auf Karten aufgeteilt werden, verwenden Sie eine von Ihrer Engine unterstützte Parallelisierungsstrategie und prüfen Sie deren Kommunikationsanforderungen.
Die bestellten Lose beschreiben die Menge an Hardware, nicht den Anwendungs-Batch oder einen zusammengeführten Speicherbereich. Bei B200 umfasst ein Los zwei Karten; bei den anderen Angeboten umfasst ein Los eine Karte. Führen Sie in Ihrer Unterlage die geplante Anzahl an Workern auf, den Anteil der Eingaben, der jedem zugewiesen wird, und wie festgestellt wird, dass eine Arbeit tatsächlich abgeschlossen ist.
Wählen Sie einen Zeitraum, der die Kontrollen und den Export einschließt
Für eine erste Miete von 3 Tagen stecken Sie ein begrenztes Ziel ab: installieren, die Pipeline validieren und ein erstes nutzbares Ergebnis erzeugen. Eine Dauer von 7 Tagen kann dazu dienen, mehr Varianten durchzugehen; 30 Tage, um eine Verarbeitung zu wiederholen und ihren Betrieb zu festigen. Das sind Arten, die Arbeit zu organisieren, keine Zusagen zur Ausführungsdauer.
Bewahren Sie am Ende die Gewichte oder deren Version, die Konfiguration, die Qualitätskontrollen, die tatsächlich erzielten Messwerte und die exportierten Ergebnisse auf. Sie wählen Ihre Software und Ihre Verarbeitungen eigenständig; Kernodeck nimmt keine Prüfung von deren Inhalt vor. Bereiten Sie Ihre Zugänge, Ihre Sicherungen und die für die Nutzung der Modelle und Daten erforderlichen Berechtigungen selbst vor.