GPU do Twoich projektów · płatność krypto bez KYC Jak wynająć
Polski
Otwórz konsolę
KERNODECK / VOTRE APPLICATION

Wybierz GPU dla swojej aplikacji inferencyjnej.

Embeddingi wsadowe, klasyfikacja obrazów czy aplikacja interaktywna: wynajmij w Kernodeck GPU dopasowany do własnej inferencji. Zacznij od RTX 4090 24 GB za 110,00 USD za partię 1 GPU na 7 dni. Wybierz pojemność na podstawie zmierzonej pamięci i swojego łańcucha CUDA; przygotowanie i eksploatacja aplikacji pozostają po Twojej stronie.

  • Przetwarzanie wsadowe lub interaktywne
  • Trzy budżety na 7 dni
  • Twój silnik i Twoje ustawienia
W Kernodeck żadnego dokumentu tożsamości ani procedury KYC na tej ścieżce wynajmu GPU. Wymagane konto: imię, nazwisko, email i hasło; nie oznacza to anonimowości. Dane konta ↗
TRZY MOŻLIWOŚCI · JEDEN TYDZIEŃ

Powiąż swoje obciążenie z konkretnym budżetem.

Model, dane wejściowe, pamięć tymczasowa i współbieżność kierują wyborem. Wersje i dostępy niezbędne dla Twojej aplikacji pozostają do potwierdzenia.

7 DNI · 1 PARTIA

NVIDIA L40S 48GB

48 Go za GPU · 1 GPU wliczone

Do sprawdzenia obciążenia interaktywnego lub multimodalnego z 48 GB na kartę.

148,00 USDza całą partię i jej 7 joursSkonfiguruj ten plan ↗

Do przetwarzania wsadowego: zacznij od potrzeby, potem od abonamentu

Chcesz tworzyć embeddingi dla kolekcji dokumentów lub klasyfikować zestaw obrazów? RTX 4090 jest kandydatem za 110,00 USD za partię 1 GPU 24 GB na 7 dni, jeśli Twój pipeline CUDA mieści się w tej pamięci wraz z danymi wejściowymi, danymi tymczasowymi i zmierzonym marginesem. Ten abonament określa budżet sprzętowy; Ty ustalasz liczbę plików, regułę wznowienia i wyniki do zachowania.

Jeśli szczytowe zużycie pamięci przez Twój proces przekracza tę pojemność, porównaj L40S: 148,00 USD za partię 1 GPU 48 GB na 7 dni. Daje ona więcej miejsca na kartę dla zmierzonego przez Ciebie obciążenia. Wybór między nimi dotyczy tej pojemności i zgodności Twojego łańcucha oprogramowania, a nie obiecywanego wolumenu dokumentów.

W przypadku niezależnych partycji B200 otwiera inną organizację: 2071,00 USD za partię 2 GPU po 180 GB każdy na 7 dni, przy czym obie karty są już uwzględnione w tej cenie. Porównaj tę opcję, gdy Twoja aplikacja potrafi rozdzielać przetwarzanie między wielu wykonawców. Nie zamienia ona obu pamięci w jedną wspólną przestrzeń 360 GB.

Dla aplikacji interaktywnej: wybierz pamięć dla całego swojego obciążenia

Asystent lub narzędzie wewnętrzne musi uwzględniać równoczesne żądania, ich długość oraz pamięci podręczne właściwe dla silnika. L40S za 148,00 USD dla partii 1 GPU 48 GB na 7 dni jest kandydatem, jeśli to pełne obciążenie mieści się w jej pamięci i jeśli Twój silnik obsługuje jej łańcuch CUDA. Twoje pomiary kolejki i odpowiedzi pozostają kryterium wyboru konfiguracji.

Jeśli potrzebujesz więcej pamięci na jednej karcie, porównaj H100 SXM: 475,00 USD za partię 1 GPU 80 GB na 7 dni. Dodaje ona pojemność na GPU; nie wystarcza, aby zagwarantować opóźnienie lub przepustowość Twojej aplikacji. Jeśli Twoje potrzeby mieszczą się już w 24 GB, RTX 4090 pozostaje opcją do porównania, zanim wybierzesz droższy plan.

Ta oferta to wynajem GPU dla Twojej aplikacji. Zarządzane API inferencji stanowi inną kategorię usługi: może być odpowiednie, jeśli szukasz przede wszystkim punktu wywołań utrzymywanego za Ciebie. W Kernodeck zapewniasz własny silnik, jego zależności i jego eksploatację; przygotowanie i wymagane sposoby dostępu dla Twojego projektu trzeba jeszcze potwierdzić przed wyborem środowiska.

TWOJA PŁATNOŚĆ

Twój pakiet, płatny bezpośrednio w kryptowalucie.

Płać za wynajem Kernodeck bezpośrednio w kryptowalutach, bez obowiązkowego doładowania: m.in. BTC w sieci Bitcoin i USDT w sieci Tron (TRC-20). Proces nie wymaga dokumentu tożsamości ani procedury KYC; konto z imieniem, nazwiskiem, adresem e-mail i hasłem jest wymagane, bez obietnicy anonimowości.

Porównaj osiem akceptowanych aktywów i sieci ↗

Warunki istotne dla Twojego projektu

Dostępność. Ilości zadeklarowane według modelu w ofertach. Nie rezerwują przyszłej dostępności ani terminu udostępnienia. Kraj hostingu i obsługiwany region do potwierdzenia przed zakupem, jeśli Twój projekt ich wymaga.

Przygotowanie. Ubuntu, PyTorch, Blender lub konfiguracja na zamówienie. Wersje, CPU, RAM, pamięć masowa, sieć i tryb dostępu do potwierdzenia w zależności od projektu; ich uwzględnienia nie można wywnioskować z modelu GPU.

Ceny i warunki. Kwoty w USD za partię i cały okres. Status podatkowy i ewentualne opłaty do potwierdzenia w obowiązujących warunkach.

Przeczytaj warunki wynajmu ↗
AVANT DE CHOISIR

Jaką moc wynająć do swojej inferencji?

Który plan wybrać na pierwsze przetwarzanie inferencji?

Jeśli Twój potok CUDA i reprezentatywna partia mieszczą się w 24 GB z zmierzonym zapasem, zacznij porównanie od RTX 4090: 110,00 USD za partię 1 GPU na 7 dni. Plan obejmuje ten okres wynajmu, nie ustalając liczby plików, które Twoja aplikacja będzie mogła przetworzyć. Uwzględnij w planowaniu instalację, kontrolę wyników i eksport; plany 3 i 30 dni pozwalają wybrać inny okres.

Kiedy zapłacić więcej za L40S lub H100 SXM?

Porównaj L40S 48 GB, gdy pełne obciążenie przekracza dostępny zapas na 24 GB, a następnie H100 SXM 80 GB, jeśli szukasz więcej pamięci na jednej karcie. Plany 7-dniowe kosztują odpowiednio 148,00 USD i 475,00 USD, każdy za partię 1 GPU. Uwzględnij w pomiarach model, dane wejściowe, pliki tymczasowe i pamięci podręczne; większa pojemność sama w sobie nie gwarantuje lepszej odpowiedzi dla Twojej aplikacji.

Czy wynajem obejmuje gotowe do wywołania API inferencji?

Oferta przedstawiona tutaj to wynajem GPU dla Twojej własnej aplikacji i nie obejmuje zarządzanego API inferencji reklamowanego jako gotowe do wywołania. To Ty wybierasz silnik, modele, zależności i ustawienia, a następnie organizujesz ich eksploatację. Jeśli priorytetem jest dla Ciebie usługa zarządzana, porównaj tę kategorię ofert osobno. Aby wynająć w Kernodeck, potwierdź przygotowanie i sposoby dostępu wymagane przez Twój projekt.

Czy B200 to logiczny wybór dla wielu równoczesnych zadań?

Staje się opcją wartą rozważenia, jeśli Twoja aplikacja może powierzyć niezależne partycje wielu wykonawcom lub obsługuje jawny podział. Za 2071,00 USD na 7 dni partia B200 obejmuje już 2 GPU po 180 GB każdy. Pamięci nie łączą się automatycznie; model rozproszony wymaga strategii zgodnej z Twoim silnikiem. Porównaj także koszt pojedynczej karty, jeśli wystarcza ona do planowanego obciążenia.

ABY PRZYGOTOWAĆ SWOJĄ PRACĘ

Od wyboru pakietu po Twoją aplikację.

Sprawdź dane wejściowe i czas odpowiedzi

Walidacja danych przed GPUKontrola typów, kształtów i wartości w celu wyodrębnienia nieprawidłowych wejść.Profilowanie kroku PyTorchWyznaczenie zakresu pomiaru i odczyt śladu CPU/GPU bez zbyt pochopnych wniosków.

Określ rezultat, który uzasadnia Twój wynajem

W przypadku przetwarzania plików określ wolumen do przejścia, format wyjściowy i regułę wznowienia. Zakończony plik musi być rozpoznawalny bez ponownego czytania całego przebiegu. W przypadku usługi interaktywnej określ maksymalny rozmiar zapytań, akceptowalny czas i zachowanie po osiągnięciu pełnej przepustowości. Ten sam model może wymagać dwóch bardzo różnych organizacji w zależności od tych ograniczeń.

Zachowaj reprezentatywną próbkę z krótkimi, typowymi przypadkami i takimi blisko Twoich granic. W potoku embeddingów przypisz każdy wektor do identyfikatora i wersji swojego wejścia. W generowaniu tekstu zapisuj parametry generowania użyte do oceny. Musisz umieć wyjaśnić różnicę w wyniku, nie przypisując jej od razu GPU.

Wybierz pamięć dla całego obciążenia inferencji

Rozmiar plików modelu nie opisuje całej pamięci używanej podczas wnioskowania. Należy uwzględnić także tensory tymczasowe, wejścia, zachowane wyjścia, a w przypadku odpowiednich modeli pamięć podręczną kluczy i wartości uwagi. Ta pamięć podręczna może stać się znacząca, gdy sekwencje się wydłużają lub gdy kilka zapytań jest przetwarzanych razem.

Zacznij od karty, której pamięć pozwala przeprowadzić reprezentatywną próbę ze zmierzonym zapasem. Modele o pamięci 24, 32, 48, 80 GB i większej odpowiadają różnym potrzebom; żadna pojemność nie gwarantuje, że dany model przejdzie ze wszystkimi swoimi ustawieniami. Zmniejszenie precyzji lub kwantyzacja może zmienić zapotrzebowanie, ale wymaga sprawdzenia wsparcia oprogramowania i jakości wyników na własnych danych wejściowych.

Wybierz GPU zgodny z Twoim łańcuchem oprogramowania

Wypisz silnik wnioskowania, jego szczególne operatory i rozszerzenia, od których zależą, zanim wybierzesz sprzęt. Aplikacja PyTorch może oferować kilka ścieżek wykonania, a wyspecjalizowane rozszerzenie obsługuje tylko jedną. Sprawdź cały łańcuch na CUDA dla NVIDIA lub na ROCm dla AMD, w tym ładowanie modelu i jego wstępne przetwarzanie.

Zachowaj minimalne polecenie, które przechodzi przez potok aż do zapisania wyniku. Dopiero potem włączaj swoje optymalizacje jedna po drugiej. Każda zmiana precyzji, kompilacji lub silnika musi zachować porównywalną kontrolę jakości. Udane załadowanie dowodzi, że wagi są czytelne; nie dowodzi, że wszystkie niezbędne ścieżki obliczeń działają.

Dostosuj batch do celu przetwarzania

Przykładowa metoda: utwórz trzy grupy tekstów według długości, a następnie przetwórz każdą z batchem 1, 2 i 4 wejść. Te rozmiary służą jako punkty próbne, nie jako uniwersalne zalecenie. Dla każdej kombinacji zanotuj ukończone wejścia, całkowity czas, zaobserwowaną maksymalną pamięć i błędy. Zatrzymaj postęp, gdy pojawi się granica, zamiast ukrywać niepowodzenia w średniej.

W przypadku usługi interaktywnej dodaj czas spędzony w kolejce. Większy batch może zmienić przepustowość i opóźnienie odczuwane przez zapytanie; sama średnia nie wystarczy do wyboru. W przypadku przetwarzania offline upewnij się, że grupowanie nie miesza kolejności wyników. Ostatecznie wybierz konfigurację, która spełnia Twoje kryterium jakości i ograniczenie czasowe.

Przejdź na wiele GPU, jeśli Twoja aplikacja potrafi rozdzielić pracę

Jeśli każda kopia modelu mieści się na jednej karcie, możesz zorganizować kilku pracowników przetwarzających odrębne partie wejść. Trzeba wtedy koordynować identyfikatory, wznowienia i zbieranie wyników. Jeśli model musi być rozłożony między karty, użyj strategii równoległości obsługiwanej przez Twój silnik i sprawdź jej wymagania dotyczące komunikacji.

Zamówione partie opisują ilość sprzętu, a nie batch aplikacyjny ani połączoną przestrzeń pamięci. W przypadku B200 jedna partia obejmuje dwie karty; w przypadku pozostałych ofert jedna partia obejmuje jedną kartę. W swojej dokumentacji wskaż planowaną liczbę workerów, przydział danych wejściowych dla każdego z nich oraz sposób stwierdzenia, że praca została faktycznie ukończona.

Wybierz okres obejmujący kontrole i eksport

Przy pierwszym wynajmie na 3 dni wyznacz ograniczony cel: instalacja, walidacja pipeline'u i uzyskanie pierwszego użytecznego wyniku. Okres 7 dni może posłużyć do przetestowania większej liczby wariantów; 30 dni do powtarzania przetwarzania i ugruntowania jego eksploatacji. To sposoby organizacji pracy, a nie obietnice czasu wykonania.

Na wyjściu zachowaj wagi lub ich wersję, konfigurację, kontrole jakości, faktycznie uzyskane pomiary oraz wyeksportowane wyniki. Oprogramowanie i przetwarzanie wybierasz samodzielnie; Kernodeck nie przeprowadza inspekcji ich zawartości. Samodzielnie przygotuj swoje dostępy, kopie zapasowe i niezbędne uprawnienia do korzystania z modeli i danych.

Przeczytaj tę stronę w Markdown ↗