GPU cho dự án của bạn · thanh toán crypto không cần KYC Cách thuê
Tiếng Việt
Mở console
KERNODECK / VOTRE APPLICATION

Chọn GPU cho ứng dụng suy luận của bạn.

Embeddings theo lô, phân loại hình ảnh hay ứng dụng tương tác: hãy thuê tại Kernodeck GPU phù hợp với suy luận của chính bạn. Bắt đầu với RTX 4090 24 GB ở mức 110,00 USD cho lô 1 GPU trong 7 ngày. Chọn dung lượng theo bộ nhớ đo được và chuỗi CUDA của bạn; bạn giữ việc chuẩn bị và vận hành ứng dụng.

  • Xử lý theo lô hoặc tương tác
  • Ba mức ngân sách trong 7 ngày
  • Môi trường và cài đặt của bạn
Tại Kernodeck, không cần giấy tờ tùy thân hay thủ tục KYC trong luồng thuê GPU này. Yêu cầu tài khoản: tên, họ, email và mật khẩu; điều này không có nghĩa là ẩn danh. Dữ liệu tài khoản ↗
BA MỨC NĂNG LỰC · MỘT TUẦN

Gắn khối lượng công việc của bạn với một ngân sách cụ thể.

Mô hình, đầu vào, bộ nhớ tạm thời và mức độ đồng thời định hướng lựa chọn. Các phiên bản và quyền truy cập cần thiết cho ứng dụng của bạn vẫn cần được xác nhận.

7 NGÀY · 1 LÔ

NVIDIA L40S 48GB

48 Go mỗi GPU · 1 GPU bao gồm

Để khảo sát một tải tương tác hoặc đa phương thức với 48 GB mỗi card.

148,00 USDcho cả lô và 7 joursCấu hình gói này ↗
7 NGÀY · 1 LÔ

NVIDIA H100 SXM 80GB

80 Go mỗi GPU · 1 GPU bao gồm

Dành cho nhu cầu bộ nhớ vượt quá 48 GB, với một ngăn xếp CUDA đã được kiểm định.

475,00 USDcho cả lô và 7 joursCấu hình gói này ↗

Cho xử lý theo lô: bắt đầu từ nhu cầu, rồi đến gói

Bạn muốn tạo embeddings cho một bộ sưu tập tài liệu hoặc phân loại một tập hình ảnh? RTX 4090 là lựa chọn ở mức 110,00 USD cho lô 1 GPU 24 GB trong 7 ngày nếu pipeline CUDA của bạn nằm gọn trong bộ nhớ đó cùng với đầu vào, các tệp tạm và một mức dự phòng đo được. Gói này định hình ngân sách phần cứng của bạn; bạn quyết định số tệp, quy tắc khôi phục và kết quả cần giữ.

Nếu đỉnh bộ nhớ của tác vụ bạn xử lý vượt quá dung lượng này, hãy so sánh với L40S: 148,00 USD cho một lô 1 GPU 48 GB trong 7 ngày. Card này cho nhiều dung lượng hơn trên mỗi card cho khối lượng công việc bạn đã đo. Việc chọn giữa hai lựa chọn phụ thuộc vào dung lượng này và khả năng tương thích của chuỗi phần mềm của bạn, chứ không phải vào một khối lượng tài liệu được hứa hẹn nào.

Đối với các phân vùng độc lập, B200 mở ra một cách tổ chức khác: 2.071,00 USD cho một lô 2 GPU 180 GB mỗi card trong 7 ngày, cả hai card đã được tính trong mức giá này. Hãy so sánh lựa chọn này khi ứng dụng của bạn biết cách phân chia tác vụ giữa nhiều worker. Nó không biến hai bộ nhớ thành một không gian duy nhất 360 GB.

Đối với ứng dụng tương tác: chọn bộ nhớ cho toàn bộ khối lượng công việc của bạn

Một trợ lý hoặc công cụ nội bộ phải tính đến các yêu cầu đồng thời, độ dài của chúng và các bộ nhớ đệm riêng của engine. L40S ở mức 148,00 USD cho một lô 1 GPU 48 GB trong 7 ngày là một ứng viên phù hợp nếu toàn bộ khối lượng công việc này nằm trong bộ nhớ của card và nếu engine của bạn hỗ trợ chuỗi CUDA của nó. Số đo của bạn về hàng đợi và các phản hồi vẫn là tiêu chí để chọn cấu hình.

Nếu bạn cần nhiều bộ nhớ hơn trên một card duy nhất, hãy so sánh với H100 SXM: 475,00 USD cho một lô 1 GPU 80 GB trong 7 ngày. Card này tăng dung lượng trên mỗi GPU; nhưng không đủ để đảm bảo độ trễ hay thông lượng của ứng dụng. Nếu nhu cầu của bạn đã nằm gọn trong 24 GB, RTX 4090 vẫn là lựa chọn cần so sánh trước khi cam kết một gói cao hơn.

Ưu đãi này là dịch vụ thuê GPU cho ứng dụng của bạn. API suy luận được quản lý là một loại dịch vụ khác: nó có thể phù hợp nếu bạn tìm kiếm trước hết một điểm gọi đã được vận hành sẵn cho bạn. Tại Kernodeck, hãy tự chuẩn bị engine, các phụ thuộc và việc vận hành nó; việc chuẩn bị và các điều kiện truy cập cần thiết cho dự án của bạn vẫn cần được xác nhận trước khi chọn môi trường.

THANH TOÁN CỦA BẠN

Gói của bạn, thanh toán trực tiếp bằng crypto.

Thanh toán trực tiếp cho thuê Kernodeck bằng crypto, không bắt buộc nạp tiền: BTC trên Bitcoin và USDT trên Tron (TRC-20), cùng nhiều loại khác. Quy trình không yêu cầu giấy tờ tùy thân hay thủ tục KYC; cần tài khoản với họ, tên, email và mật khẩu, không hứa hẹn ẩn danh.

So sánh tám tài sản và mạng được chấp nhận ↗

Các điều kiện hữu ích cho dự án của bạn

Khả dụng. Số lượng công bố theo từng mẫu trong các ưu đãi. Chúng không đặt trước tình trạng sẵn có trong tương lai cũng như ngày cung cấp. Quốc gia lưu trữ và khu vực phục vụ cần được xác nhận trước khi mua nếu dự án của bạn yêu cầu những điều này.

Chuẩn bị. Ubuntu, PyTorch, Blender hoặc yêu cầu tùy chỉnh. Phiên bản, CPU, RAM, lưu trữ, mạng và cách truy cập cần được xác nhận theo từng dự án; không thể suy ra sự bao gồm của chúng từ mẫu GPU.

Giá và điều kiện. Số tiền USD cho cả lô và toàn bộ thời hạn. Tình trạng thuế và các khoản phí có thể có cần được xác nhận trong các điều khoản áp dụng.

Đọc điều kiện thuê ↗
AVANT DE CHOISIR

Nên thuê năng lực nào cho suy luận của bạn?

Nên chọn gói nào cho tác vụ suy luận đầu tiên?

Nếu pipeline CUDA và một batch đại diện của bạn nằm gọn trong 24 GB với mức dự phòng đã đo, hãy bắt đầu so sánh từ RTX 4090: 110,00 USD cho một lô 1 GPU trong 7 ngày. Gói này bao gồm khoảng thời gian thuê đó, mà không ấn định số lượng tệp mà ứng dụng của bạn có thể xử lý. Hãy đưa vào kế hoạch của bạn việc cài đặt, kiểm tra kết quả đầu ra và xuất dữ liệu; các gói 3 và 30 ngày cho phép chọn một khoảng thời gian khác.

Khi nào nên trả nhiều tiền hơn cho L40S hoặc H100 SXM?

Hãy so sánh L40S 48 GB khi toàn bộ khối lượng công việc vượt quá mức dự phòng hiện có trên 24 GB, rồi đến H100 SXM 80 GB nếu bạn tìm kiếm nhiều bộ nhớ hơn trên một card duy nhất. Các gói 7 ngày có giá lần lượt là 148,00 USD và 475,00 USD, mỗi gói cho một lô 1 GPU. Hãy tính cả mô hình, dữ liệu đầu vào, các tệp tạm và bộ nhớ đệm trong phép đo của bạn; dung lượng lớn hơn tự nó không đảm bảo một phản hồi tốt hơn cho ứng dụng.

Gói thuê có bao gồm một API suy luận sẵn sàng để gọi không?

Ưu đãi được trình bày ở đây là dịch vụ thuê GPU cho ứng dụng của chính bạn, và không bao gồm một API suy luận được quản lý được công bố là sẵn sàng để gọi. Bạn chọn engine, các mô hình, các phụ thuộc và các thiết lập, rồi tự tổ chức việc vận hành chúng. Nếu ưu tiên của bạn là một dịch vụ được quản lý, hãy so sánh loại ưu đãi đó một cách riêng biệt. Để thuê tại Kernodeck, hãy yêu cầu xác nhận việc chuẩn bị và các điều kiện truy cập mà dự án của bạn yêu cầu.

B200 có phải là lựa chọn hợp lý cho nhiều tác vụ đồng thời không?

Nó trở thành một lựa chọn đáng xem xét nếu ứng dụng của bạn có thể giao các phân vùng độc lập cho nhiều worker hoặc hỗ trợ phân chia tác vụ một cách rõ ràng. Ở mức 2.071,00 USD trong 7 ngày, một lô B200 đã bao gồm 2 GPU 180 GB mỗi card. Các bộ nhớ không tự động hợp nhất; một mô hình được phân tán đòi hỏi một chiến lược tương thích với engine của bạn. Hãy so sánh cả chi phí của một card duy nhất nếu nó đủ cho khối lượng công việc dự kiến.

ĐỂ CHUẨN BỊ CÔNG VIỆC CỦA BẠN

Từ việc chọn gói đến ứng dụng của bạn.

Kiểm tra đầu vào và thời gian phản hồi

Xác thực dữ liệu trước GPUKiểm soát kiểu, hình dạng và giá trị để cô lập các đầu vào không hợp lệ.Profiler một bước PyTorchGiới hạn phép đo và đọc một dấu vết CPU/GPU mà không kết luận quá vội.

Xác định sản phẩm bàn giao biện minh cho việc thuê của bạn

Đối với xử lý tệp, hãy xác định khối lượng cần duyệt, định dạng đầu ra và quy tắc tiếp tục. Một tệp đã hoàn thành phải được nhận biết mà không cần đọc lại toàn bộ quá trình thực thi. Đối với một dịch vụ tương tác, hãy xác định kích thước tối đa của yêu cầu, thời gian chấp nhận được và hành vi khi đạt tới giới hạn năng lực. Cùng một mô hình có thể đòi hỏi hai cách tổ chức rất khác nhau tùy theo những ràng buộc này.

Hãy giữ một mẫu đại diện với các trường hợp ngắn, thông thường và gần với giới hạn của bạn. Trong một pipeline embeddings, hãy gắn mỗi vector với định danh và phiên bản của đầu vào tương ứng. Trong sinh văn bản, hãy ghi lại các tham số sinh được dùng để đánh giá. Bạn phải có khả năng giải thích sự khác biệt về kết quả mà không quy ngay cho GPU.

Chọn bộ nhớ cho toàn bộ khối lượng suy luận

Kích thước các tệp của mô hình không mô tả hết bộ nhớ được dùng trong quá trình suy luận. Cũng cần tính đến các tensor tạm thời, đầu vào, đầu ra được giữ lại và, đối với các mô hình liên quan, bộ nhớ đệm key và value của cơ chế attention. Bộ nhớ đệm này có thể trở nên đáng kể khi chuỗi dài ra hoặc khi nhiều yêu cầu được xử lý cùng lúc.

Hãy bắt đầu bằng một card mà bộ nhớ cho phép chạy thử đại diện của bạn với một biên độ đã đo lường. Các mô hình 24, 32, 48, 80 GB và hơn nữa đáp ứng những nhu cầu khác nhau; không có dung lượng nào đảm bảo rằng một mô hình nhất định sẽ chạy được với mọi thiết lập. Giảm độ chính xác hoặc lượng tử hóa có thể thay đổi dấu chân bộ nhớ, nhưng buộc bạn phải kiểm tra khả năng hỗ trợ của phần mềm và chất lượng đầu ra trên chính đầu vào của bạn.

Chọn GPU tương thích với chuỗi phần mềm của bạn

Hãy liệt kê engine suy luận, các toán tử đặc thù của nó và những extension mà bạn phụ thuộc trước khi chọn phần cứng. Một ứng dụng PyTorch có thể cung cấp nhiều đường thực thi, trong khi một extension chuyên dụng chỉ hỗ trợ một đường. Hãy kiểm tra toàn bộ chuỗi trên CUDA cho NVIDIA hoặc trên ROCm cho AMD, kể cả việc tải mô hình và tiền xử lý.

Hãy giữ một lệnh tối giản chạy xuyên suốt pipeline cho đến khi ghi ra một kết quả. Chỉ sau đó mới bật từng tối ưu hóa một. Mỗi thay đổi về độ chính xác, biên dịch hay engine đều phải giữ một phép kiểm tra chất lượng có thể so sánh được. Một lần tải thành công chứng tỏ các trọng số đọc được; nó không chứng tỏ rằng mọi đường tính toán cần thiết đều hoạt động.

Điều chỉnh batch theo mục tiêu xử lý của bạn

Ví dụ về phương pháp: lập ba nhóm văn bản theo độ dài, rồi xử lý mỗi nhóm với batch 1, 2 và 4 đầu vào. Các kích thước này chỉ là điểm thử nghiệm, không phải khuyến nghị phổ quát. Với mỗi tổ hợp, hãy ghi lại số đầu vào đã hoàn thành, tổng thời gian, bộ nhớ tối đa quan sát được và các lỗi. Hãy dừng tiến trình khi xuất hiện một giới hạn thay vì che giấu các thất bại trong một giá trị trung bình.

Đối với một dịch vụ tương tác, hãy thêm thời gian chờ trong hàng đợi. Một batch lớn hơn có thể thay đổi thông lượng và độ trễ mà một yêu cầu cảm nhận được; chỉ một giá trị trung bình là không đủ để lựa chọn. Đối với xử lý ngoại tuyến, hãy đảm bảo rằng việc gom nhóm không làm xáo trộn thứ tự kết quả. Cuối cùng, hãy chọn một cấu hình tuân thủ tiêu chí chất lượng và ràng buộc độ trễ của bạn.

Chuyển sang nhiều GPU nếu ứng dụng của bạn biết phân chia công việc

Nếu mỗi bản sao của mô hình vừa trên một card, bạn có thể tổ chức nhiều worker tiêu thụ các phân vùng đầu vào khác nhau. Khi đó cần phối hợp các định danh, việc tiếp tục và việc thu thập đầu ra. Nếu mô hình phải được chia giữa các card, hãy dùng một chiến lược song song hóa được engine của bạn hỗ trợ và kiểm tra các yêu cầu giao tiếp của nó.

Số lượng đặt mua mô tả số lượng phần cứng, không phải batch của ứng dụng hay một vùng nhớ hợp nhất. Với B200, một lô gồm hai card; với các gói khác, một lô gồm một card. Hãy nêu rõ trong hồ sơ của bạn số lượng worker dự kiến, phần đầu vào giao cho mỗi worker và cách xác nhận rằng một công việc đã thực sự hoàn tất.

Chọn khoảng thời gian bao gồm các bước kiểm tra và xuất dữ liệu

Với lần thuê đầu tiên 3 ngày, hãy đặt mục tiêu giới hạn: cài đặt, kiểm chứng pipeline và tạo ra kết quả đầu tiên có thể dùng được. Thời lượng 7 ngày có thể dùng để thử nhiều biến thể hơn; 30 ngày để lặp lại một quy trình và củng cố việc vận hành nó. Đây là những cách tổ chức công việc, không phải cam kết về thời gian thực thi.

Khi kết thúc, hãy lưu lại trọng số hoặc phiên bản của chúng, cấu hình, các kiểm tra chất lượng, các chỉ số thực tế đạt được và kết quả đã xuất. Bạn tự chủ động lựa chọn phần mềm và quy trình xử lý của mình; Kernodeck không kiểm tra nội dung của chúng. Hãy tự chuẩn bị quyền truy cập, bản sao lưu và các quyền cần thiết để sử dụng mô hình và dữ liệu.

Đọc trang này ở định dạng Markdown ↗