Xác định một yêu cầu đại diện
Một dịch vụ embeddings, phân loại hay phiên âm không có cùng đầu vào. Hãy cố định độ dài tài liệu, kích thước hình ảnh hoặc thời lượng âm thanh, rồi tạo một tập nhỏ bao quát sự đa dạng của chúng. Với mỗi trường hợp, xác định kết quả mong đợi và cách báo lỗi.
Hãy đo riêng thời gian tải mô hình. Độ trễ của lần gọi đầu tiên và của một tiến trình đã sẵn sàng trả lời hai câu hỏi khác nhau cho người dùng ứng dụng của bạn.
Chia sẻ 24 GB giữa các yêu cầu
Bắt đầu với một yêu cầu, rồi tăng mức đồng thời trong khi giữ nguyên đầu vào. Theo dõi bộ nhớ và hàng đợi: chấp nhận nhiều cuộc gọi cùng lúc hơn không có nghĩa là chúng sẽ xong nhanh hơn. Hãy đặt một giới hạn và một hành vi rõ ràng khi đạt tới giới hạn đó.
Hãy kiểm chứng môi trường CUDA, PyTorch và các thư viện chuẩn bị đa phương tiện nếu dịch vụ của bạn dùng chúng. Các chức năng video của L4 chỉ được dùng nếu phần mềm của bạn bật đường dẫn tương thích; sự hiện diện của phần cứng không tự động thay đổi một script Python.
Khi nào nên chọn dung lượng khác
Nếu các trường hợp khó của bạn không vừa trong 24 GB, L40S mở ra lựa chọn 48 GB trong cùng dòng Ada. Với một nguyên mẫu tập trung vào tính toán mô hình, hãy so sánh thêm RTX 4090. Nếu bạn cần nghiên cứu 80 GB trong một miền bộ nhớ duy nhất, hãy chuyển sang A100 thay vì nhân nhiều lô L4 mà không có chiến lược phần mềm.
Xây dựng một thử nghiệm kết thúc gọn gàng
Trong 3 ngày, hãy đánh giá việc tải và truy vấn. Trong 7 ngày, thêm tính đồng thời, đầu vào không hợp lệ và khởi động lại. Gói 30 ngày có thể dùng cho một chiến dịch lặp với các báo cáo hàng ngày mà bạn lưu giữ.
Lệnh yêu cầu mô hình, lô, thời lượng và chuẩn bị, sau đó tạo tài khoản hoặc đăng nhập. Tiếp theo bạn chọn tài sản và mạng crypto, không cần thủ tục KYC hay giấy tờ tùy thân. Sau khi chuyển tiền, “Tôi đã thanh toán” ghi lại thông báo. Bạn có thể xem hồ sơ và tình trạng thanh toán từ tài khoản Kernodeck của mình.