Một ứng dụng một card dễ hiểu
Hãy bắt đầu bằng một quy trình tải mô hình, xử lý một lô và xuất kết quả. Cố định kích thước đầu vào và số lượng yêu cầu. Kịch bản đơn giản này giúp xác định liệu nỗ lực tiếp theo nên tập trung vào bộ nhớ GPU, dữ liệu hay logic Python.
Với 80 GB, bạn có thể khám phá các khối lượng công việc lớn hơn so với một card 24 hoặc 48 GB, trong khi vẫn chỉ quản lý một vùng nhớ duy nhất. Tuy nhiên, hãy dự phòng một khoảng cho các cấp phát tạm thời của engine.
Quan sát cả truyền dữ liệu lẫn kernel
Một chương trình tải lại cùng dữ liệu giữa hai lần gọi có thể dành một phần đáng kể thời gian ngoài phần tính toán hữu ích. Hãy đo riêng thời gian chuẩn bị trên CPU, truyền, thực thi và lấy kết quả. Với các phép đo CUDA, hãy lưu ý đến thực thi bất đồng bộ để không chỉ đo việc gửi công việc.
Hãy xác nhận hoạt động với phiên bản PyTorch và các thư viện đã biên dịch của dự án. Giữ một lần chạy không tối ưu làm điểm so sánh trước khi sửa đổi đường thực thi.
So sánh mà không nhầm lẫn các định dạng H100
H100 SXM và H100 PCIe không mô tả cùng một cấu hình phần cứng. Hãy chọn SXM nếu nghiên cứu của bạn biện minh cho việc đo hành vi của nó đối với các trao đổi phân tán. Thay vào đó, hãy chọn H200 khi khối lượng một card của bạn vượt quá 80 GB. A100 SXM vẫn là một lựa chọn thay thế cần xem xét cho một môi trường Ampere đã được đánh giá.
Thuê để đưa ra quyết định
Gói 3 ngày có thể dùng để thiết lập hồ sơ ban đầu. Trong 7 ngày, hãy thử nhiều kích thước lô và giữ một báo cáo so sánh; trong 30 ngày, hãy tổ chức các lần chạy và theo dõi chúng bằng các mã định danh ổn định.
Chọn thời lượng, số lô và bản dựng trong trình cấu hình, sau đó tạo tài khoản hoặc đăng nhập. Thanh toán tuân theo tài sản và mạng lưới đã chọn. Sau khi chuyển khoản, « Tôi đã thanh toán » thêm một báo hiệu vào đơn hàng, mà bạn có thể tìm thấy trong tài khoản Kernodeck của mình.