Bắt đầu từ một bước huấn luyện hoàn chỉnh
Lần chạy đầu tiên của bạn phải bao gồm việc đọc dữ liệu, lượt truyền xuôi, tính gradient và cập nhật optimizer. Hãy đo toàn bộ chu trình này trước khi tăng batch. Trọng số chỉ là một phần của bộ nhớ đang dùng: các activation và trạng thái huấn luyện cũng phải vừa với 80 GB.
Hãy giữ một chuỗi đầu vào đại diện, bao gồm cả các ví dụ cồng kềnh. Bạn sẽ tránh được việc tính toán toàn bộ chiến dịch dựa trên một batch đầu tiên đặc biệt dễ.
Độ chính xác hỗn hợp và so sánh có kiểm soát
PyTorch cho phép chọn độ chính xác phù hợp cho một số phép toán nhất định với autocast. Hãy thử cài đặt này trên hàm mất mát và các tiêu chí kiểm định của bạn. Một tùy chọn được bật không phải là bằng chứng về tính ổn định số: hãy giữ một lần chạy so sánh, các chỉ số và tham số chính xác.
Với nhiều card, hãy phân biệt batch trên mỗi GPU với batch toàn cục. Số lượng tiến trình và việc tích lũy gradient là một phần của quy trình, cũng như tốc độ học.
SXM, PCIe hay nhiều bộ nhớ hơn
H100 PCIe vẫn giữ dung lượng 80 GB và đáng được so sánh cho công việc chủ yếu trên một card. Với việc trao đổi thường xuyên giữa các GPU, hãy đo cấu trúc liên kết mà ứng dụng của bạn thực sự dùng; tên SXM không thay thế cho việc kiểm tra này. Hãy chọn H200 nếu vấn đề được xác định trước hết là thiếu bộ nhớ trên mỗi card.
Đặt trước một khoảng thời gian bao gồm cả việc khôi phục
Chọn 3 ngày để xác nhận một vòng lặp và một checkpoint, 7 ngày cho một loạt thí nghiệm ablation, hoặc 30 ngày cho các thí nghiệm theo dõi. Hãy đưa cả đánh giá và xuất kết quả vào lịch trình này, không chỉ các epoch huấn luyện.
Trong trình cấu hình, hãy chọn bản dựng PyTorch hoặc tùy chỉnh, số lô và thời lượng. Tạo tài khoản hoặc đăng nhập trước khi lưu đơn hàng và chọn thanh toán crypto. Nút « Tôi đã thanh toán » dùng để báo hiệu giao dịch; trạng thái theo dõi thanh toán vẫn hiển thị trong tài khoản của bạn.