Hai card, một kế hoạch phân chia rõ ràng
Bắt đầu bằng việc chọn giữa hai chiến lược: một bản sao mô hình trên mỗi card để xử lý dữ liệu khác nhau, hoặc một mô hình thực sự được phân chia giữa các GPU. Song song dữ liệu của PyTorch không tự nó biến hai bộ nhớ thành một kho dự trữ duy nhất dùng được cho một mô hình quá lớn.
180 GB thuộc về từng B200. Để khai thác chúng cùng nhau, hãy ghi lại việc phân tách mô hình, trao đổi giữa các tiến trình và lưu các phân vùng. Một bài kiểm tra ngắn về giao tiếp và khôi phục phải được thực hiện trước chiến dịch đầy đủ.
Kiểm tra Blackwell trước khi tối ưu
Chuẩn bị một bản phân phối PyTorch và các extension đã biên dịch tương thích với B200. Một thư viện Python import không lỗi vẫn có thể thất bại ở kernel CUDA đầu tiên: hãy kiểm tra việc tải, một lượt lan truyền tiến, tính gradient và ghi một checkpoint. Giữ lại các phiên bản đã chạy được lộ trình này.
Sau đó tách biệt quá trình biên dịch ban đầu và tính toán đã ổn định trong các phép đo của bạn. Sự phân biệt này giúp quyết định liệu một tối ưu hóa có đáng giữ lại cho tải của chính bạn hay không.
Khi nào nên chọn H200 hoặc MI300X
Nếu toàn bộ xử lý của bạn vừa trên một card duy nhất và không dùng GPU thứ hai, hãy xem xét H200 SXM với 141 GB. Nếu ưu tiên của bạn là bộ nhớ lớn mỗi card với môi trường ROCm được kiểm soát, MI300X với 192 GB là một hướng khác. Lựa chọn trước hết phụ thuộc vào phần mềm và kế hoạch tính toán.
Lập kế hoạch cho lot và các sản phẩm bàn giao
Dự trù 3 ngày để xác nhận việc khởi chạy phân tán, 7 ngày để so sánh nhiều cấu hình và 30 ngày cho một chiến dịch kèm checkpoint định kỳ. Mỗi lot đặt hàng chứa hai B200; hãy kiểm tra tổng số card trong bảng tóm tắt.
Chọn khoảng thời gian, số lot và phần chuẩn bị, rồi điền họ, tên và email. Chọn crypto và mạng của bạn; sau khi chuyển tiền, « Tôi đã trả » ghi nhận báo cáo của bạn. Giữ lại mã đơn hàng cùng bản kê các lần chạy.