두 개의 카드, 명확한 분산 계획
먼저 두 가지 전략 중에서 선택하세요. 각 카드에 모델 복사본을 두고 서로 다른 데이터를 처리하거나, 모델을 GPU 간에 실제로 분산하는 것입니다. PyTorch의 데이터 병렬 처리는 그 자체만으로 두 개의 메모리를 너무 큰 모델이 사용할 수 있는 하나의 저장 공간으로 만들어 주지는 않습니다.
180GB는 각 B200에 속합니다. 이를 함께 활용하려면 모델 분할, 프로세스 간 통신, 파티션 저장을 문서화하세요. 전체 캠페인에 앞서 통신과 복원에 대한 짧은 테스트를 먼저 수행해야 합니다.
최적화 전에 Blackwell 검증하기
B200과 호환되는 PyTorch 배포판과 컴파일된 확장을 준비하세요. 오류 없이 임포트된 Python 라이브러리도 첫 CUDA 커널에서 실패할 수 있으므로, 로딩, 순전파, 기울기 계산, 체크포인트 쓰기를 테스트하세요. 이 과정을 실행한 버전을 보관하세요.
그런 다음 측정에서 초기 컴파일과 안정화된 계산을 분리하세요. 이 구분은 특정 최적화를 자신의 부하에 대해 유지할 가치가 있는지 판단하는 데 도움이 됩니다.
H200 또는 MI300X를 선택할 때
전체 처리가 단일 카드에 들어가고 두 번째 GPU를 사용하지 않는다면 141GB H200 SXM을 검토하세요. 카드당 큰 메모리와 잘 관리된 ROCm 환경이 우선이라면 192GB MI300X가 또 다른 선택지입니다. 선택은 무엇보다 소프트웨어와 계산 계획에 달려 있습니다.
로트와 산출물 계획하기
분산 실행 검증에는 3일, 여러 설정 비교에는 7일, 정기적인 체크포인트가 필요한 캠페인에는 30일을 계획하세요. 주문한 각 로트에는 B200이 두 개 포함됩니다. 요약에서 총 카드 수를 확인하세요.
기간, 로트, 준비 사항을 선택한 다음 이름, 성, 이메일을 입력하세요. 암호화폐와 네트워크를 선택하고, 전송 후 « 결제했습니다 »를 누르면 신고가 기록됩니다. 주문 참조 번호를 실행 매니페스트와 함께 보관하세요.