완전한 학습 단계부터 시작
첫 시도는 데이터 읽기, 순전파, 그레이디언트 계산, 옵티마이저 업데이트를 모두 거쳐야 합니다. 배치를 늘리기 전에 이 전체 주기를 측정하세요. 가중치는 점유 메모리의 일부일 뿐이며, 활성화와 학습 상태도 80GB 안에 들어가야 합니다.
대용량 예제를 포함한 대표적인 입력 시퀀스를 유지하세요. 특히 쉬운 첫 배치를 기준으로 전체 캠페인을 설계하는 일을 피할 수 있습니다.
혼합 정밀도와 통제된 비교
PyTorch에서는 autocast로 일부 연산에 적합한 정밀도를 선택할 수 있습니다. 손실 함수와 검증 기준에서 이 설정을 테스트하세요. 옵션을 켰다는 것이 수치적 안정성의 증거는 아닙니다. 비교 실행, 지표, 정확한 파라미터를 유지하세요.
여러 카드를 사용할 경우 GPU당 배치와 전체 배치를 구분하세요. 프로세스 수와 그레이디언트 누적도 학습률과 마찬가지로 프로토콜의 일부입니다.
SXM, PCIe 또는 더 많은 메모리
H100 PCIe는 80GB 용량을 유지하며 주로 단일 카드 작업에서 비교해 볼 만합니다. GPU 간 교환이 잦다면 애플리케이션이 실제로 사용하는 토폴로지를 측정하세요. SXM이라는 이름이 이 점검을 대신해 주지 않습니다. 식별된 문제가 우선 카드당 메모리 부족이라면 H200을 선택하세요.
재개를 포함한 기간 예약
루프와 체크포인트를 검증하려면 3일, 일련의 소거 실험이라면 7일, 추적이 필요한 실험이라면 30일을 선택하세요. 이 일정에는 학습 에폭뿐 아니라 평가와 내보내기도 포함시키세요.
구성기에서 PyTorch 또는 사용자 지정 준비, 배치 수, 기간을 선택하세요. 주문을 저장하고 암호화폐 결제를 선택하기 전에 계정을 만들거나 로그인하세요. «결제했습니다» 버튼은 송금을 알리는 용도이며, 결제 추적은 계정에서 계속 확인할 수 있습니다.