1. GPU를 선택하기 전에 결과를 정의하기
애플리케이션 전체를 관통하는 샘플을 선택하세요. 추론의 경우 대표적인 입력 몇 개와 예상 출력 형식에서 시작하세요. 모델 적응(파인튜닝)의 경우 데이터를 읽고, 업데이트를 수행하며, 체크포인트를 작성하는 짧은 실행을 준비하세요. 목적은 최종 볼륨을 맡기기 전에 전체 경로를 검증하는 것입니다.
교육적인 예를 들어 보겠습니다. 문서를 분류한다고 가정해 보죠. 서로 다른 길이의 문서 여러 개와 프로그램이 정상적으로 거부해야 하는 사례 하나를 포함해, 식별 가능한 문서 열두 개를 준비합니다. 허용할 카테고리와 결과의 저장 위치를 정합니다. 열두 개의 식별자는 결과 요약에 정확히 한 번씩 나타나야 하며, 각각 허용된 결과나 명시적인 오류가 함께 표시되어야 합니다. 이 시나리오는 여러분의 애플리케이션에 맞게 조정하면 되며, 특정 모델이나 처리량을 전제로 하지 않습니다.
표의 모든 열을 보려면 스크롤하세요.| 확인할 항목 | 실행 전에 준비한 기준 |
|---|---|
| 입력 | 12개의 고유 식별자, 읽을 수 있는 파일, 하나의 잘못된 사례 대비. |
| 결과 | 승인된 서류당 허용되는 카테고리 하나이며, 임의로 만든 식별자는 없습니다. |
| 실패 | 거부된 각 문서에 사유가 연결되며, 조용히 누락되는 일은 없습니다. |
| 체험판 종료 | 승인 + 거부 = 12, 보고서와 결과는 사본에서 다시 검토. |
2. 백엔드, 메모리, 요금제 선택
프로젝트 라이브러리부터 확인하세요. CUDA 의존성이 있으면 NVIDIA 체인으로 향합니다. MI300X를 고려한다면 ROCm 지원, 특히 확장 기능 지원을 검토해야 합니다. 공식 PyTorch 선택기는 운영체제와 연산 플랫폼을 구분합니다. 다른 머신에서 복사한 명령어를 그대로 쓰는 것은 호환성 검증이 아닙니다.
다음으로 대표 작업에 필요한 메모리를 비교하세요. 가중치, 입력, 중간 연산, 그리고 사용하는 방식 고유의 상태까지 포함합니다. 모델 파일 크기만으로는 충분하지 않습니다. 최대 사용량을 아직 모른다면 이 항목을 파일럿의 목표로 두고, 파라미터 수만으로 모델이 돌아간다고 단정하지 마세요.
3일, 7일 또는 30일을 선택하고 1~10개의 로트를 선택하세요. 로트 하나에는 카드 한 장이 포함되며, B200의 경우에만 두 장이 포함됩니다. 여러 카드를 사용하더라도 프로그램이 자동으로 분산되거나 메모리가 통합되지 않습니다. 설치, 검증, 연산, 내보내기에 걸리는 시간을 장기적으로 고려하세요. 파일럿의 열두 문서는 절차를 검증하기 위한 것이지, 전체 캠페인의 소요 시간을 기계적으로 예측하기 위한 것이 아닙니다.
3. 머신 변경에도 견디는 작업 폴더 준비
코드 리비전, 의존성, 데이터 및 모델 참조, 파라미터, 진입 명령을 한데 모으세요. 필요한 접근 권한은 별도로 제공하는 방법을 명시하세요. 홈 디렉터리 경로는 이전 절차가 아닙니다. 암묵적인 가정을 파라미터로 바꾸고 프로젝트 폴더에서 경로를 확인하세요.
구성에서 선택한 Ubuntu, PyTorch, Blender 또는 사용자 지정 준비는 필요를 표현할 뿐입니다. 프로젝트, 확장 기능 또는 라이선스가 이미 설치되어 있다는 증거는 아닙니다. 무엇이 있어야 하는지 설명한 다음, 처리를 시작하기 전에 실제로 받은 환경을 점검하세요.
우리 문서 배치의 경우, 변경되지 않는 파일럿 입력, 파라미터 파일, 시험마다 별도의 결과 디렉터리를 유지하세요. 또한 결과를 다시 검토하는 방법도 적어 두세요. 이 폴더는 클 필요가 없습니다. 잊어버린 셀, 오래된 터미널, 복사되지 않은 파일 때문에 성공이 좌우되지 않게 해야 합니다.
projet/
README.md # 설치, 실행, 점검
requirements-rebuild.txt # 문서화된 의존성 및 출처
config/pilote.json # 비밀이 없는 파라미터
data/pilote/ # 허용된 12개 입력
src/ # 애플리케이션
runs/ # 시험마다 하나의 하위 폴더4. 주문을 다시 확인한 후 서비스 단계를 따르세요
요약은 선택 사항과 일치해야 합니다: 모델, 기간, 로트, 총 카드 수, 준비 사항, USD 금액. 총액은 기간당 로트 가격에 로트 수를 곱한 값입니다. B200 로트 가격에는 이미 두 장의 카드가 포함되어 있으므로 GPU 수를 두 번 곱하지 마세요.
첫 주문이라면 이름, 성, 이메일, 비밀번호로 계정을 만드세요. 이미 계정이 있다면 로그인하세요. 이미 로그인되어 있다면 정보가 미리 채워져 있습니다. 계정을 통해 다른 브라우저에서도 주문과 잔액을 확인할 수 있습니다. 이 과정에서는 KYC 절차나 신분증이 필요하지 않습니다.
암호화폐로 결제하려면 해당 결제에 표시된 자산, 네트워크, 주소, 금액, 기한을 사용하세요. 전송 후 «결제했습니다»를 누르면 신고가 기록됩니다. 이는 자금 수령이나 서비스 제공을 확인하는 것이 아닙니다. 충분한 USD 잔액으로도 대여 금액 전액을 결제할 수 있습니다. 이후 실제로 안내된 준비 정보와 접속 정보를 따르세요.
5. 최종 볼륨 전에 실행 점검하기
리소스가 제공되면 실제로 사용되는 인터프리터와 로드된 환경을 확인하세요. 애플리케이션 전에 최소 진단을 실행하세요. PyTorch import가 성공해도 GPU 연산이 입증되지는 않으며, 간단한 연산이 성공해도 모델의 모든 확장이 검증되지는 않습니다. 진단 폴더는 이 진행 과정을 설명하고 다운로드 가능한 리소스를 제공합니다.
그런 다음 새 출력 디렉터리에서 파일럿을 실행하세요. 문서의 경우 식별자, 카테고리, 성공 건수, 예상된 거부를 확인하세요. 여러 결과를 입력과 함께 검토하세요. 구문상 유효한 출력도 용도에 맞지 않을 수 있습니다. 무엇이 승인되었고 무엇이 아직 수정되어야 하는지 기록한 후에만 전체 코퍼스로 넘어가세요.
실행이 실패하면 첫 번째 오류와 도달한 단계를 기록하세요. 재설치 전에 인터프리터를, 복사 전에 경로를, 배치를 늘리기 전에 입력 크기를 확인하세요. 한 번에 하나의 요인만 변경하세요. 프로세스가 오래 걸린다면 실행에 사용한 대화형 연결과 별도로 모니터링을 구성하세요.
6. 활용 가능한 증거를 확보하고 다음 단계 결정하기
결과와 그 요약을 직접 관리하는 위치로 복사한 후 그 복사본을 다시 확인하세요. 결과를 이해하는 데 필요한 매개변수와 참조가 포함되어 있는지 확인하세요. 컴퓨팅 환경에 있는 파일만을 유일한 백업으로 간주하지 마세요. 대여 기한을 기다리지 말고 파일럿 중에 이 점검을 하세요.
학습의 경우 새 프로세스에서 재개 테스트를 추가하세요. Kernodeck 미니 프로젝트는 CPU에서의 방법을 보여줍니다. 애플리케이션은 여전히 자체 상태, 정밀도, 데이터를 검증해야 합니다. 독립적인 문서의 경우 재개는 완료된 항목과 재처리할 항목을 식별하는 것을 의미합니다.
최종 결정은 예정된 볼륨을 시작하거나, 환경을 수정하거나, 구성을 재검토하는 것일 수 있습니다. 이 결정을 그 근거와 함께 보관하세요. 비호환성을 드러내는 파일럿은 유용합니다. 더 많은 연산을 투입하기 전에 모호한 문제를 해결해야 할 명확한 조건으로 바꿔주기 때문입니다.