대여를 정당화하는 결과물을 정의하세요
파일 처리라면 순회할 볼륨, 출력 형식, 재개 규칙을 정의하세요. 완료된 파일은 전체 실행을 다시 읽지 않고도 인식할 수 있어야 합니다. 대화형 서비스라면 요청의 최대 크기, 허용 가능한 지연, 용량에 도달했을 때의 동작을 정의하세요. 같은 모델이라도 이러한 제약에 따라 매우 다른 두 가지 구성이 필요할 수 있습니다.
짧은 사례, 일반적인 사례, 한계에 가까운 사례를 포함한 대표 표본을 보관하세요. 임베딩 파이프라인에서는 각 벡터를 입력의 식별자 및 버전과 연결하세요. 텍스트 생성에서는 평가에 사용한 생성 파라미터를 기록하세요. 결과 차이를 즉시 GPU 탓으로 돌리지 않고 설명할 수 있어야 합니다.
전체 추론 워크로드에 맞는 메모리를 선택하세요
모델 파일의 가중치만으로는 추론 중 사용되는 전체 메모리를 설명할 수 없습니다. 임시 텐서, 입력, 보관되는 출력, 그리고 해당되는 모델의 경우 어텐션의 키·값 캐시도 고려해야 합니다. 이 캐시는 시퀀스가 길어지거나 여러 요청을 함께 처리할 때 커질 수 있습니다.
먼저 측정된 여유를 두고 대표적인 시험을 수행할 수 있는 메모리를 갖춘 카드로 시작하세요. 24, 32, 48, 80GB 이상의 모델은 서로 다른 요구에 대응하며, 어떤 용량도 특정 모델이 모든 설정으로 통과한다고 보장하지 않습니다. 정밀도를 낮추거나 양자화하면 메모리 사용량이 달라질 수 있지만, 소프트웨어 지원과 자체 입력에서의 출력 품질을 확인해야 합니다.
소프트웨어 스택과 호환되는 GPU를 선택하세요
하드웨어를 선택하기 전에 추론 엔진, 그 특수 연산자, 의존하는 확장을 나열하세요. PyTorch 애플리케이션은 여러 실행 경로를 제공할 수 있지만, 특화된 확장은 그중 하나만 지원합니다. NVIDIA의 CUDA 또는 AMD의 ROCm에서 모델 로딩과 전처리를 포함한 전체 체인을 검증하세요.
결과를 기록하는 단계까지 파이프라인을 통과하는 최소 명령을 유지하세요. 그다음에야 최적화를 하나씩 활성화하세요. 정밀도, 컴파일, 엔진을 변경할 때마다 비교 가능한 품질 검사를 유지해야 합니다. 로딩 성공은 가중치를 읽을 수 있다는 것을 보여줄 뿐, 필요한 모든 계산 경로가 작동한다는 것을 보여주지는 않습니다.
처리 목표에 맞게 배치를 설정하세요
방법 예시: 길이별로 세 그룹의 텍스트를 구성한 다음, 각각을 1, 2, 4개 입력의 배치로 처리하세요. 이 크기는 시험 지점일 뿐 보편적인 권장 사항이 아닙니다. 각 조합마다 완료된 입력, 총 시간, 관측된 최대 메모리, 오류를 기록하세요. 한계가 나타나면 실패를 평균으로 감추지 말고 진행을 중단하세요.
대화형 서비스라면 대기열에서 보낸 시간을 추가하세요. 더 큰 배치는 처리량과 요청이 체감하는 지연을 바꿀 수 있으므로 하나의 평균만으로 선택하기에 충분하지 않습니다. 오프라인 처리라면 그룹화가 결과 순서를 섞지 않도록 하세요. 최종적으로 품질 기준과 지연 제약을 충족하는 구성을 선택하세요.
애플리케이션이 작업을 분산할 수 있다면 여러 GPU로 전환하세요
모델의 각 인스턴스가 한 카드에 들어간다면, 입력의 서로 다른 파티션을 소비하는 여러 워커를 구성할 수 있습니다. 이때 식별자, 재개, 출력 수집을 조정해야 합니다. 모델을 카드 간에 분할해야 한다면 엔진이 지원하는 병렬화 전략을 사용하고 그 통신 요구 사항을 확인하세요.
주문한 로트는 하드웨어 수량을 의미하며, 애플리케이션 배치나 통합 메모리 공간을 뜻하지 않습니다. B200의 경우 로트 하나에 카드 두 장이 포함되고, 다른 상품의 경우 로트 하나에 카드 한 장이 포함됩니다. 계획서에는 예정된 워커 수, 각 워커에 할당된 입력 비율, 작업이 실제로 완료되었는지 확인하는 방법을 명시하세요.
검증과 내보내기를 포함하는 기간을 선택하세요
3일 첫 대여라면 목표를 좁게 잡으세요. 설치, 파이프라인 검증, 첫 번째 활용 가능한 결과 산출입니다. 7일은 더 많은 변형을 시험하는 데, 30일은 반복 처리와 운영을 공고히 하는 데 쓸 수 있습니다. 이는 작업을 조직하는 방식이지 실행 시간을 보장하는 약속이 아닙니다.
마무리 단계에서는 가중치 또는 그 버전, 구성, 품질 검사, 실제로 얻은 측정값, 내보낸 결과를 보관하세요. 소프트웨어와 처리는 자율적으로 선택하며, Kernodeck은 그 내용을 검사하지 않습니다. 모델과 데이터 사용에 필요한 접근 권한, 백업, 허가를 직접 준비하세요.