Tetapkan hasil yang membenarkan penyewaan Anda
Untuk pemrosesan berkas, tentukan volume yang akan diproses, format output, dan aturan pemulihan. Berkas yang selesai harus dapat dikenali tanpa membaca ulang seluruh eksekusi. Untuk layanan interaktif, tentukan ukuran maksimum permintaan, waktu tunggu yang dapat diterima, dan perilaku ketika kapasitas tercapai. Model yang sama dapat menuntut dua pengaturan yang sangat berbeda bergantung pada kendala ini.
Simpan sampel representatif dengan kasus pendek, umum, dan yang mendekati batas Anda. Dalam pipeline embeddings, kaitkan setiap vektor dengan pengenal dan versi inputnya. Dalam generasi teks, catat parameter generasi yang digunakan untuk evaluasi. Anda harus dapat menjelaskan perbedaan hasil tanpa langsung menyalahkan GPU.
Pilih memori untuk seluruh beban inferensi
Bobot berkas model tidak menggambarkan seluruh memori yang digunakan selama inferensi. Perlu juga mempertimbangkan tensor sementara, input, output yang disimpan, dan untuk model yang bersangkutan, cache key dan value dari attention. Cache ini dapat menjadi besar ketika sekuens memanjang atau beberapa permintaan diproses bersamaan.
Mulailah dengan kartu yang memorinya memungkinkan uji coba representatif Anda dengan margin terukur. Model 24, 32, 48, 80 GB dan lebih besar menjawab kebutuhan yang berbeda; tidak ada kapasitas yang menjamin model tertentu akan berjalan dengan semua pengaturannya. Mengurangi presisi atau kuantisasi dapat mengubah jejak memori, tetapi menuntut verifikasi dukungan perangkat lunak dan kualitas output pada input Anda sendiri.
Pilih GPU yang kompatibel dengan rantai perangkat lunak Anda
Daftarkan mesin inferensi, operator khususnya, dan ekstensi yang Anda andalkan sebelum memilih perangkat keras. Aplikasi PyTorch dapat menawarkan beberapa jalur eksekusi, sedangkan ekstensi khusus hanya mendukung satu. Verifikasi seluruh rantai pada CUDA untuk NVIDIA atau pada ROCm untuk AMD, termasuk pemuatan model dan prapemrosesannya.
Simpan perintah minimal yang menelusuri pipeline hingga penulisan hasil. Baru setelah itu, aktifkan optimasi Anda satu per satu. Setiap perubahan presisi, kompilasi, atau mesin harus mempertahankan kontrol kualitas yang sebanding. Pemuatan yang berhasil membuktikan bahwa bobot dapat dibaca; itu tidak membuktikan bahwa semua jalur komputasi yang diperlukan berfungsi.
Atur batch sesuai tujuan pemrosesan Anda
Contoh metode: buat tiga kelompok teks berdasarkan panjang, lalu proses masing-masing dengan batch 1, 2, dan 4 input. Ukuran ini berfungsi sebagai titik uji, bukan rekomendasi universal. Untuk setiap kombinasi, catat input yang selesai, waktu total, memori maksimum yang teramati, dan kesalahan. Hentikan kemajuan ketika batas muncul alih-alih menyembunyikan kegagalan dalam rata-rata.
Untuk layanan interaktif, tambahkan waktu yang dihabiskan dalam antrean. Batch yang lebih besar dapat mengubah throughput dan waktu tunggu yang dirasakan oleh suatu permintaan; satu rata-rata saja tidak cukup untuk memilih. Untuk pemrosesan offline, pastikan pengelompokan tidak mengacak urutan hasil. Akhirnya pilih konfigurasi yang memenuhi kriteria kualitas dan kendala waktu Anda.
Beralih ke beberapa GPU jika aplikasi Anda dapat mendistribusikan pekerjaan
Jika setiap salinan model muat pada satu kartu, Anda dapat mengatur beberapa pekerja yang mengonsumsi partisi input yang berbeda. Maka perlu mengoordinasikan pengenal, pemulihan, dan pengumpulan output. Jika model harus dibagi antar kartu, gunakan strategi paralelisme yang didukung oleh mesin Anda dan verifikasi persyaratan komunikasinya.
Paket yang dipesan menggambarkan jumlah perangkat keras, bukan batch aplikasi maupun ruang memori gabungan. Untuk B200, satu paket mencakup dua kartu; untuk penawaran lainnya, satu paket mencakup satu kartu. Cantumkan dalam berkas Anda jumlah pekerja yang direncanakan, porsi masukan yang dipercayakan kepada masing-masing, dan cara memastikan bahwa suatu pekerjaan benar-benar selesai.
Pilih periode yang mencakup kontrol dan ekspor
Untuk penyewaan pertama selama 3 hari, tetapkan tujuan yang terbatas: menginstal, memvalidasi pipeline, dan menghasilkan hasil pertama yang dapat digunakan. Durasi 7 hari dapat dimanfaatkan untuk menjajaki lebih banyak varian; 30 hari untuk mengulang suatu pemrosesan dan mengonsolidasikan operasinya. Ini adalah cara mengorganisasi pekerjaan, bukan janji waktu eksekusi.
Pada akhirnya, simpan bobot atau versinya, konfigurasi, pemeriksaan kualitas, metrik yang benar-benar diperoleh, dan hasil yang diekspor. Anda memilih perangkat lunak dan pemrosesan Anda secara mandiri; Kernodeck tidak melakukan inspeksi atas isinya. Siapkan sendiri akses, cadangan, dan izin yang diperlukan untuk penggunaan model dan data.