Inferensi: dari model yang dimuat ke layanan yang berguna
Anda ingin menghasilkan respons, mengekstrak representasi, atau memproses korpus. Mulailah dengan menentukan format input, ukurannya, dan frekuensi permintaan. Uji coba dengan input pendek tidak menggambarkan layanan yang harus menerima beberapa permintaan panjang secara paralel.
Alur inferensi membantu Anda menyiapkan kumpulan permintaan, pemeriksaan ketersediaan, dan pembacaan hasil. Anda kemudian dapat membandingkan GPU dan parameternya tanpa mengubah beban kerja yang diukur secara bersamaan. Luaran yang diharapkan adalah profil permintaan, prosedur peluncuran, dan kumpulan pengukuran yang disimpan bersama konfigurasinya.
Adaptasi: menyusun eksperimen yang dapat dilanjutkan
Mengadaptasi model berarti menghubungkan data pelatihan, metode, dan kriteria evaluasi. Sebelum eksekusi panjang, verifikasi satu langkah komputasi, penulisan checkpoint, dan pembacaannya kembali. Anda akan memiliki dasar konkret untuk memilih durasi paket dan ritme penyimpanan.
Alur adaptasi menawarkan organisasi per uji coba: hipotesis, parameter, luaran, dan keputusan berikutnya. Sisihkan satu kumpulan evaluasi untuk perbandingan, lalu simpan hasilnya meskipun uji coba tidak memberikan peningkatan yang diharapkan. Memahami hasil negatif dapat mencegah pengulangan pekerjaan yang sama.
Beberapa batch untuk pekerjaan yang terpisah dengan jelas
Ketika eksperimen bersifat independen, tetapkan konfigurasi, input, dan tujuan hasil untuk masing-masing eksperimen. Lalu tentukan tugas mana yang memakai kartu mana. Pengaturan ini cocok misalnya untuk perbandingan parameter atau pemrosesan partisi dari suatu korpus.
Sebaliknya, untuk satu model terdistribusi, siapkan mekanisme pendistribusian dan pertukaran yang dibutuhkan oleh program. Jumlah GPU dengan demikian menjadi bagian dari arsitektur perangkat lunak. Lembar spesifikasi perangkat dan panduan lingkungan membantu Anda menyelaraskan keputusan ini dengan pesanan Anda.