Memulai dari satu langkah pelatihan yang lengkap
Percobaan pertama Anda harus mencakup pembacaan data, forward pass, penghitungan gradien, dan pembaruan optimizer. Ukur siklus lengkap ini sebelum menambah batch. Bobot hanyalah sebagian dari memori yang terpakai: aktivasi dan status pelatihan juga harus muat dalam 80 GB.
Simpan urutan input yang representatif, termasuk contoh yang besar. Anda akan menghindari mengukur seluruh kampanye berdasarkan batch pertama yang sangat mudah.
Presisi campuran dan perbandingan terkendali
PyTorch memungkinkan pemilihan presisi yang sesuai untuk operasi tertentu dengan autocast. Uji pengaturan ini pada fungsi loss dan kriteria validasi Anda. Opsi yang diaktifkan bukan bukti kestabilan numerik: simpan eksekusi pembanding, metrik, dan parameter yang tepat.
Untuk beberapa kartu, bedakan batch per GPU dari batch global. Jumlah proses dan akumulasi gradien adalah bagian dari protokol, sama seperti laju pembelajaran.
SXM, PCIe, atau lebih banyak memori
H100 PCIe tetap memiliki kapasitas 80 GB dan layak dibandingkan untuk pekerjaan yang sebagian besar single-card. Untuk pertukaran yang sering antar-GPU, ukur topologi yang benar-benar digunakan aplikasi Anda; nama SXM tidak menggantikan pemeriksaan ini. Pilih H200 jika masalah yang teridentifikasi terutama adalah kekurangan memori per kartu.
Memesan periode yang mencakup pemulihan
Pilih 3 hari untuk memvalidasi satu loop dan satu checkpoint, 7 hari untuk rangkaian ablation, atau 30 hari untuk eksperimen berkelanjutan. Sertakan evaluasi dan ekspor dalam jadwal ini, bukan hanya epoch pelatihan.
Di konfigurator, pilih persiapan PyTorch atau kustom, batch Anda, dan durasinya. Buat akun atau masuk sebelum menyimpan pesanan dan memilih pembayaran kripto. Tombol « J’ai payé » berfungsi menandai transfer; pemantauan pembayaran tetap terlihat di akun Anda.