Зрозумілий одноcarte-застосунок
Почніть із процесу, який завантажує модель, обробляє пакет і експортує результат. Зафіксуйте розмір входів і кількість запитів. Цей простий сценарій дає змогу визначити, чи наступні зусилля слід спрямувати на пам'ять GPU, дані чи логіку Python.
З 80 ГБ ви можете досліджувати більші навантаження, ніж із картою на 24 чи 48 ГБ, зберігаючи при цьому лише один домен пам'яті для керування. Однак передбачте запас для тимчасових виділень пам'яті вашого рушія.
Спостерігайте за передачами так само, як за ядром
Програма, яка перезавантажує ті самі дані між двома викликами, може витрачати значну частину часу поза корисним обчисленням. Вимірюйте окремо підготовку CPU, передачу, виконання та отримання результату. Для вимірювань CUDA враховуйте асинхронне виконання, щоб не вимірювати лише подання роботи.
Перевірте роботу з вашою версією PyTorch і скомпільованими бібліотеками проєкту. Збережіть спробу без оптимізації як точку порівняння, перш ніж змінювати шлях виконання.
Порівнюйте, не плутаючи формати H100
H100 SXM і H100 PCIe описують не ту саму апаратну конфігурацію. Виберіть SXM, якщо ваше дослідження виправдовує вимірювання його поведінки для розподілених обмінів. Натомість виберіть H200, коли ваше одноcarte-навантаження перевищує 80 ГБ. A100 SXM залишається альтернативою, яку варто розглянути для вже перевіреного середовища Ampere.
Орендуйте, щоб ухвалити рішення
Тариф на 3 дні може слугувати для встановлення початкового профілю. За 7 днів перевірте кілька розмірів пакетів і збережіть порівняльний звіт; за 30 днів організуйте запуски та їх відстеження зі стабільними ідентифікаторами.
Виберіть тривалість, кількість пакетів і підготовку в конфігураторі, а потім створіть обліковий запис або увійдіть. Оплата відповідає вибраному активу та мережі. Після вашого переказу «Я оплатив» додає позначку до замовлення, яку ви знайдете у своєму обліковому записі Kernodeck.