Понятное однокарточное приложение
Начните с процесса, который загружает свою модель, обрабатывает партию и экспортирует результат. Зафиксируйте размер входных данных и число запросов. Этот простой сценарий позволит определить, должны ли дальнейшие усилия быть направлены на память GPU, данные или логику Python.
С 80 ГБ вы можете исследовать более объёмные нагрузки, чем с картой на 24 или 48 ГБ, сохраняя при этом единое адресное пространство памяти. Однако предусмотрите запас для временных аллокаций вашего движка.
Наблюдать за передачами так же, как за ядром
Программа, которая перезагружает одни и те же данные между двумя вызовами, может тратить значительную часть времени вне полезных вычислений. Замеряйте отдельно подготовку CPU, передачу, выполнение и получение результата. Для измерений CUDA учитывайте асинхронное выполнение, чтобы не измерять только постановку задачи.
Проверьте работоспособность с вашей версией PyTorch и скомпилированными библиотеками проекта. Сохраните прогон без оптимизации как точку сравнения, прежде чем менять путь выполнения.
Сравнивать, не путая форматы H100
H100 SXM и H100 PCIe описывают не одну и ту же аппаратную конфигурацию. Выбирайте SXM, если ваше исследование оправдывает измерение его поведения для распределённых обменов. Выбирайте скорее H200, когда ваша однокарточная нагрузка превышает 80 ГБ. A100 SXM остаётся альтернативой, которую стоит рассмотреть для уже проверенной среды Ampere.
Арендовать, чтобы принять решение
Тариф на 3 дня может послужить для построения начального профиля. За 7 дней протестируйте несколько размеров партий и сохраните сравнительный отчёт; за 30 дней организуйте запуски и их отслеживание с помощью стабильных идентификаторов.
Выберите длительность, количество партий и подготовку в конфигураторе, затем создайте аккаунт или войдите. Оплата следует за выбранным активом и сетью. После вашего перевода «Я оплатил» добавляет отметку к заказу, которую вы найдёте в своём аккаунте Kernodeck.