Подготовить полную программную миграцию
Составьте список компонентов, выполняющих вычисления на GPU: PyTorch, библиотеки внимания, квантование и возможные собственные операторы. Переносимый скрипт Python может зависеть от расширения, предназначенного исключительно для CUDA. Проверьте каждый компонент на выбранной версии ROCm, прежде чем запускать крупную кампанию.
В PyTorch для ROCm интерфейсы torch.cuda по-прежнему используются для обозначения GPU. Поэтому не заменяйте механически все вхождения на «hip»: определите установленный бэкенд и протестируйте небольшое реальное вычисление.
Использовать 192 ГБ с помощью репрезентативного теста
Эта емкость дает место для объемных моделей, активаций или кэшей. Она не позволяет по одной лишь себе определить максимальный размер модели: точность, длина входов, метод адаптации и временные пространства меняют общую потребность.
Подготовьте сценарий, который включает ваши самые длинные входы и полную резервную копию. Сравнивайте численные результаты миграции с допуском, определенным для вашей задачи, а не с неявным требованием идентичных файлов между платформами.
Когда сохранить путь NVIDIA
Если для ключевого расширения нет работоспособного пути ROCm, H200 SXM на 141 GB может упростить проект, оставшись в рамках CUDA. Для уже переносимого программного обеспечения, но с меньшей нагрузкой, сравните также реальную потребность с картой на 80 GB. Дополнительная память должна решать выявленную проблему, а не просто заменять диагностику.
Разбить аренду на этапы проверки
Используйте 3 дня, чтобы установить, протестировать и зафиксировать расхождения; 7 дней, чтобы стабилизировать зависимости и сравнить ваши выходные данные; 30 дней для кампании, чей путь ROCm проверен. Записывайте дистрибутив системы и версии библиотек в манифест.
Выберите MI300X, длительность, партии и подготовку, подходящую для вашего стека ROCm. Имя, фамилия и email остаются контактными данными заказа; никакие документы для KYC не требуются. Затем выберите криптоспособ и сообщите о переводе с помощью «Я оплатил».