准备一次完整的软件迁移
列出执行 GPU 计算的组件:PyTorch、注意力库、量化以及可能存在的自研算子。一个可移植的 Python 脚本可能依赖某个仅限 CUDA 的扩展。在启动大型任务之前,请针对所选 ROCm 版本逐一验证每个组件。
在 ROCm 版 PyTorch 中,仍使用 torch.cuda 接口来指定 GPU。因此不要机械地把所有出现的地方都替换成“hip”:先确认所安装的后端,再用一个小的真实计算来测试。
用一次有代表性的测试来发挥 192 GB 的作用
这一容量为大型模型、激活值或缓存提供了空间。它本身并不能推断出模型的最大规模:精度、输入长度、适配方法和临时空间都会改变总需求量。
准备一个包含最长输入和完整备份的测试用例。将迁移后的数值结果与你为任务设定的容差进行比较,而不是隐式要求各平台之间的文件完全相同。
何时保留 NVIDIA 路径
如果核心扩展没有可用的 ROCm 路径,141 GB 的 H200 SXM 可以在继续使用 CUDA 的情况下简化项目。对于已经可移植但负载更小的软件,也请将实际需求与 80 GB 显卡进行比较。额外的显存应当解决已确认的问题,而不只是替代诊断。
将租用拆分为验证阶段
用 3 天完成安装、测试并记录差异;用 7 天稳定依赖并比较输出;用 30 天开展已验证 ROCm 路径的完整实验。在清单中记录系统发行版和库版本。
选择 MI300X、时长、批次以及适配你 ROCm 技术栈的准备工作。名字、姓氏和邮箱仍是下单联系方式;不要求任何 KYC 身份证明文件。然后选择加密货币支付方式,并通过「J’ai payé」告知转账。