从完整的训练步骤开始
你的首次试验应走完数据读取、前向传播、梯度计算和优化器更新。在增大批次之前,先测量这个完整循环。权重只占已用显存的一部分:激活值和训练状态同样必须容纳在 80 GB 之内。
保留一组具有代表性的输入序列,包括体积较大的样本。这样可避免根据第一个特别容易的批次来规划整个campaign的规模。
混合精度与受控对比
PyTorch 允许通过 autocast 为某些运算选择适配的精度。请在损失函数和验证标准上测试该设置。启用某个选项并不代表数值稳定性得到保证:请保留一次对比运行、指标以及确切的参数。
对于多卡,请区分每块 GPU 的批次与全局批次。进程数量和梯度累积与学习率一样,都是流程的一部分。
SXM、PCIe 还是更大显存
H100 PCIe 同样具备 80 GB 容量,对于以单卡为主的工作值得对比。若 GPU 之间需要频繁通信,请测量你的应用实际使用的拓扑;SXM 这一名称并不能替代这一检查。如果已确定的首要问题是每卡显存不足,请优先考虑 H200。
预订一段包含恢复的时间
选择 3 天来验证一次循环和一个检查点,7 天用于一组消融实验,或 30 天用于持续跟踪的实验。请把评估和导出纳入这份日程,而不仅仅是训练轮次。
在配置器中,选择 PyTorch 或自定义准备方案、批次数量和时长。在保存订单并选择加密货币结算之前,先创建账户或登录。“我已付款”按钮用于标记转账;付款跟踪始终可在您的账户中查看。