为您的项目提供 GPU · 无 KYC 的加密货币支付 如何租用
简体中文
打开控制台
GPU 参数页 / KERNODECK

A100 SXM:保留 80 GB 的 Ampere 基础

A100 SXM 每块 GPU 提供 80 GB HBM2e 显存。该型号适合延续一个已在 Ampere 上验证过的 PyTorch 项目、比较不同训练变体,或在迁移到 Hopper 之前建立基准。

1 包含 GPUHBM2e
80每块显卡 GB

78 可用显卡.

所示显存为每块 GPU。选择时长,然后在配置器中选择批组数量。

3 jours

每批 1 块 GPU

US$120.00租用 3 jours

7 jours

每批 1 块 GPU

US$280.00租用 7 jours

30 jours

每批 1 块 GPU

US$990.00租用 30 jours

沿用原有参数继续项目

已知的环境可以减少新实验中的未知因素。请带上代码版本、依赖文件、参数设置以及一个小的评估数据集。在修改批次大小或优化器之前,先测试模型重新加载和数据格式。

可复现性是在项目层面构建的。更换 PyTorch 版本、硬件或算法后,相同的随机种子并不能保证结果一致;因此请保留条件和观察到的差异。

让 80 GB 服务于正确的阶段

在训练循环中负载最高的时刻测量显存,而不只是在导入模型之后。训练保留的状态比单纯的推理更多。梯度累积可用于使用更小的微批次进行训练,但它不会消除权重或优化器状态。

A100 支持多种计算格式,包括 BF16。根据运算和预期质量选择精度,然后保持相同规则以比较两次实验。

替代方案必须回应诊断结论

如果 80 GB 够用但你希望研究 Hopper,请用完全相同的协议比较 H100 SXM。如果你的分配已经溢出,则应考虑 141 GB 的 H200。相反,一个远低于 48 GB 的项目可以先在 RTX A6000 上试用,再分配更多容量。

预订并保留续跑能力

3 天适合复现一个目标结果;7 天留出尝试多个变体的空间;30 天可以组织更长的系列实验并设置断点。将每个检查点与其阶段对应,并在到期前测试其加载。

租用流程是先选择 A100、批次、时长和环境,然后填写联系方式。选择加密货币并转账后,使用「J’ai payé」。将订单号保留在实验日志中,以便关联硬件、时段和结果。