1. 在选择显卡之前先定义预期结果
选择一个能贯穿整个应用的样本。对于推理,从几个有代表性的输入和一种预期的输出格式入手。对于模型适配,规划一次短运行:它读取数据、执行一次更新并写出一个检查点。目的是在把最终数据量交给它之前,先验证完整路径。
举一个教学示例:你想对文档进行分类。准备十二个已标识的文档,其中包含多种长度,以及一个程序应当干净拒绝的案例。确定允许的类别和结果的存放位置。这十二个标识符必须在汇总中恰好各出现一次,并带有被接受的结果或明确的错误。这个场景应适配你自己的应用;它不假设任何特定模型或吞吐量。
左右滚动表格即可查看所有列。| 检查要点 | 启动前准备好的标准 |
|---|---|
| 输入 | 12 个唯一标识符;文件可读;预留一个无效案例。 |
| 结果 | 每个被接受的文档对应一个允许的类别;不出现凭空编造的标识符。 |
| 失败 | 每个被拒绝的文档都附有一个原因;不发生静默丢失。 |
| 试运行结束 | 接受数 + 拒绝数 = 12;报告和结果从一份副本中复核。 |
2. 选择后端、内存和套餐
先看项目所用的库。依赖 CUDA 会把你引向 NVIDIA 技术栈;选择 MI300X 方案则需要考察 ROCm 的支持情况,尤其是对扩展的支持。PyTorch 官方选择器会区分操作系统和计算平台:从另一台机器上照抄一条命令并不等于验证了兼容性。
接下来比较一个有代表性任务所需的内存:权重、输入、中间计算以及你方法自身的状态。仅看模型文件的大小是不够的。如果你还不知道峰值,就把这一点作为试点的目标,而不要仅凭参数量就宣称某个模型能够跑得下。
选择 3、7 或 30 天,以及 1 到 10 个批次。每个批次包含一张显卡,但 B200 除外,它包含两张。多张显卡不会自动对程序进行分配,也不会统一它们的内存。在时长中要为安装、校验、计算和导出预留时间;试点的那十二个文档是用来验证流程的,并不能机械地预测整个任务周期需要多久。
3. 准备一个能经受更换机器的目录
汇总代码版本、依赖项、数据和模型的引用、参数以及入口命令。另行说明如何提供所需的访问权限。指向您个人目录的路径不是传输流程:请将隐含的假设替换为参数,并从项目文件夹核对路径。
在配置中选择的 Ubuntu、PyTorch、Blender 或自定义准备方案表达的是你的需求。它并不证明你的项目、其扩展或授权已经安装好。描述必须存在的内容,然后在开始处理之前检查实际收到的环境。
对于我们的文档批次,保留一个不可变的试点输入、一个参数文件,以及每次试验单独的结果目录。还要写明如何复核汇总。这个目录不必很大;它要避免让成功取决于某个被遗忘的单元格、某个旧终端或某个未复制的文件。
projet/
README.md # 安装、启动、检查
requirements-rebuild.txt # 依赖项及其来源说明
config/pilote.json # 不含密钥的参数
data/pilote/ # 12 个允许的输入
src/ # 你的应用
runs/ # 每次试验一个子目录4. 重新核对订单,然后按照服务步骤操作
摘要应与您的选择一致:型号、时长、批次、显卡总数、准备工作和美元金额。总额是该时长的单批价格乘以批次数。B200 的单批价格已包含其两块显卡:请勿再乘以 GPU 数量。
首次下单时,请用名、姓、邮箱和密码创建账户。如果您已有账户,请登录;如果已登录,相关信息会自动预填。账户可让您在其他浏览器中查看订单和余额。整个流程无需 KYC 流程,也无需身份证明。
如需用加密货币支付,请使用对应结算所显示的数字资产、网络、地址、金额和截止时间。转账后,点击“我已支付”以记录您的申报。这并不代表资金已到账或资源已就绪。足够的美元余额也可全额支付租赁费用。随后请按照实际提供的准备信息和访问方式操作。
5. 在正式放量前检查启动情况
资源就绪后,请确认实际使用的解释器和已加载的环境。在运行您的应用之前,先执行最小诊断。成功导入 PyTorch 并不代表 GPU 计算可用;一次简单计算成功也无法验证模型的所有扩展。诊断文件夹中描述了这一推进过程,并提供可下载的资源。
然后在全新的输出目录中运行您的驱动程序。对于文档,请检查标识符、类别、成功数量和预期的拒绝情况。结合输入查看若干结果:语法上有效的输出对实际用途而言仍可能不正确。只有在写明哪些已通过、哪些仍需修正之后,才可切换到完整语料库。
如果启动失败,请记录第一个错误和已到达的步骤。在重装之前先检查解释器;在复制之前先检查路径;在增大批处理之前先检查输入大小。每次只改变一个因素。如果进程运行时间较长,请将其监控与用于启动它的交互式连接分开组织。
6. 获取可用证据并决定下一步
将结果及其总结复制到您控制的存储位置,然后重新审阅这份副本。确认其中包含理解该结果所需的参数和引用信息。不要将计算环境中的文件视为您唯一的备份。请在试点期间进行这项检查,不要等到租用期满。
对于训练,请在一个新进程中添加恢复测试。Kernodeck 迷你项目演示了一种在 CPU 上的方法;您的应用仍需验证自身的状态、精度和数据。对于独立文档,恢复则是指识别已完成的部分和需要重新处理的部分。
您的最终决定可以是启动计划中的量、修正环境或重新调整配置。请将这一决定及其理由一并保留。揭示不兼容性的试点是有价值的:它将模糊的问题转化为在投入更多计算之前需要解决的具体条件。