[参考页面](<https://kernodeck.com/zh/usages/inference>)

# 为你的推理应用程序选择 GPU。

批量 Embeddings、图片排序或交互式应用：在 Kernodeck 租用适合你自己推理需求的 GPU。从 24 GB 的 RTX 4090 开始，1 块 GPU 7 天批次仅需 110.00 USD。根据你实测的显存和 CUDA 工具链选择容量；应用的准备和运维由你掌控。

- 批量或交互式处理
- 三档 7 天预算
- 你的引擎，你的设置

[选择 RTX 4090 · 7 天](<https://kernodeck.com/zh/compute/configure?config=rtx-4090&days=7>)

在 Kernodeck，此 GPU 租用流程无需身份证件，也不进行 KYC 流程。需要账户：名字、姓氏、邮箱和密码；这并不意味着匿名。

推理租赁

一款为你的应用程序打造的套餐，按负载选择容量：租用前比较 24、48 和 80 GB。

## 关键信息

| 信息 | 详情 |
| --- | --- |
| 周期与单位 | 3、7 或 30 天的单批套餐。一批包含 1 块 GPU，B200 除外：2 块 GPU，已计入其价格。 |
| 可用性 | 各优惠中按型号申报的数量。这些数量不预留未来供应量，也不代表供应日期。若您的项目对此有要求，请在购买前确认托管国家和服务区域。 |
| 无需 KYC | 在 Kernodeck，此 GPU 租用流程无需身份证件，也不进行 KYC 流程。需要账户：名字、姓氏、邮箱和密码；这并不意味着匿名。 |
| 准备 | Ubuntu、PyTorch、Blender 或定制需求。版本、CPU、RAM、存储、网络和访问方式需根据项目确认；它们的包含不能从 GPU 型号推断。 |
| 价格与条款 | 金额以美元计，涵盖整个批次和全部周期。税务状态和可能的费用需在适用条款中确认。 |

## 可用套餐

一批、整个周期的美元总价。显存按每块 GPU 计；申报库存按批计。

| 型号 | 每块 GPU 显存 | 每批 GPU 数 | 时长 | 批数 | 总价 | 申报库存（按批计） | 状态 | 配置 |
| --- | --- | --- | --- | --- | --- | --- | --- | --- |
| [NVIDIA GeForce RTX 4090 24GB](<https://kernodeck.com/zh/compute/rtx-4090>) | 24 Go | 1 | 7 天 | 1 | 110.00 USD | 265 | 适用于整卡 24 GB 显存即可承载的批处理负载。 | [配置此套餐](<https://kernodeck.com/zh/compute/configure?config=rtx-4090&days=7>) |
| [NVIDIA L40S 48GB](<https://kernodeck.com/zh/compute/l40s>) | 48 Go | 1 | 7 天 | 1 | 148.00 USD | 74 | 适用于每卡 48 GB 显存的交互式或多模态负载。 | [配置此套餐](<https://kernodeck.com/zh/compute/configure?config=l40s&days=7>) |
| [NVIDIA H100 SXM 80GB](<https://kernodeck.com/zh/compute/h100-sxm>) | 80 Go | 1 | 7 天 | 1 | 475.00 USD | 63 | 适用于显存需求超过 48 GB、并需要经过验证的 CUDA 栈的场景。 | [配置此套餐](<https://kernodeck.com/zh/compute/configure?config=h100-sxm&days=7>) |
| [NVIDIA B200 SXM](<https://kernodeck.com/zh/compute/b200>) | 180 Go | 2 | 7 天 | 1 | 2,071.00 USD | 4 | 两块各 180 GB 的 GPU，适用于能够组织其使用的应用。 | [配置此套餐](<https://kernodeck.com/zh/compute/configure?config=b200&days=7>) |

## 针对批量处理：先从需求出发，再到套餐

你想为一批文档生成嵌入，或对一组图像进行分类？如果你的 CUDA 流水线连同输入、临时数据和留出的实测余量都能装进该显存，那么 1 组 1 个 24 GB 的 GPU 租用 7 天、价格为 110.00 USD 的 RTX 4090 就是一个候选方案。这个套餐框定了你的硬件预算；文件数量、恢复规则和要保留的结果由你决定。

如果您的处理内存峰值超过此容量，可对比 L40S：148.00 USD，为 1 块 48 GB GPU 的 7 天套餐。它为按您实测的负载提供了更大的单卡空间。两者之间的选择取决于这一容量以及您软件链的兼容性，而不是任何承诺的文档数量。

对于相互独立的分区，B200 提供了另一种组织方式：2,071.00 USD，为 2 块各 180 GB GPU 的 7 天套餐，两张卡的费用已包含在此价格中。当您的应用能够在多个工作进程之间分配处理任务时，可对比此选项。它并不会将两块内存合并为一个 360 GB 的统一空间。

- [选择 RTX 4090 7 天 — 110.00 USD](<https://kernodeck.com/zh/compute/configure?config=rtx-4090&days=7>)
- [选择 L40S 7 天 — 148.00 USD](<https://kernodeck.com/zh/compute/configure?config=l40s&days=7>)
- [查看用于分布式处理的 B200 套餐](<https://kernodeck.com/zh/compute/b200>)

## 用于交互式应用：为完整负载选择内存

助手或内部工具需要考虑并发请求、其长度以及引擎自身特有的缓存。L40S 为 148.00 USD，即 1 块 48 GB GPU 的 7 天套餐，如果该完整负载能够放入其内存，且您的引擎支持其 CUDA 链，那么它是一个候选方案。您对队列和响应的实测结果仍是选定配置的标准。

如果您需要单卡上更大的内存，可对比 H100 SXM：475.00 USD，为 1 块 80 GB GPU 的 7 天套餐。它增加了单 GPU 的容量；但仅凭这一点并不足以保证您应用的延迟或吞吐量。如果您的需求在 24 GB 内已经足够，那么在购买更高档套餐之前，仍应对比 RTX 4090。

此方案是为您的应用提供的 GPU 租赁。托管推理 API 属于另一类服务：如果您首要寻找的是为您运维的调用端点，它可能适用。在 Kernodeck，您需要自行准备引擎、其依赖项及其运维；在选定环境之前，您项目所需的准备工作和访问方式仍需确认。

- [选择 H100 SXM 7 天 — 475.00 USD](<https://kernodeck.com/zh/compute/configure?config=h100-sxm&days=7>)
- [对比 L40S 及其套餐](<https://kernodeck.com/zh/compute/l40s>)
- [以 RTX 4090 回到 24 GB](<https://kernodeck.com/zh/compute/rtx-4090>)
- [准备您应用的软件链](<https://kernodeck.com/zh/docs/environnements-reproductibles>)
- [对比 3、7 和 30 天套餐](<https://kernodeck.com/zh/pricing>)

## 您的套餐，可直接用加密货币支付。

直接使用加密货币支付您的 Kernodeck 租赁，无需强制充值：例如 Bitcoin 上的 BTC 和 Tron 上的 USDT（TRC-20）等。流程不要求身份证件或 KYC 程序；账户需要名字、姓氏、电子邮件和密码，不承诺匿名。

- [对比八种支持的资产与网络](<https://kernodeck.com/zh/docs/crypto-payments>)

## 明确能证明您租赁合理性的交付成果

对于文件处理，要定义要遍历的数据量、输出格式和续跑规则。一个已完成的文件应当无需重读整个执行过程就能被识别。对于交互式服务，要定义请求的最大规模、可接受的时延以及容量达到上限时的行为。同一个模型根据这些约束可能需要两种截然不同的组织方式。

保留一个有代表性的样本，其中包含短的、常规的以及接近你上限的用例。在嵌入流水线中，把每个向量与其输入的标识符和版本关联起来。在文本生成中，记录用于评估的生成参数。你应当能够解释结果的差异，而不是立刻把它归因于 GPU。

## 为完整的推理负载选择内存

模型文件的权重并不能描述推理过程中使用的全部内存。还需要考虑临时张量、输入、保留的输出，以及对于相关模型而言，注意力机制的键值缓存。当序列变长或同时处理多个请求时，该缓存可能会变得很大。

先从一张内存足以在可衡量余量下完成代表性试跑的显卡开始。24、32、48、80 GB 及以上的型号满足不同的需求；没有任何一种容量能保证某个给定模型在其全部设置下都能跑通。降低精度或量化可能改变内存占用，但必须验证软件支持情况以及在你自己的输入上的输出质量。

- [比较目录中各显卡的内存容量](<https://kernodeck.com/zh/compute>)
- [找出消耗内存的阶段](<https://kernodeck.com/zh/docs/observer-un-lancement>)

## 选择与您软件链兼容的 GPU

在选择硬件之前，先列出推理引擎、其特殊算子以及你所依赖的扩展。一个 PyTorch 应用可能提供多条执行路径，而一个专用扩展只支持其中一条。要在 NVIDIA 的 CUDA 或 AMD 的 ROCm 上验证整条链路，包括模型加载及其预处理。

保留一条能贯穿整个流水线直到写出结果的最小命令。只有在此之后，才逐一启用你的优化。每一次精度、编译或引擎的更改都应保持可比的质量检查。加载成功只证明权重可读，并不证明所有必要的计算路径都能正常工作。

## 根据您的处理目标调整批量大小

方法示例：按长度把文本分成三组，然后分别以批大小为 1、2 和 4 的输入进行处理。这些大小只是试跑点，并非通用建议。对每种组合，记录已完成的输入、总耗时、观测到的最大内存以及错误。当出现上限时就停止推进，而不是把失败掩盖在平均值里。

对于交互式服务，还要加上在队列中等待的时间。更大的批处理可能改变吞吐量和一个请求所感受到的时延；仅凭一个平均值不足以做出选择。对于离线处理，要确保分组不会打乱结果的顺序。最终选择一种既满足你的质量准则又满足时延约束的配置。

## 如果您的应用能够分配工作，就扩展到多块 GPU

如果模型的每一份副本都能装进一张卡，你可以组织多个工作进程，各自消费输入的不同分区。此时需要协调标识符、续跑和结果收集。如果模型必须分散到多张卡上，就使用你的引擎所支持的并行策略，并核对其通信要求。

所订购的批次描述的是硬件数量，而非应用层批次或合并后的内存空间。对于B200，一个批次包含两张卡；对于其他方案，一个批次包含一张卡。请在您的方案中列明计划的工作进程数量、每个进程承担的输入份额，以及如何确认某项工作确实已经完成。

## 选择一段包含检查与导出的时长

首次租用3天时，请设定一个有限的目标：安装、验证流水线并产出第一个可用的结果。7天的时长可用于尝试更多变体；30天则可用于重复某项处理并巩固其运行。这些只是组织工作的方式，并非对执行时限的承诺。

输出时，请保留权重或其版本、配置、质量检查、实际获得的指标以及导出的结果。您可自主选择软件和处理方式；Kernodeck 不会对其内容进行检查。请自行准备好访问凭据、备份，以及使用模型和数据所需的授权。

## 购买前的问题

### 首次进行推理处理应选择哪个套餐？

如果您的 CUDA 流水线和具有代表性的批次在 24 GB 内仍有可测量的余量，请从 RTX 4090 开始对比：110.00 USD，为 1 块 GPU 的 7 天套餐。该套餐覆盖这一段租赁时间，并不限定您应用能够处理的文件数量。请在计划中保留安装、输出检查和导出环节；3 天和 30 天套餐可让您选择其他周期。

### 何时值得为 L40S 或 H100 SXM 支付更高费用？

当完整负载超出 24 GB 上的可用余量时，可对比 48 GB 的 L40S；如果您希望单卡拥有更大内存，再对比 80 GB 的 H100 SXM。7 天套餐的价格分别为 148.00 USD 和 475.00 USD，各自对应 1 块 GPU。请在测量中计入模型、输入、临时数据和缓存；更高的容量本身并不保证您应用获得更好的响应。

### 租赁是否包含可直接调用的推理 API？

此处介绍的方案是为您自己的应用提供的 GPU 租赁，不包含宣称可直接调用的托管推理 API。您自行选择引擎、模型、依赖项和设置，然后自行组织其运维。如果您的首要需求是托管服务，请单独对比这一类方案。若要在 Kernodeck 租赁，请确认您项目所需的准备工作和访问方式。

### B200 是否是多个同时处理的合理选择？

如果您的应用能够将相互独立的分区交给多个工作进程，或者支持显式分配，它就成为一个值得考虑的选项。在 7 天内为 2,071.00 USD，一个 B200 套餐已包含 2 块各 180 GB 的 GPU。各内存不会自动合并；分布式模型需要与您的引擎兼容的策略。如果单卡足以应对预期负载，也可对比其成本。

## 选择与配置

- [准备可复现的推理环境](<https://kernodeck.com/zh/docs/environnements-reproductibles>)
- [查看48 GB的NVIDIA方案](<https://kernodeck.com/zh/compute/l40s>)
- [查看用于ROCm链路的AMD方案](<https://kernodeck.com/zh/compute/mi300x>)
- [选择3天、7天或30天的时长](<https://kernodeck.com/zh/pricing>)
- [八种支持的加密货币组合](<https://kernodeck.com/zh/docs/crypto-payments>)
- [为推理选择一种算力配置](<https://kernodeck.com/zh/usages/inference>)
