两个 30B MoE 模型的基准测试设置

AWS 在 SageMaker AI 上针对两个 30B Mixture-of-Experts 模型展开基准测试。这两个模型分别是 Qwen3-Coder-30B 和 NVIDIA Nemotron-3-Nano-30B。测试覆盖 G5、G6、G6e 以及 G7 GPU 实例,核心指标包括吞吐量、延迟和每 token 成本。

测试直接在 Amazon SageMaker AI 环境中运行,目的是让开发者了解不同 GPU 实例在实际小 LLM 推理场景下的表现。G7 实例引入 NVIDIA Blackwell GPU,成为本次对比的重点对象。所有测试均围绕这两个具体模型展开,没有涉及其他参数规模或架构的模型。

G5 至 G7 实例的吞吐量对比

基准测试结果显示,在处理 Qwen3-Coder-30B 和 NVIDIA Nemotron-3-Nano-30B 时,不同实例的吞吐量存在差异。G7 实例在两个模型上的吞吐量均高于 G5 和 G6 系列。

G5 实例作为较早一代产品,在吞吐量上处于较低水平。G6 和 G6e 实例相比 G5 有一定提升,但仍落后于 G7。G7 凭借 Blackwell GPU 的架构优势,在相同批处理条件下实现了更高的 token 处理速率。

两个模型的吞吐量曲线随实例类型升级而逐步上升,其中 G7 的提升幅度最为显著。这表明在 SageMaker AI 上部署小 LLM 时,选择更新一代的 GPU 实例能直接带来吞吐量的改善。

各 GPU 实例的延迟表现分析

延迟是本次基准测试的另一核心指标。测试覆盖了 Qwen3-Coder-30B 和 NVIDIA Nemotron-3-Nano-30B 在 G5、G6、G6e、G7 实例上的端到端推理延迟。

G5 实例的延迟数值最高,尤其在处理较长上下文或较高并发时表现明显。G6 和 G6e 实例将延迟降低到一定范围,但仍未达到 G7 的水平。G7 实例的 Blackwell GPU 帮助将平均延迟控制在更低数值,特别是在批量推理场景中优势突出。

两个模型的延迟分布呈现相似规律:实例从 G5 向 G7 过渡时,p50 和 p95 延迟均有下降。NVIDIA Nemotron-3-Nano-30B 在 G7 上的延迟改善幅度略大于 Qwen3-Coder-30B,这可能与模型内部 MoE 路由机制对硬件的适配程度有关。

每 token 成本的实例间差异

成本效率是企业部署 LLM 时重点关注的维度。测试计算了两个模型在各实例上的每 token 成本。

G5 实例虽然单价相对较低,但由于吞吐量和延迟表现一般,每 token 成本处于较高位置。G6 和 G6e 实例在成本上有所优化,但仍不及 G7。G7 实例通过更高的吞吐量和更低的延迟,将每 token 成本显著拉低。

在相同工作负载下,G7 的每 token 成本相比 G5 可降低一定比例,G6 系列则处于中间水平。两个 30B MoE 模型的成本曲线均随实例升级而下降,其中 Blackwell GPU 带来的效率提升是关键因素。

G7 Blackwell GPU 的价格性能提升

G7 实例搭载 NVIDIA Blackwell GPU,在本次基准测试中展现出 measurable price-performance 优势。针对 Qwen3-Coder-30B 和 NVIDIA Nemotron-3-Nano-30B 的测试数据表明,G7 在吞吐量和延迟指标上的提升足以抵消潜在的实例单价差异,最终体现在更低的每 token 成本上。

Blackwell GPU 的架构改进直接服务于 MoE 模型的稀疏计算特性,使其在 SageMaker AI 推理任务中获得更高利用率。测试结果显示,G7 相比前代 G5 和 G6 实例,在价格性能比上取得可量化的进步。

这一提升并非来自单一指标,而是吞吐量增加、延迟降低和成本优化的综合结果。开发者在考虑 SageMaker AI 上部署 30B 规模 MoE 模型时,G7 的 price-performance 数据提供了清晰的决策参考。

SageMaker AI 上小 LLM 推理的实例推荐

综合基准测试结果,G7 实例适合对成本和性能都有较高要求的场景。Qwen3-Coder-30B 和 NVIDIA Nemotron-3-Nano-30B 在 G7 上的表现表明,当工作负载以推理为主且追求低每 token 成本时,Blackwell GPU 能带来实际收益。

G5 实例仍可用于实验、原型开发或对延迟不敏感的低并发任务。G6 和 G6e 实例则适合中等规模部署,在性能与成本之间取得平衡。

对于生产环境中的小 LLM 推理,建议优先评估 G7 实例,尤其当模型属于 30B MoE 类型时。SageMaker AI 提供的这些 GPU 选项,让开发者能根据具体吞吐量、延迟和成本目标灵活选择实例类型,最终实现更优的部署效率。

相关阅读