AWS SageMaker AI 上小 LLM 推理基准测试:G7 与 G5、G6 实例对比
两个 30B MoE 模型的基准测试设置 AWS 在 SageMaker AI 上针对两个 30B Mixture-of-Experts 模型展开基准测试。这两个模型分别是 Qwen3-Coder-30B 和 NVIDIA Nemotron-3-Nano-30B。测试覆盖 G5、G6、G6e 以及 G7 GPU 实例,核心指标包括吞吐量、延迟和每 token 成本。 测试直接在 Amazon SageMaker AI 环境中运行,目的是让开发者了解不同 GPU 实例在实际小 LLM 推理场景下……