Amazon SageMaker Inference 推出前缀感知路由 降低 LLM 延迟

Amazon SageMaker Inference 现在提供前缀感知路由这一新路由策略。它将共享相同提示前缀的请求发送到同一实例,从而让 KV 缓存保持温暖。在 Llama 3.1 70B 模型基准测试中,这一功能将 P50 时间到首 token 减少高达 77%,同时提高了 KV 缓存命中率。

SageMaker Inference 前缀感知路由功能发布

Amazon SageMaker Inference 正式推出前缀感知路由功能。该功能作为一种路由策略,专门针对大型语言模型推理场景设计。AWS 官方博客详细介绍了这一更新,标志着 SageMaker 在 LLM 推理优化方向又迈出重要一步。

这一发布直接指向降低推理延迟的核心需求。过去开发者在处理高并发 LLM 请求时,常面临 KV 缓存失效导致的重复计算开销。前缀感知路由的出现,为 SageMaker 用户提供了更高效的实例流量分配方式。

共享提示前缀请求的路由策略

前缀感知路由的核心在于其路由逻辑。当多个请求包含相同的提示前缀时,该策略会将它们定向发送到同一个计算实例。这种分配方式不再是简单的随机或轮询,而是基于提示内容的前缀相似性进行智能匹配。

这一设计充分利用了 LLM 推理的实际使用模式。许多应用场景下,用户查询往往共享通用指令、上下文模板或系统提示。这些共享部分构成提示前缀,通过路由策略实现同实例汇聚,避免跨实例分散导致的资源浪费。

KV 缓存保持温暖的具体机制

前缀感知路由通过将相同前缀请求发送到同一实例来维持 KV 缓存温暖。KV 缓存记录了先前计算的键值对,当后续请求复用相同前缀时,实例可以直接读取缓存内容,而无需从头重新计算。

这种机制让缓存状态在实例层面保持活跃。请求抵达后,实例能快速定位已缓存的前缀计算结果,跳过重复的前向传播步骤。整个过程依赖于路由层面的精准分配,确保缓存命中成为常态而非例外。

Llama 3.1 70B 基准测试的 TTFT 改善

在 Llama 3.1 70B 模型上进行的基准测试显示,前缀感知路由将 P50 时间到首 token 减少了高达 77%。这一指标直接反映用户感知到的首 token 生成速度,77% 的降幅意味着响应起始阶段显著加快。

测试环境聚焦真实 LLM 推理负载,涵盖不同前缀共享程度的请求分布。结果表明,当路由策略生效后,时间到首 token 的中位数获得大幅优化。这一数据来自 AWS 官方基准,为实际部署提供可靠参考。

KV 缓存命中率提升的量化效果

基准测试同时记录了 KV 缓存命中率的提升。前缀感知路由让更多请求能够复用已有缓存,直接推高命中率数值。更高的命中率意味着更少的计算资源消耗在重复前缀处理上。

这一量化结果与 TTFT 改善形成互补。缓存命中率上升直接驱动延迟降低,在 Llama 3.1 70B 测试中体现为整体效率的跃升。AWS 博客明确指出这一提升,为开发者评估功能价值提供具体依据。

前缀感知路由对 LLM 延迟的整体作用

前缀感知路由为 LLM 推理延迟优化带来系统性改善。它通过路由层面的创新,减少不必要的计算重复,让 SageMaker Inference 在处理大规模语言模型时更加高效。

这一功能特别适用于对话系统、代码补全和长上下文应用等场景。这些场景中提示前缀重复现象普遍,路由策略能稳定发挥作用。开发者可在 SageMaker 控制台或 API 中启用该路由模式,快速获得延迟收益。

AWS 持续在 SageMaker Inference 上投入推理加速技术。前缀感知路由的发布进一步丰富了优化工具集,帮助用户在不改变模型本身的情况下显著提升服务质量。未来更多 LLM 应用将借助这一能力实现更低延迟的实时交互。

相关阅读