Amazon SageMaker Inference 推出 prefix-aware routing 降低 LLM 延迟
Amazon SageMaker Inference 推出 prefix-aware routing 降低 LLM 延迟
Amazon SageMaker Inference 现已提供 prefix-aware routing 路由策略。该策略将共享相同 prompt prefix 的请求发送到同一实例,使 KV cache 保持温暖。在 Llama 3.1 70B 的基准测试中,这一方法将 P50 time-to-first-token 最多降低了 77%。
prefix-aware routing 的路由策略定义
prefix-aware routing 是一种新的路由策略。它依据请求中的 prompt prefix 来决定目标实例。所有携带相同 prefix 的推理请求会被定向到同一个实例上。这种路由方式不同于传统的随机或轮询分发,而是有意识地让具有相似开头的提示词请求聚集在一起。
该策略的核心在于识别 prompt 的前缀部分。当前缀匹配时,请求不会分散到集群内的多个不同实例,而是集中处理。这种设计直接服务于后续的缓存机制,避免了不必要的跨实例数据迁移。
KV cache 保持温暖的具体机制
当请求被路由到同一实例后,KV cache 得以维持温暖状态。KV cache 记录了先前计算出的键值对,这些数据在生成后续 token 时可以直接复用,而无需从头重新计算。
如果请求分散到不同实例,之前的 KV cache 就无法被后续请求命中,导致每次新请求都需要完整的前向计算。prefix-aware routing 通过实例亲和性让后续共享 prefix 的请求能直接访问已预热的 cache,从而减少重复劳动。
这种机制在长上下文或对话式应用中特别有效,因为用户输入往往带有重复的系统提示或历史上下文。保持 cache 温暖直接缩短了从接收请求到输出第一个 token 的等待时间。
Llama 3.1 70B 基准测试的模型选择
基准测试选用了 Llama 3.1 70B 作为测试对象。这是一款参数规模达到 700 亿的大型语言模型,广泛用于各种生成式 AI 任务。
选择 Llama 3.1 70B 进行评测,反映了该模型在实际部署中对延迟敏感度高、KV cache 收益明显的特点。测试环境基于 Amazon SageMaker Inference 平台,模拟了真实生产流量下的路由行为。
P50 time-to-first-token 降低 77% 的数据
在 Llama 3.1 70B 的基准测试中,prefix-aware routing 将 P50 time-to-first-token 最多降低了 77%。P50 指标代表一半请求的首 token 生成时间,该数值的大幅下降意味着大多数用户能感受到显著的响应加速。
77% 的降幅来自对比实验,传统路由方式下首 token 延迟较高,而启用新路由策略后,相同负载下的中位数延迟被压缩到原来的不到四分之一。这一结果直接验证了路由策略对端到端用户体验的改善。
KV cache 相关指标的改进
除了时间指标,测试还显示 KV cache 命中率得到提升。更高的命中率意味着更多计算可以复用已缓存的结果,进一步降低整体算力消耗。
命中率上升直接关联到 prefix 路由的有效性。当更多请求命中同一实例的 cache 时,系统避免了大量冗余的注意力计算。这一改进在高并发场景下尤为重要,能同时带来延迟降低和吞吐量潜在提升。
SageMaker Inference 上的功能落地
prefix-aware routing 已作为新功能在 Amazon SageMaker Inference 上落地。用户可以在创建端点或更新推理配置时选择这一路由策略,无需修改模型本身或应用代码。
该功能与 SageMaker 现有的扩缩容、监控工具无缝集成。开发者可以继续使用熟悉的 SageMaker 接口,同时获得 KV cache 优化带来的性能收益。这一落地方式降低了企业将大模型投入生产的门槛。
通过在 SageMaker Inference 上直接提供 prefix-aware routing,AWS 为大规模 LLM 部署提供了更高效的推理路径。实际应用中,用户只需调整少量配置即可启用该策略,快速享受到基准测试中展示的延迟优化效果。
整体来看,这一路由策略聚焦于 LLM 推理链路中的关键瓶颈,通过智能流量调度实现 cache 复用。Llama 3.1 70B 上的测试数据为有意采用该功能的团队提供了具体参考。
相关阅读
- 原文作者:知识铺
- 原文链接:https://index.zshipu.com/ai002/post/20260910/Amazon-SageMaker-Inference-%E6%8E%A8%E5%87%BA-prefix-aware-routing-%E9%99%8D%E4%BD%8E-LLM-%E5%BB%B6%E8%BF%9F/
- 版权声明:本作品采用知识共享署名-非商业性使用-禁止演绎 4.0 国际许可协议进行许可,非商业转载请注明出处(作者,原文链接),商业转载请联系作者获得授权。
- 免责声明:本页面内容均来源于站内编辑发布,部分信息来源互联网,并不意味着本站赞同其观点或者证实其内容的真实性,如涉及版权等问题,请立即联系客服进行更改或删除,保证您的合法权益。转载请注明来源,欢迎对文章中的引用来源进行考证,欢迎指出任何有错误或不够清晰的表达。也可以邮件至 sblig@126.com