Amazon SageMaker Inference 推出 prefix-aware routing 降低 LLM 延迟
Amazon SageMaker Inference 推出 prefix-aware routing 降低 LLM 延迟 Amazon SageMaker Inference 现已提供 prefix-aware routing 路由策略。该策略将共享相同 prompt prefix 的请求发送到同一实例,使 KV cache 保持温暖。在 Llama 3.1 70B 的基准测试中,这一方法将 P50 time-to-first-token 最多降低了 77%。 prefix-aware routing 的路由策略定义 prefix-aware routing 是一种新的路由策略。它依据请求中的 prompt prefix 来决定目标实例。所有携带相同 prefix 的推理请求会被定向到同一个……