Amazon SageMaker Inference 推出前缀感知路由 降低 LLM 延迟
Amazon SageMaker Inference 推出前缀感知路由 降低 LLM 延迟 Amazon SageMaker Inference 现在提供前缀感知路由这一新路由策略。它将共享相同提示前缀的请求发送到同一实例,从而让 KV 缓存保持温暖。在 Llama 3.1 70B 模型基准测试中,这一功能将 P50 时间到首 token 减少高达 77%,同时提高了 KV 缓存命中率。 SageMaker Inference 前缀感知路由功能发布 Amazon SageMaker Inference 正式推出前缀感知路由功能。……