KV Cache 如何成为大模型推理的显存瓶颈
开篇 上一篇完整走了一遍前向传播:token 查表成向量,逐层经过 Transformer Block 用 Q、K、V 做自注意力。生成长序列时,如果不缓存 K 和 V,每一步都要对全部历史 token 重新计算注意力,导致计算量随长度线性增长。KV Cache 正是在这个基础上,通过存储历史 K V 来加速推理,但同时引入了显存瓶颈。 KV Cache 的核心作用是把已……
专注于Android、Java、Go语言(golang)、移动互联网、项目管理、软件架构