开篇 上一篇完整走了一遍前向传播:token 查表成向量,逐层经过 Transformer Block 用 Q、K、V 做自注意力。生成长序列时,如果不缓存 K 和 V,每一步都要对全部历史 token 重新计算注意力,导致计算量随长度线性增长。KV Cache 正是在这个基础上,通过存储历史 K V 来加速推理,但同时引入了显存瓶颈。 KV Cache 的核心作用是把已……

阅读全文