<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>大模型推理 on 知识铺的博客</title>
    <link>https://index.zshipu.com/geek001/tags/%E5%A4%A7%E6%A8%A1%E5%9E%8B%E6%8E%A8%E7%90%86/</link>
    <description>Recent content in 大模型推理 on 知识铺的博客</description>
    <generator>Hugo -- gohugo.io</generator>
    <language>zh-CN</language>
    <lastBuildDate>Fri, 04 Sep 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://index.zshipu.com/geek001/tags/%E5%A4%A7%E6%A8%A1%E5%9E%8B%E6%8E%A8%E7%90%86/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>KV Cache 如何成为大模型推理的显存瓶颈</title>
      <link>https://index.zshipu.com/geek001/post/20260904/KV-Cache-%E5%A6%82%E4%BD%95%E6%88%90%E4%B8%BA%E5%A4%A7%E6%A8%A1%E5%9E%8B%E6%8E%A8%E7%90%86%E7%9A%84%E6%98%BE%E5%AD%98%E7%93%B6%E9%A2%88/</link>
      <pubDate>Fri, 04 Sep 2026 00:00:00 +0000</pubDate>
      <guid>https://index.zshipu.com/geek001/post/20260904/KV-Cache-%E5%A6%82%E4%BD%95%E6%88%90%E4%B8%BA%E5%A4%A7%E6%A8%A1%E5%9E%8B%E6%8E%A8%E7%90%86%E7%9A%84%E6%98%BE%E5%AD%98%E7%93%B6%E9%A2%88/</guid>
      <description>开篇 上一篇完整走了一遍前向传播：token 查表成向量，逐层经过 Transformer Block 用 Q、K、V 做自注意力。生成长序列时，如果不缓存 K 和 V，每一步都要对全部历史 token 重新计算注意力，导致计算量随长度线性增长。KV Cache 正是在这个基础上，通过存储历史 K V 来加速推理，但同时引入了显存瓶颈。 KV Cache 的核心作用是把已</description>
    </item>
  </channel>
</rss>
