Transformer 推理为了不重算前面 token,会把所有 Key 和 Value 缓存下来——这就是 KV cache。短上下文时无所谓,但一旦到长上下文,事情失控: Llama2-13B 跑 128k context,KV cache 单独就吃 80GB——一张 A100 ...