model-internals (10)TransformersTransformers — KV cache 体系本页总览数据截至 2026-08-27(上游 commit b6c0bfe04c82)04 · KV cache 体系 这一章讲什么: 自回归推理的显存大头与性能命脉——KV cache——在 v5 里怎么组织。核心是一个二级抽象:Cache 是容器,CacheLayerMixin 的子类们是每层的存取策略。读完你能选对 cache 类,也知道滑窗、静态、量化、线性注意力各自的代价。 1. 它要解决的小问题