KVCache
Transformer 自回归推理中的 Key-Value 缓存机制。推理时将已计算的注意力 Key/Value 张量缓存复用,避免每生成一个 token 就重算全部前文,是降低推理延迟的核心技术。优化方向包括滑动窗口注意力(SWA,固定窗口淘汰旧 KV)、双池分治(Full/SWA 独立管理)、三级缓存(GPU 显存/CPU 内存/NVMe SSD 按热度流转)等。小米 MiMo 的 Hybrid SWA 架构将 KVCache 存储压缩至同级方案约 1/7。
Transformer 自回归推理中的 Key-Value 缓存机制。推理时将已计算的注意力 Key/Value 张量缓存复用,避免每生成一个 token 就重算全部前文,是降低推理延迟的核心技术。优化方向包括滑动窗口注意力(SWA,固定窗口淘汰旧 KV)、双池分治(Full/SWA 独立管理)、三级缓存(GPU 显存/CPU 内存/NVMe SSD 按热度流转)等。小米 MiMo 的 Hybrid SWA 架构将 KVCache 存储压缩至同级方案约 1/7。