前缀缓存

Prefix Caching,在 LLM 推理中缓存共享前缀的 KV 值以避免重复计算的技术。当多个请求共享相同前缀(如系统提示词、对话历史)时,直接复用已计算的 KVCache,显著降低 Prefill 延迟与计算量。在滑动窗口注意力(SWA)架构下,传统”token 相等→KV 相等”假设被打破,需改用”窗口安全长度”匹配规则。小米 MiMo 线上前缀缓存命中率平均达 93%(高频用户超 95%)。

关联