大模型推理
大语言模型推理(LLM Inference)的系统工程与优化,涵盖 KVCache 管理、分级缓存、前缀缓存、调度策略、Prefill/Decode 阶段优化等。核心理念是”模型能力不缩减,精进的是推理系统工程能力”——同模型、同硬件下实现更高吞吐、更低延迟。代表方案如小米 MiMo 的 Hybrid SWA + MoE 架构全链路优化,将 KVCache 存储压缩至同级方案约 1/7。
大语言模型推理(LLM Inference)的系统工程与优化,涵盖 KVCache 管理、分级缓存、前缀缓存、调度策略、Prefill/Decode 阶段优化等。核心理念是”模型能力不缩减,精进的是推理系统工程能力”——同模型、同硬件下实现更高吞吐、更低延迟。代表方案如小米 MiMo 的 Hybrid SWA + MoE 架构全链路优化,将 KVCache 存储压缩至同级方案约 1/7。