Swiftlet

leonickson1/Swiftlet,基于 Swift + Metal 的端侧推理运行时(约 1 万行,Apache 2.0),专为 Qwen3-Next / Qwen3.5-3.6 MoE 混合架构设计。核心机制是专家流式(expert streaming):只把模型的小型稠密核心常驻内存,路由专家权重按需从 SSD 流式加载。

规格(4-bit)

模型磁盘峰值内存解码速度
Qwen3.6-35B-A3B18 GB2.6 GBM5 Mac 7–11 tok/s;iPhone 17 约 1 tok/s
Qwen3-Next-80B-A3B42 GB4.3 GBM5 Mac 4.5–5 tok/s

“4.3GB 跑 80B”的真相:不是把稠密 80B 压进 4.3GB,而是 MoE 稀疏激活——每 token 仅约 3B 参数激活(80B 版每层 512 专家路由 10 个),稠密核心 4-bit 约 2.5 GB,其余为磁盘专家数据块。

关键机制

  • 路由专家重打包为固定步长数据块存入 .qpack 容器;取专家用单次 pread(不用 mmap);热门专家 LFU+recency 缓存(命中率 43%–70%)。
  • 75% 层使用 Gated DeltaNet 线性注意力(固定状态,无增长 KV 缓存)→ 端侧长上下文优势。
  • 四种交付形态:SwiftletCore 包 / CLI / swiftlet-server(OpenAI 兼容回环 API)/ App Store 的 Priv AI。
  • 逐层与 mlx-lm 参考实现比对验证;借鉴 TurboFieldfare(Gemma 专家流式先驱)设计但从零实现。
  • 作者诚实声明:每 token 仅 ~3B 激活参数,“对话和写作像大模型,事实记忆像小模型”;项目与 Claude Code 协作构建。

来源

  • Swiftlet 源页(“iPhone 首次原生运行该级别模型”为作者声明,待第三方验证)