Swiftlet
leonickson1/Swiftlet,基于 Swift + Metal 的端侧推理运行时(约 1 万行,Apache 2.0),专为 Qwen3-Next / Qwen3.5-3.6 MoE 混合架构设计。核心机制是专家流式(expert streaming):只把模型的小型稠密核心常驻内存,路由专家权重按需从 SSD 流式加载。
规格(4-bit)
| 模型 | 磁盘 | 峰值内存 | 解码速度 |
|---|---|---|---|
| Qwen3.6-35B-A3B | 18 GB | 2.6 GB | M5 Mac 7–11 tok/s;iPhone 17 约 1 tok/s |
| Qwen3-Next-80B-A3B | 42 GB | 4.3 GB | M5 Mac 4.5–5 tok/s |
“4.3GB 跑 80B”的真相:不是把稠密 80B 压进 4.3GB,而是 MoE 稀疏激活——每 token 仅约 3B 参数激活(80B 版每层 512 专家路由 10 个),稠密核心 4-bit 约 2.5 GB,其余为磁盘专家数据块。
关键机制
- 路由专家重打包为固定步长数据块存入
.qpack容器;取专家用单次 pread(不用 mmap);热门专家 LFU+recency 缓存(命中率 43%–70%)。 - 75% 层使用 Gated DeltaNet 线性注意力(固定状态,无增长 KV 缓存)→ 端侧长上下文优势。
- 四种交付形态:SwiftletCore 包 / CLI / swiftlet-server(OpenAI 兼容回环 API)/ App Store 的 Priv AI。
- 逐层与 mlx-lm 参考实现比对验证;借鉴 TurboFieldfare(Gemma 专家流式先驱)设计但从零实现。
- 作者诚实声明:每 token 仅 ~3B 激活参数,“对话和写作像大模型,事实记忆像小模型”;项目与 Claude Code 协作构建。
来源
- Swiftlet 源页(“iPhone 首次原生运行该级别模型”为作者声明,待第三方验证)