本地 AI 推理
本地 AI 推理指在终端设备(桌面 GPU、NAS、浏览器端)上运行大模型,而非依赖云端 API。其驱动力包括隐私保护、延迟优化和成本控制。开源模型生态(如 Gemma、Qwen 系列)和量化技术使模型可压缩至消费级显存,代表实践包括 Chrome 内置 Gemini Nano 和桌面端本地部署。
新进展(2026-08-06 批次)
- 专家流式(expert streaming)把端侧边界推进到 MoE 35B/80B:Swiftlet(Swift + Metal,约 1 万行)只把稠密核心常驻内存、路由专家权重按需从 SSD 流式加载——Qwen3-Next-80B-A3B 在 Mac 峰值内存仅 4.3 GB(每 token 约 3B 激活参数 + 4-bit),Qwen3.6-35B-A3B 可在 iPhone 17 原生运行(约 2.5 GB、~1 tok/s,作者称该级别首次)。机制:.qpack 固定步长数据块 + 单次 pread + LFU+recency 专家缓存(命中率 43%–70%);Gated DeltaNet 线性注意力层无增长 KV 缓存。局限:解码 4.5–5 tok/s(Mac)仅达交互可用下限,事实记忆受限于激活参数。来源:Swiftlet 源页。
- 本地语音栈:Voicebox(48,220 stars)——安装包约 500MB + 模型 350MB–8GB,七种本地 TTS 引擎 + Whisper 听写 + Qwen3 口语清理,MCP Server 供 Agent 发声。来源:Voicebox 实测。
- 本地私有 Deep Research:DeepSearcher(Zilliz)——LLM + Milvus 向量库,可切换 DeepSeek-R1/Qwen/Claude,敏感数据不出域。来源:DeepSearcher 源页。
新进展(2026-08-10 批次)
- 消费级本地多模态栈(照片语义搜索):Lap(Rust+Tauri,GPL-3.0,v0.3.0,1.5k+ stars)把文字搜图/相似图搜索/人脸识别(Beta)/智能标签全部跑在本机,底层是 CLIP + ONNX Runtime + InsightFace 的消费级本地栈——CLIP 做文字描述与图片的语义匹配,不上传任何照片。本地 AI 语义搜索正成为”散落硬盘的个人资产”类工具的标准件。来源:Lap 源页。
- 视频生成模型进入 16GB 显存:MiniMax H3(视频-音频联合生成)以”能省则省”组合(Pruned ≈20B + GGUF Q4_K_M 量化 ≈11.6GB + 32B 文本编码器 CPU offload + 12fps 出片 RIFE 插帧)在消费级硬件(RTX 4070 Ti Super 16GB + 64GB 内存)落地,显存峰值 ≈15.5GB、约 15 分钟一条 720p/10 秒带音频视频。与 LLM 侧 Swiftlet 专家流式形成双线呼应:4-bit 量化 + 组件放置策略(流式加载 / CPU offload)让消费级硬件跑大模型。来源:H3 部署攻略。
关联
- Open Source AI Models Infrastructure
- Swiftlet、Voicebox、DeepSearcher
- Lap、MiniMax(2026-08-10 批次)