罗福莉 (Luo Fuli)
AI 研究员,DeepSeek V3 训练者之一,现任小米 MiMo 系列模型主导者。曾在量化交易领域工作,“总有方式去建模价格”是她当时的信条。
技术背景
- 亲手写过预训练 pipeline,做过 loss spike(训练崩溃)排查,在几千张卡上跑过 1T 模型
- 主导 Xiaomi MiMo V2 系列(Pro 思考与调度、Omni 多模态感知、TTS 语音输出)
核心判断
AI 范式
- 框架比模型更重要:中层模型 + 好框架在大部分场景下接近顶尖模型 + 简单框架
- 模型是消耗品,框架是资产:用顶尖模型一次性投资打造框架后,日常切换更便宜模型
- Skills = 另类信息(Alpha):互联网访问不到的智能,企业规范、组织经验、个人教给 Agent 的执行标准
MiMo V2 架构选择
- 选择 Hybrid Attention 而非 MLA:MLA 已做到完美临界点,无法利用 MTP(多 token 预测)加速;Hybrid 保留计算富余,MTP 正好利用
- Flash 100-150 TPS,Pro 60-100 TPS(远超常见千亿模型的 30-50 TPS)
- MTP 是”后验的意外之喜”,不是精心规划出来的
AGI 时间线
- 两个月前判断 AGI 还需 2 年以上,现在改口 2 年内
- 目前进度约 20%,年底可能到 60-70%
- 中美顶尖模型代差:2-3 个月(不是年)
- Agent 已能训模型,1-2 年内可能实现 Agent 训出比人更好的模型,“左脚踩右脚向上提升”
- Post Train 算力正追平 Pre Train(从 35:1 到 1:1)
管理哲学
- 层级制度默认”上面的人有超越所有人的智能”,这个界定在 Agent 时代”非常奇怪”
- 带 100 人团队但核心迭代仅 20-30 人,没有组、没有 leader、没有 deadline
- 管理三关键词:热爱(创造体验)、环境(看 checkpoint 上限)、蒸馏(MOPD 多教师在线策略蒸馏)
- 不发论文,越少越好。不看学术会议论文
- 群体智能是乘积不是加法
- 从”总有方式去建模价格”转向”做符合价值观的事”
团队组织实践
- 春节让团队玩 OpenClaw,不达 100 轮对话可 quit(并非真考核,目的是创造体验)
- 倾向招大二大三的学生,看重 checkpoint 上限而非 supervised 后的状态
- 团队 3-4 周完成以前 30-40 周的研究量