罗福莉 (Luo Fuli)

AI 研究员,DeepSeek V3 训练者之一,现任小米 MiMo 系列模型主导者。曾在量化交易领域工作,“总有方式去建模价格”是她当时的信条。

技术背景

  • 亲手写过预训练 pipeline,做过 loss spike(训练崩溃)排查,在几千张卡上跑过 1T 模型
  • 主导 Xiaomi MiMo V2 系列(Pro 思考与调度、Omni 多模态感知、TTS 语音输出)

核心判断

AI 范式

  • 框架比模型更重要:中层模型 + 好框架在大部分场景下接近顶尖模型 + 简单框架
  • 模型是消耗品,框架是资产:用顶尖模型一次性投资打造框架后,日常切换更便宜模型
  • Skills = 另类信息(Alpha):互联网访问不到的智能,企业规范、组织经验、个人教给 Agent 的执行标准

MiMo V2 架构选择

  • 选择 Hybrid Attention 而非 MLA:MLA 已做到完美临界点,无法利用 MTP(多 token 预测)加速;Hybrid 保留计算富余,MTP 正好利用
  • Flash 100-150 TPS,Pro 60-100 TPS(远超常见千亿模型的 30-50 TPS)
  • MTP 是”后验的意外之喜”,不是精心规划出来的

AGI 时间线

  • 两个月前判断 AGI 还需 2 年以上,现在改口 2 年内
  • 目前进度约 20%,年底可能到 60-70%
  • 中美顶尖模型代差:2-3 个月(不是年)
  • Agent 已能训模型,1-2 年内可能实现 Agent 训出比人更好的模型,“左脚踩右脚向上提升”
  • Post Train 算力正追平 Pre Train(从 35:1 到 1:1)

管理哲学

  • 层级制度默认”上面的人有超越所有人的智能”,这个界定在 Agent 时代”非常奇怪”
  • 带 100 人团队但核心迭代仅 20-30 人,没有组、没有 leader、没有 deadline
  • 管理三关键词:热爱(创造体验)、环境(看 checkpoint 上限)、蒸馏(MOPD 多教师在线策略蒸馏)
  • 不发论文,越少越好。不看学术会议论文
  • 群体智能是乘积不是加法
  • 从”总有方式去建模价格”转向”做符合价值观的事”

团队组织实践

  • 春节让团队玩 OpenClaw,不达 100 轮对话可 quit(并非真考核,目的是创造体验)
  • 倾向招大二大三的学生,看重 checkpoint 上限而非 supervised 后的状态
  • 团队 3-4 周完成以前 30-40 周的研究量