Loop Engineering 2026:从 Karpathy 到 Anthropic 官方化

2026 年中,Loop Engineering 完成从”概念”到”产品化”的飞跃——Karpathy 发布《LOOPS.md》理论源头,Anthropic 推出官方《Getting started with loops》四层体系。


理论谱系

Karpathy LOOPS.md (思想源头,五条规则)
       ↓
Anthropic Getting started with loops (产品化,四层 Loop)
       ↓
/goal / /loop / /schedule (命令实现)
       ↓
Qoder CLI / Claude Code / Codex (工具落地)
       ↓
TMA1 v2 / 15 Loop 实操手册 (中国社区实践)

Karpathy《LOOPS.md》五条规则

Rule I: WRITE THE LOOP, NOT THE PROMPT

“如果你凌晨 3 点还在迭代一条消息,你还在 prompting 时代。”

五动词:gather → reason → act → verify → repeat。

Rule II: SEPARATE THE ROLES

三个角色,三个 context windows:

  • Planner:把模糊人类句子转成 sprint spec,不许碰代码
  • Generator:写所有东西,禁止给自己打分
  • Evaluator:读 diffs,第一条信息就要被告之”代码是坏的,证明它”

Rule III: NEGOTIATE THE CONTRACT FIRST

Generator 写第一行代码之前,先提出”完成是什么样”。Evaluator 反驳。双方通过磁盘 markdown 文件争论,直到同意 checklist。

Rule IV: WRITE TO DISK, NOT TO CONTEXT

维护:

  • feature_list.json
  • progress.md
  • contract.md
  • append-only log.md## [YYYY-MM-DD] op | title 格式)

模型应该能够崩溃、丢失 session、然后通过读三个文件恢复到中断点。

Rule V: LET THE LOOP RESTART

反直觉:当前前沿模型最好的行为是当运行出错时愿意全部丢弃、重新开始。不要打断这个过程

Anthropic 四层 Loop 路线图

类型触发适合场景对应能力
L1Turn-based检查动作探索 / 临时修改 / 小任务普通对话 + Skills
L2Goal-based停止条件有明确验收标准的长任务/goal
L3Time-based触发节奏定时检查外部状态/loop/schedule
L4Proactive整套提示和流程重复发生、边界清楚的工作流/schedule + /goal + Skills + Dynamic Workflows

警告

没有停止条件的 Loop = Token 焚烧炉 没有验证步骤的 Loop = 自动化产生幻觉

/goal 命令的三要素

✅ 可衡量的结果(测试通过 / 分数达标 / 队列清空)
✅ 证明方式(跑哪个命令 / 看哪个报告)
✅ 边界条件(最多尝试几轮 / 哪些文件不能动)

对比

❌ /goal 把这个项目优化好
✅ /goal npm test exits 0, npm run build exits 0, 
   homepage Lighthouse performance score is at least 90, 
   stop after 6 turns

升级策略

别一上来就上最复杂的 Proactive Loop,先从最小的 L1 开始,把能验证的东西写清楚,再逐步放权。

跨生态验证

[2026-07-20] 官方《Getting started with loops》原文摄入补充

来源:Claude Code 官方下场:Loops 上手指南(Anthropic 官方博客 2026-06-30 编译)。本主题此前的”四层 Loop 路线图”即来自该官方指南;本次直接摄入原文,补充以下操作层细节

  • 官方定义:Loop = “agent 重复执行工作周期,直到满足一个停止条件”;用四维区分循环(怎么触发 / 怎么停止 / 用哪个原语 / 什么任务最适合)。
  • Turn-based 的杠杆——可量化验证:把人工检查编码成 SKILL.md,应包含让 Claude 能看到 / 度量 / 与结果交互的工具或连接器(启动 dev server、点控件截图 before/after、检查 console 零报错、用 Chrome DevTools MCP 跑性能 trace)。“检查越量化,Claude 越容易自我验证。“(衔接 Skill Engineering
  • Goal-based 的评估模型机制:每当 Claude 想停,一个评估模型检查停止条件,不满足就送回继续干——确定性标准(通过测试数、分数阈值)特别有效。
  • Proactive 组合范式/schedule(查新报告)+ /goal(定义”做完”)+ dynamic workflows(并行 worktree 探索三种解法 + judge 对抗性审查)+ auto mode(不停下来请求权限)。
  • 维持代码质量四原则:保持代码库干净 / 给 Claude 验证自己工作的路(skills 编码”好是什么样”)/ 文档触手可及 / 第二 agent code review/code-review,新鲜上下文偏见更少)。“当某结果不达标,别停留在修掉这一个问题——把它编码进系统,让未来所有迭代都受益。”
  • Token 管理命令/usage(按 skills/subagents/MCP 拆解)、/goal 无参(当前轮数+token)、/workflows(每 agent token,可随时停某 agent);确定性工作用脚本(比推理便宜);routine 间隔匹配被盯对象的变化频率。

跨主题互证:官方循环把”评估器”作为一等组件(评估模型 / judge / code-review 第二 agent),与同批 Agent 三重悖论综述 中”验证器层级决定自我改进持久性”的结论收敛——见 AI Agent 自我改进AI Agent Evaluation

[2026-08-10] Pi 的递归美学与 Boris Cherny 的 loop 宣言

Pi 的递归美学(引擎源码精读)

来源:从 Pi 窥见 Loop Engineering 的递归美学OpenClaw 背后的引擎 Pi 给出 loop 工程的最简实现样本——整个引擎只有一种原语:循环,一切复杂行为都是循环套循环长出来的:

  • 两层循环,职责单一:外层 agent-run loop(agent_start→agent_end,回答”这次请求是否真正结束”,管任务边界);内层 turn loop(一次 assistant 响应 + 其工具调用 + 工具结果,管阶段节奏)。子 Agent 内部再嵌套完整同构 loop——“递归美学”的字面含义。
  • 无打断交互 = 循环里的普通状态检查:steeringQueue(中途插话)在当前 turn 结束后、下次请求模型前注入上下文;followUpQueue(追问)在 agent 打算结束时检查,有货就再跑一轮。“用户随时可以说话”没有任何特殊路径。
  • 极简与生产级并存:核心循环引擎几百行、系统提示词不足 1000 token;但截断保护毫不含糊——模型输出被 token 上限截断时,该消息所有工具调用整批标记失败、一个都不执行(执行一个参数残缺的 write 可能毁掉用户文件)。“循环本身不复杂,把循环包装成能用的产品才复杂。”
  • Graph vs Agent 的最终答案:Graph 把控制流写在图的结构里;Agent 模式把控制流交给模型、把确定性做进运行时。与 Graph Engineering 的”图是 loop 的组织方式,不是替代品”互相印证。

口径注记:本篇称 Pi 默认工具只有 read/bash/edit/write 四个,与既有 Pi-Coding-Agent 实体页所载 7 个内置工具不一致(版本差异或”默认 vs 内置”口径不同),详见源页矛盾标注。

Boris Cherny:“我的工作是写循环”

来源:Claude Code 创始人亲自示范。Claude Code 创始人 Boris Cherny 的原话是 loop 工程叙事的核心一手引文:

“I don’t prompt Claude anymore. I have loops that are running… My job is to write loops.”(我不再给 Claude 写提示词了,我的工作是写循环)

配套实践:一切重复操作编码为斜杠命令/子智能体/钩子/MCP,验证跑在 AI 循环内部(“循环只在现实说’过了’的时候才往前走,不是 AI 自己说’我觉得行’就行”),工程师的位置”从打字的人,变成做判断的人”。另见 复合工程(循环之上的规则复利)。

批判性旁注:认知债与意图债 源作者提示”Loop Engineering 多少带点 Token 生意的意思”——对本主题的流行叙事保留一分警觉。

相关 Wiki