Loop Engineering 2026:从 Karpathy 到 Anthropic 官方化
2026 年中,Loop Engineering 完成从”概念”到”产品化”的飞跃——Karpathy 发布《LOOPS.md》理论源头,Anthropic 推出官方《Getting started with loops》四层体系。
理论谱系
Karpathy LOOPS.md (思想源头,五条规则)
↓
Anthropic Getting started with loops (产品化,四层 Loop)
↓
/goal / /loop / /schedule (命令实现)
↓
Qoder CLI / Claude Code / Codex (工具落地)
↓
TMA1 v2 / 15 Loop 实操手册 (中国社区实践)
Karpathy《LOOPS.md》五条规则
Rule I: WRITE THE LOOP, NOT THE PROMPT
“如果你凌晨 3 点还在迭代一条消息,你还在 prompting 时代。”
五动词:gather → reason → act → verify → repeat。
Rule II: SEPARATE THE ROLES
三个角色,三个 context windows:
- Planner:把模糊人类句子转成 sprint spec,不许碰代码
- Generator:写所有东西,禁止给自己打分
- Evaluator:读 diffs,第一条信息就要被告之”代码是坏的,证明它”
Rule III: NEGOTIATE THE CONTRACT FIRST
Generator 写第一行代码之前,先提出”完成是什么样”。Evaluator 反驳。双方通过磁盘 markdown 文件争论,直到同意 checklist。
Rule IV: WRITE TO DISK, NOT TO CONTEXT
维护:
feature_list.jsonprogress.mdcontract.mdappend-only log.md(## [YYYY-MM-DD] op | title格式)
模型应该能够崩溃、丢失 session、然后通过读三个文件恢复到中断点。
Rule V: LET THE LOOP RESTART
反直觉:当前前沿模型最好的行为是当运行出错时愿意全部丢弃、重新开始。不要打断这个过程。
Anthropic 四层 Loop 路线图
| 层 | 类型 | 触发 | 适合场景 | 对应能力 |
|---|---|---|---|---|
| L1 | Turn-based | 检查动作 | 探索 / 临时修改 / 小任务 | 普通对话 + Skills |
| L2 | Goal-based | 停止条件 | 有明确验收标准的长任务 | /goal |
| L3 | Time-based | 触发节奏 | 定时检查外部状态 | /loop、/schedule |
| L4 | Proactive | 整套提示和流程 | 重复发生、边界清楚的工作流 | /schedule + /goal + Skills + Dynamic Workflows |
警告
没有停止条件的 Loop = Token 焚烧炉 没有验证步骤的 Loop = 自动化产生幻觉
/goal 命令的三要素
✅ 可衡量的结果(测试通过 / 分数达标 / 队列清空)
✅ 证明方式(跑哪个命令 / 看哪个报告)
✅ 边界条件(最多尝试几轮 / 哪些文件不能动)
对比:
❌ /goal 把这个项目优化好
✅ /goal npm test exits 0, npm run build exits 0,
homepage Lighthouse performance score is at least 90,
stop after 6 turns
升级策略
别一上来就上最复杂的 Proactive Loop,先从最小的 L1 开始,把能验证的东西写清楚,再逐步放权。
跨生态验证
- Harness-Engineering:相同思想,不同命名
- Skills-Ecosystem:Skill 自带验收标准呼应 L1
- Andrej-Karpathy:理论源头
- Skill-Zoo:解决技能分散问题
[2026-07-20] 官方《Getting started with loops》原文摄入补充
来源:Claude Code 官方下场:Loops 上手指南(Anthropic 官方博客 2026-06-30 编译)。本主题此前的”四层 Loop 路线图”即来自该官方指南;本次直接摄入原文,补充以下操作层细节:
- 官方定义:Loop = “agent 重复执行工作周期,直到满足一个停止条件”;用四维区分循环(怎么触发 / 怎么停止 / 用哪个原语 / 什么任务最适合)。
- Turn-based 的杠杆——可量化验证:把人工检查编码成
SKILL.md,应包含让 Claude 能看到 / 度量 / 与结果交互的工具或连接器(启动 dev server、点控件截图 before/after、检查 console 零报错、用 Chrome DevTools MCP 跑性能 trace)。“检查越量化,Claude 越容易自我验证。“(衔接 Skill Engineering) - Goal-based 的评估模型机制:每当 Claude 想停,一个评估模型检查停止条件,不满足就送回继续干——确定性标准(通过测试数、分数阈值)特别有效。
- Proactive 组合范式:
/schedule(查新报告)+/goal(定义”做完”)+ dynamic workflows(并行 worktree 探索三种解法 + judge 对抗性审查)+ auto mode(不停下来请求权限)。 - 维持代码质量四原则:保持代码库干净 / 给 Claude 验证自己工作的路(skills 编码”好是什么样”)/ 文档触手可及 / 第二 agent code review(
/code-review,新鲜上下文偏见更少)。“当某结果不达标,别停留在修掉这一个问题——把它编码进系统,让未来所有迭代都受益。” - Token 管理命令:
/usage(按 skills/subagents/MCP 拆解)、/goal无参(当前轮数+token)、/workflows(每 agent token,可随时停某 agent);确定性工作用脚本(比推理便宜);routine 间隔匹配被盯对象的变化频率。
跨主题互证:官方循环把”评估器”作为一等组件(评估模型 / judge / code-review 第二 agent),与同批 Agent 三重悖论综述 中”验证器层级决定自我改进持久性”的结论收敛——见 AI Agent 自我改进 与 AI Agent Evaluation。
[2026-08-10] Pi 的递归美学与 Boris Cherny 的 loop 宣言
Pi 的递归美学(引擎源码精读)
来源:从 Pi 窥见 Loop Engineering 的递归美学。OpenClaw 背后的引擎 Pi 给出 loop 工程的最简实现样本——整个引擎只有一种原语:循环,一切复杂行为都是循环套循环长出来的:
- 两层循环,职责单一:外层 agent-run loop(agent_start→agent_end,回答”这次请求是否真正结束”,管任务边界);内层 turn loop(一次 assistant 响应 + 其工具调用 + 工具结果,管阶段节奏)。子 Agent 内部再嵌套完整同构 loop——“递归美学”的字面含义。
- 无打断交互 = 循环里的普通状态检查:steeringQueue(中途插话)在当前 turn 结束后、下次请求模型前注入上下文;followUpQueue(追问)在 agent 打算结束时检查,有货就再跑一轮。“用户随时可以说话”没有任何特殊路径。
- 极简与生产级并存:核心循环引擎几百行、系统提示词不足 1000 token;但截断保护毫不含糊——模型输出被 token 上限截断时,该消息所有工具调用整批标记失败、一个都不执行(执行一个参数残缺的 write 可能毁掉用户文件)。“循环本身不复杂,把循环包装成能用的产品才复杂。”
- Graph vs Agent 的最终答案:Graph 把控制流写在图的结构里;Agent 模式把控制流交给模型、把确定性做进运行时。与 Graph Engineering 的”图是 loop 的组织方式,不是替代品”互相印证。
? 口径注记:本篇称 Pi 默认工具只有 read/bash/edit/write 四个,与既有 Pi-Coding-Agent 实体页所载 7 个内置工具不一致(版本差异或”默认 vs 内置”口径不同),详见源页矛盾标注。
Boris Cherny:“我的工作是写循环”
来源:Claude Code 创始人亲自示范。Claude Code 创始人 Boris Cherny 的原话是 loop 工程叙事的核心一手引文:
“I don’t prompt Claude anymore. I have loops that are running… My job is to write loops.”(我不再给 Claude 写提示词了,我的工作是写循环)
配套实践:一切重复操作编码为斜杠命令/子智能体/钩子/MCP,验证跑在 AI 循环内部(“循环只在现实说’过了’的时候才往前走,不是 AI 自己说’我觉得行’就行”),工程师的位置”从打字的人,变成做判断的人”。另见 复合工程(循环之上的规则复利)。
? 批判性旁注:认知债与意图债 源作者提示”Loop Engineering 多少带点 Token 生意的意思”——对本主题的流行叙事保留一分警觉。