Skill 工程(Skill Engineering)

围绕 Agent Skills 的工程化方法论。


核心问题

  • Skills 良莠不齐,质量难评估
  • 跨编程工具复用难
  • Skill 不是 prompt,而是”什么算完成”的定义

设计原则

1. SKILL.md 自带验收

  • 写清楚”做什么”和”怎么验收”
  • 与 Anthropic 官方《Getting started with loops》L1 呼应

2. 跨工具 SSOT

  • ~/.agents/skills/ 唯一真实源
  • 各 Agent 工具目录软链接

3. 个人方法论 → Skill

  • 悟鸣”五步读文章”:chujianyun/skills
  • 专家知识蒸馏 Skill 模板
  • 16 个国民级 App 蒸馏 Skill

关键报告

  • skills-deep-research-report.md(500 行)
  • 专家知识蒸馏 Skill 设计模板.md

相关 Wiki

[2026-07-17] apple-design 蒸馏法 + sansheng-write 流水线法:Skill 工程两条路径实证

  • apple-design 蒸馏法(github.com/emilkowalski/skills,约 10.5k 星):从 Apple WWDC 设计演讲蒸馏 17 条设计和动效原则,再转成 Web 可落地写法。核心:可中断性(动画进行一半能抓回来、关闭到一半再拖回立刻跟随手势不等旧动画结束)、材质和层级(backdrop-filter 半透明、大表面更强模糊阴影/小控件更轻)、字体字距(大标题和正文不共用字距、大字更紧小字重可读性、行高跟字号一起调)。真正解决的是界面判断力——AI 不只知道动画怎么写,还要知道界面为什么会舒服。是”专家知识蒸馏 → Skill 模板”路径的标杆。
  • sansheng-write 流水线法(github.com/sandypoli-boop/sansheng-write):把公众号写作管成 CI 流水线——9 阶段状态机可恢复,每阶段后 verify 校验门(机器盘查不听模型自己说,听脚本量出来的数:正文字数、加粗密度、封面读图片像素验宽高比和分辨率)。失败自修:同一步连错 3 次才找人。去 AI 味双武器(人味种子不可改写 + 声纹库注入作者定稿开篇)。冷读审稿强制换模型家族(同门模型有同样语义盲区,换家族才照得出来)。6 对冻结黄金快照。学习飞轮对比手改定稿前后差异提炼规则存进规则库。227 项自动化测试 + 7 道质量硬门。
  • last30days 工程化旁证(4.6 万星 skill):有版本号、写死输出规矩、回归测试和质量评测。关键指令曾藏在文件第 1000+ 行导致模型读不到(团队三次自查才发现并挪到前面),翻车原因写进更新记录——把”1000 行指令翻车”当作可记录可修复的工程问题。
  • 强化本页核心论断”Skill 不是 prompt,而是’什么算完成’的定义”:apple-design 定义”什么算 Apple 风格完成”(17 条原则 + 可中断性判据),sansheng-write 定义”什么算一篇公众号文章完成”(227 测试 + 7 质量门 + 黄金快照),last30days 定义”什么算一份简报完成”(版本号 + 回归测试)。

来源:../sources/2026-07-17-AI-Agent开源工具生态

新增案例(2026-08-06 批次)

  • loop-me(Matt Pocock,in-progress):苏格拉底式拷问 27 轮发现用户工作中的重复循环,沉淀为 workflows/*.md 规格;设计哲学 “Push Right + Brief”(人=晚到的单次决策者,读简报不读草稿);完成标准:“implementer agent 能直接照着构建,不需再问任何问题”。来源:loop-me 实测
  • img2threejs 的防失控设计:每轮最多纠正 3 次、全流程最多 6 次,连续不达标即停下报告失败而非无限烧 token;状态持久化 .img2threejs/state.json 支持中断续跑——“重试上限 + 失败即停”是长流程 Skill 的必备护栏。来源:img2threejs 实测
  • create-whiteboard-video(维克兹,开源):九步视频生产流水线,关键节点设人工确认门禁(素材确认后才渲染)、单环节可局部返工(替换单图/重做单幕)、收尾出质检报告——“人负责把控方向,Agent 负责把长流程跑完”;开发调试自述耗 3 亿 token(注意口径:调试成本 ≠ 生产成本)。来源:create-whiteboard-video 源页

模式收敛:三个案例共同印证本页核心论断——生产级 Skill = 验收定义 + 质量门槛脚本 + 人工确认门 + 重试上限 + 状态持久化。“人工确认门”已升级为跨域收敛模式,见 人类确认门分析

[2026-08-12] 方法论书蒸馏:从“记住”到“会触发”

读书蒸馏法 补足了从长篇知识源构造 Skill 的六步流程:全书分析 → 多角色抽取框架/原则/案例/反例/术语 → 跨情境验证 → 写 trigger/non-trigger 与步骤 → 建依赖 → 压力测试和负触发。

它强化本页“Skill 不是 Prompt”的判断:

  • 摘要回答“书里说了什么”,Skill 回答“什么情况下该调用哪套判断”。
  • when-not-to-trigger 是适用边界,不是可选说明。
  • 至少两个跨情境正例和一个反例,才能证明方法不是复述原案例。
  • 多 Agent 可并行抽取视角,但最终冲突消解、证据归属和验收仍需统一主流程。

Learnscape 进一步提供交互模拟作为验证形式:让抽象规则变成可操纵状态,借运行中的反常结果暴露知识缺口。08-11 日报中的 SkillEval 则尝试以 Skill 文档层信号预测下游表现;代码尚未公开,暂视为值得跟踪的评测方向。

相关源