Skill 工程(Skill Engineering)
围绕 Agent Skills 的工程化方法论。
核心问题
- Skills 良莠不齐,质量难评估
- 跨编程工具复用难
- Skill 不是 prompt,而是”什么算完成”的定义
设计原则
1. SKILL.md 自带验收
- 写清楚”做什么”和”怎么验收”
- 与 Anthropic 官方《Getting started with loops》L1 呼应
2. 跨工具 SSOT
~/.agents/skills/唯一真实源- 各 Agent 工具目录软链接
3. 个人方法论 → Skill
- 悟鸣”五步读文章”:chujianyun/skills
- 专家知识蒸馏 Skill 模板
- 16 个国民级 App 蒸馏 Skill
关键报告
- skills-deep-research-report.md(500 行)
- 专家知识蒸馏 Skill 设计模板.md
相关 Wiki
[2026-07-17] apple-design 蒸馏法 + sansheng-write 流水线法:Skill 工程两条路径实证
- apple-design 蒸馏法(github.com/emilkowalski/skills,约 10.5k 星):从 Apple WWDC 设计演讲蒸馏 17 条设计和动效原则,再转成 Web 可落地写法。核心:可中断性(动画进行一半能抓回来、关闭到一半再拖回立刻跟随手势不等旧动画结束)、材质和层级(backdrop-filter 半透明、大表面更强模糊阴影/小控件更轻)、字体字距(大标题和正文不共用字距、大字更紧小字重可读性、行高跟字号一起调)。真正解决的是界面判断力——AI 不只知道动画怎么写,还要知道界面为什么会舒服。是”专家知识蒸馏 → Skill 模板”路径的标杆。
- sansheng-write 流水线法(github.com/sandypoli-boop/sansheng-write):把公众号写作管成 CI 流水线——9 阶段状态机可恢复,每阶段后 verify 校验门(机器盘查不听模型自己说,听脚本量出来的数:正文字数、加粗密度、封面读图片像素验宽高比和分辨率)。失败自修:同一步连错 3 次才找人。去 AI 味双武器(人味种子不可改写 + 声纹库注入作者定稿开篇)。冷读审稿强制换模型家族(同门模型有同样语义盲区,换家族才照得出来)。6 对冻结黄金快照。学习飞轮对比手改定稿前后差异提炼规则存进规则库。227 项自动化测试 + 7 道质量硬门。
- last30days 工程化旁证(4.6 万星 skill):有版本号、写死输出规矩、回归测试和质量评测。关键指令曾藏在文件第 1000+ 行导致模型读不到(团队三次自查才发现并挪到前面),翻车原因写进更新记录——把”1000 行指令翻车”当作可记录可修复的工程问题。
- 强化本页核心论断”Skill 不是 prompt,而是’什么算完成’的定义”:apple-design 定义”什么算 Apple 风格完成”(17 条原则 + 可中断性判据),sansheng-write 定义”什么算一篇公众号文章完成”(227 测试 + 7 质量门 + 黄金快照),last30days 定义”什么算一份简报完成”(版本号 + 回归测试)。
新增案例(2026-08-06 批次)
- loop-me(Matt Pocock,in-progress):苏格拉底式拷问 27 轮发现用户工作中的重复循环,沉淀为
workflows/*.md规格;设计哲学 “Push Right + Brief”(人=晚到的单次决策者,读简报不读草稿);完成标准:“implementer agent 能直接照着构建,不需再问任何问题”。来源:loop-me 实测。 - img2threejs 的防失控设计:每轮最多纠正 3 次、全流程最多 6 次,连续不达标即停下报告失败而非无限烧 token;状态持久化
.img2threejs/state.json支持中断续跑——“重试上限 + 失败即停”是长流程 Skill 的必备护栏。来源:img2threejs 实测。 - create-whiteboard-video(维克兹,开源):九步视频生产流水线,关键节点设人工确认门禁(素材确认后才渲染)、单环节可局部返工(替换单图/重做单幕)、收尾出质检报告——“人负责把控方向,Agent 负责把长流程跑完”;开发调试自述耗 3 亿 token(注意口径:调试成本 ≠ 生产成本)。来源:create-whiteboard-video 源页。
模式收敛:三个案例共同印证本页核心论断——生产级 Skill = 验收定义 + 质量门槛脚本 + 人工确认门 + 重试上限 + 状态持久化。“人工确认门”已升级为跨域收敛模式,见 人类确认门分析。
[2026-08-12] 方法论书蒸馏:从“记住”到“会触发”
读书蒸馏法 补足了从长篇知识源构造 Skill 的六步流程:全书分析 → 多角色抽取框架/原则/案例/反例/术语 → 跨情境验证 → 写 trigger/non-trigger 与步骤 → 建依赖 → 压力测试和负触发。
它强化本页“Skill 不是 Prompt”的判断:
- 摘要回答“书里说了什么”,Skill 回答“什么情况下该调用哪套判断”。
when-not-to-trigger是适用边界,不是可选说明。- 至少两个跨情境正例和一个反例,才能证明方法不是复述原案例。
- 多 Agent 可并行抽取视角,但最终冲突消解、证据归属和验收仍需统一主流程。
Learnscape 进一步提供交互模拟作为验证形式:让抽象规则变成可操纵状态,借运行中的反常结果暴露知识缺口。08-11 日报中的 SkillEval 则尝试以 Skill 文档层信号预测下游表现;代码尚未公开,暂视为值得跟踪的评测方向。
相关源
- Claude 模型的上下文工程,新规发布了!(Thariq 复盘)(Skills 当轻量指南、避免过度约束;长 skill 拆多文件;后果严重领域仍需硬约束)
- 把方法论书蒸馏成可执行 Skills