之前写了 Cangjie Skill(蒸馏内容)和 nvwa-skill(蒸馏人),这两个项目负责「生成」Skills。那生成之后呢?谁来保证这些 Skills 的质量?
答案是这个系列的第三块拼图——达尔文.skill(Darwin Skill),一个让 AI Skills 自动进化的系统。
| 属性 | 值 |
|---|---|
| 星标 | 5087 ⭐ |
| 许可 | MIT |
| 版本 | 2.0(2026-05-28) |
| 安装 | npx skills add alchaincyf/darwin-skill |
| 亮点 | 微软研究院 SkillOpt 官方集成 |
核心能力:像训练模型一样优化你的 Agent Skills。评估 → 改进 → 测试 → 保留或回滚。一个只能向前转的棘轮。
(来源:GitHub README - darwin-skill)
当你有 10 个 Skills 时可以手动维护;当你有 60+ 个 Skills 时,你需要一个系统。
传统的 Skill 审查是纯结构性的:检查格式对不对、步骤有没有编号、路径能不能访问。但一个格式完美的 Skill,跑出来的效果可能很差。
达尔文.skill 同时评估结构质量和实际效果,然后只保留真正有改进的修改。
2.0 版本做了系统性升级,吸收了微软研究院 2026-05-22 的两篇论文(SkillLens 和 SkillOpt),微软也把达尔文列入了官方集成名单。
1. 九维评分标准
| 维度 | 说明 |
|---|---|
| 失败模式编码 | 把已知失败路径显式编码进 skill,不只是"告诉 agent 别犯错" |
| 可执行具体性 | 明文禁止「建议/可以考虑/根据情况」等模糊词 |
| 高风险行动黑名单 | 强制显式列出禁止的破坏性操作(rm -rf、git reset --hard 等) |
| 其他 6 维 | 结构完整性、触发条件清晰度、边界声明、测试覆盖等 |
2. 验证机制
3. 人在回路(Human in the Loop)
这是达尔文区别于全自动优化设计的核心:
4. 八条反例黑名单
| # | 禁止行为 |
|---|---|
| 1 | 同一个 AI 又改又评(LLM 自评准确率仅 46.4%) |
| 2 | 用 git reset --hard 当回滚手段 |
| 3 | 为凑分而堆冗余 |
| 4 | 跳过测试提示词直接评分 |
| 5 | 一轮内改多个维度 |
| 6 | 干跑比例 > 30% |
| 7 | 静默跳过异常 |
| 8 | 忽视维度相关簇 |
5. 实测验证数据
(来源:GitHub README)
| Skill | 做什么 | 输入 | 输出 |
|---|---|---|---|
| Cangjie | 蒸馏内容方法论 | 书/视频/播客 | 内容 SKILL.md |
| nvwa | 蒸馏人的思维框架 | 人名 | 人物 SKILL.md |
| Darwin | 让 SKILL.md 自动进化 | 已有的 SKILL.md | 优化后的 SKILL.md |
这三个项目组成了一个完整的 Skill 生态:生成 → 进化。
观点收尾:
达尔文.skill 是我见过最系统的 Skill 质量评估工具。它的九维评分标准和反例黑名单设计,即使你不跑自动优化流程,光是拿这些标准去检查自己的 SKILL.md,就能发现很多问题。
而且它有一个很少见的品质——知道什么时候该停。人在回路的三层守关、早停机制、反例黑名单的第 3 条"禁止为凑分堆冗余"——这些都说明作者不是为了展示效果而生造分数。
| 适合谁 | 不适合谁 |
|---|---|
| 有 5 个以上 Skills 需要维护的人 | 只有 1-2 个 Skill 的人(手动就够了) |
| 想提升 Skills 质量的开发者 | 不相信量化评分能反映质量的人 |
| 对 Skill 生态感兴趣的技术从业者 | 只想下载现成 Skill 用的普通用户 |
想了解 Skill 生态的另外两块拼图:Cangjie Skill(蒸馏内容)→ 评测文章,nvwa-skill(蒸馏人)→ 评测文章。
本文参考了以下资料,结合博主个人使用经验进行了二次创作:
- GitHub: alchaincyf/darwin-skill — README
- GitHub: kangarooking/cangjie-skill — 关联项目
- GitHub: xmg2024/nvwa-skill — 关联项目