达尔文.skill:5087 Star 的开源 AI Skill 自动进化系统,微软研究院官方集成

Updated on in ai

达尔文.skill:让你的 AI Skills 自动进化的开源项目(5087 Star)

之前写了 Cangjie Skill(蒸馏内容)和 nvwa-skill(蒸馏人),这两个项目负责「生成」Skills。那生成之后呢?谁来保证这些 Skills 的质量?

答案是这个系列的第三块拼图——达尔文.skill(Darwin Skill),一个让 AI Skills 自动进化的系统。


项目概览

属性
星标 5087 ⭐
许可 MIT
版本 2.0(2026-05-28)
安装 npx skills add alchaincyf/darwin-skill
亮点 微软研究院 SkillOpt 官方集成

核心能力:像训练模型一样优化你的 Agent Skills。评估 → 改进 → 测试 → 保留或回滚。一个只能向前转的棘轮。

(来源:GitHub README - darwin-skill)


它解决了什么问题

当你有 10 个 Skills 时可以手动维护;当你有 60+ 个 Skills 时,你需要一个系统。

传统的 Skill 审查是纯结构性的:检查格式对不对、步骤有没有编号、路径能不能访问。但一个格式完美的 Skill,跑出来的效果可能很差。

达尔文.skill 同时评估结构质量实际效果,然后只保留真正有改进的修改。


2.0 的核心升级

2.0 版本做了系统性升级,吸收了微软研究院 2026-05-22 的两篇论文(SkillLens 和 SkillOpt),微软也把达尔文列入了官方集成名单。

1. 九维评分标准

维度 说明
失败模式编码 把已知失败路径显式编码进 skill,不只是"告诉 agent 别犯错"
可执行具体性 明文禁止「建议/可以考虑/根据情况」等模糊词
高风险行动黑名单 强制显式列出禁止的破坏性操作(rm -rf、git reset --hard 等)
其他 6 维 结构完整性、触发条件清晰度、边界声明、测试覆盖等

2. 验证机制

  • 多评委独立审查:每轮启动 2 个独立评委
  • 评委不复用:下一轮启动全新评委,避免锚定效应
  • 早停机制:单轮涨幅 < 1 分自动停手

3. 人在回路(Human in the Loop)

这是达尔文区别于全自动优化设计的核心:

  • Phase 1 基线评估 → 人工审报告,决定改什么
  • Phase 2 单维度优化 → CHECKPOINT 强制暂停,等用户确认
  • Phase 3 回归测试 → 涨幅低于阈值强制停手

4. 八条反例黑名单

# 禁止行为
1 同一个 AI 又改又评(LLM 自评准确率仅 46.4%)
2 用 git reset --hard 当回滚手段
3 为凑分而堆冗余
4 跳过测试提示词直接评分
5 一轮内改多个维度
6 干跑比例 > 30%
7 静默跳过异常
8 忽视维度相关簇

5. 实测验证数据

  • huashu-gpt-image skill:80.8 → 91.5 → 91.65(+10.85 分)
  • darwin-skill 自评:86.05 → 92.05 → 92.7(+6.65 分)

(来源:GitHub README)


它和其他两个 Skill 的关系

Skill 做什么 输入 输出
Cangjie 蒸馏内容方法论 书/视频/播客 内容 SKILL.md
nvwa 蒸馏人的思维框架 人名 人物 SKILL.md
Darwin 让 SKILL.md 自动进化 已有的 SKILL.md 优化后的 SKILL.md

这三个项目组成了一个完整的 Skill 生态:生成 → 进化


我的结论

观点收尾:

达尔文.skill 是我见过最系统的 Skill 质量评估工具。它的九维评分标准和反例黑名单设计,即使你不跑自动优化流程,光是拿这些标准去检查自己的 SKILL.md,就能发现很多问题。

而且它有一个很少见的品质——知道什么时候该停。人在回路的三层守关、早停机制、反例黑名单的第 3 条"禁止为凑分堆冗余"——这些都说明作者不是为了展示效果而生造分数。

适合谁 不适合谁
有 5 个以上 Skills 需要维护的人 只有 1-2 个 Skill 的人(手动就够了)
想提升 Skills 质量的开发者 不相信量化评分能反映质量的人
对 Skill 生态感兴趣的技术从业者 只想下载现成 Skill 用的普通用户

想了解 Skill 生态的另外两块拼图:Cangjie Skill(蒸馏内容)→ 评测文章,nvwa-skill(蒸馏人)→ 评测文章


本文参考了以下资料,结合博主个人使用经验进行了二次创作: