达尔文·自主实验
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装技能 @user_df471c2d/darwin-skill。
技能介绍
技能优化中的挑战
在构建和维护 AI Agent 技能时,开发者常面临一个核心矛盾:如何平衡技能 SKILL.md 文件的结构规范性与实际运行效果?纯结构审查(如检查 frontmatter 或步骤编号)无法保证技能在真实场景中表现良好——一个格式完美的技能可能输出低质量结果。同时,手动优化迭代耗时费力,且容易陷入局部最优,缺乏自动化评估和安全回滚机制。
自主实验循环:核心机制
达尔文技能通过自主实验循环解决上述问题,其设计哲学借鉴了 Karpathy 的 autoresearch。核心流程是 评估 → 改进 → 实测验证 → 人类确认 → 保留或回滚,具体包含:
- 双重评估体系:采用 8 维度加权评分(总分 100),其中 6 个结构维度(如
Frontmatter质量、指令具体性)对SKILL.md进行静态分析;2 个效果维度(整体架构、实测表现)通过子 agent 执行测试 prompt,对比有无技能的输出质量。 - 棘轮机制:优化循环只保留总分严格高于基线的改进,自动回滚退步的变更,确保单调上升。
- 人在回路:每个优化步骤后暂停,由用户确认测试 prompt 设计和评分结果,避免自动化偏差。
- 探索性重写:当 hill-climbing 优化连续停滞时,可提议一次重写以突破局部最优,但需用户明确同意。
优化策略按优先级(P0-P3)排序,从效果问题(如输出偏离意图)到结构性问题(如缺少检查点),每轮只改一个维度。
适用边界与约束
达尔文技能专用于优化 AI Agent 的 SKILL.md 文件,遵循以下约束:
- 不改变核心功能:只优化“怎么写”和“怎么执行”,不改变“做什么”。
- 不引入新依赖:不添加原技能没有的脚本或资源。
- 单维度修改:每轮变更限制在一个维度,确保可归因。
- 文件大小控制:优化后
SKILL.md不超过原始大小的 150%。 - 可回滚:所有改动在 git 分支上进行,支持
git revert。
该技能适用于需要系统化迭代优化的 AI Agent 开发场景,尤其适合注重实测验证和版本管理的团队。
使用场景
- 当你开发了一个新 AI Agent 技能后,用达尔文对其进行 8 维度评分,并通过迭代优化循环改进其 SKILL.md 的结构清晰度和指令具体性。
- 在技能部署前,通过子 agent 执行测试 prompt,对比有无技能时的输出质量,验证技能是否真正解决了用户意图并提升了效果。
- 当需要批量优化多个技能时,按基线分数排序从最弱开始,每轮只改一个维度(如补充触发词或异常处理),确保变更可追溯。
- 当 hill-climbing 优化连续停滞时,提议一次探索性重写来突破局部最优,但暂停等待用户确认重写方案后再执行。
适合人员
- AI Agent 技能开发者:需要系统化迭代优化 SKILL.md 文件,确保结构规范和运行效果,并有实测验证环节。
- 技术文档维护者:负责 AI Agent 技能的文档质量,需评估 SKILL.md 的 frontmatter、步骤清晰度并改进可执行性。
- 产品测试工程师:需验证技能在实际场景中的效果,使用测试 prompt 对比有无技能的输出差异并量化评分。
- 技能项目经理:管理多个技能版本,需确保优化过程有人类确认步骤,避免自动化偏差并支持回滚。