Darwin Skill
darwin-skill
Скилл для улучшения других скиллов: оценка SKILL.md по девяти критериям, правка, проверка тестовыми запросами и откат
Установка
npx skills add alchaincyf/darwin-skillЭто чужой код. Посмотрите файлы в репозитории перед установкой.
Что делает
Darwin Skill переносит идею автоматических экспериментов Карпатого из обучения моделей в работу со скиллами. Он оценивает SKILL.md по девяти критериям: структура, ясность шагов, описание сбоев, контрольные точки, конкретность, архитектура, результат на тестовых запросах и список запрещенных действий. Затем находит самое слабое место с учетом веса, правит только его, коммитит в git и отдает оценку двум независимым подагентам. Если результат не стал лучше, правка откатывается через git revert, а при слабом приросте цикл останавливается. После каждого скилла агент ждет подтверждения пользователя.
Для кого. Для тех, кто пишет и поддерживает десятки собственных скиллов и хочет улучшать их по измеримым критериям.
Подходит, если
- Скиллов накопилось много, и нужно понять, какие из них слабые
- Нужно улучшить конкретный скилл и проверить, что правка действительно помогла
- Нужно добавить в скилл обработку сбоев и список опасных действий
Не подходит, если
- Скиллы лежат вне git-репозитория
- Нужно написать скилл с нуля: для этого у автора есть отдельный скилл
Пример запроса к агенту
Оцени и улучши скилл release-notes, после каждой правки покажи дифф и изменение оценкиОграничения
SKILL.md и основной README на китайском, есть английская версия README. Работать нужно в git-репозитории, а локальные изменения скиллов перед запуском стоит закоммитить. Оценка подагентами и прогон тестовых запросов расходуют много токенов. Часть критериев отражает стилевые предпочтения автора.
Как отключить. Удалите папку darwin-skill из каталога скиллов, например ~/.claude/skills/darwin-skill.
Проверка безопасности
- Правит файлы скиллов и делает коммиты и откаты в git
- Запускает подагентов и тестовые запросы
Коротко о README
README объясняет связь с autoresearch Карпатого и изменения версии 2.0, основанные на двух статьях Microsoft Research о качестве скиллов. Описаны пять принципов, девять критериев оценки, пять этапов цикла оптимизации и механизм храповика, при котором оценка только растет. Установка одной командой npx skills или архивом. Лицензия MIT.
SKILL.md
--- name: darwin-skill description: "Darwin Skill 2.0 (达尔文.skill 2.0): autonomous skill optimizer, v2.0 integrates Microsoft Research SkillLens (arXiv 2605.23899) 9-dim rubric + SkillOpt (arXiv 2605.23904) validation-gated design + human-in-the-loop checkpoints. Evaluates SKILL.md files using a 9-dimension rubric (structure + effectiveness + meta-skill blacklists), runs hill-climbing with git version control, spawns independent judge agents for blind evaluation, validates improvements through test prompts with auto-break on diminishing returns, and generates visual result cards. Use when user mentions "优化skill", "skill评分", "自动优化", "auto optimize", "skill质量检查", "达尔文", "darwin", "帮我改改skill", "skill怎么样", "提升skill质量", "skill review", "skill打分"." --- # Darwin Skill 2.0 > **v2.0 · 2026-05-28** — 吸收 Microsoft Research SkillLens(arXiv 2605.23899)的 9 维评分药方 + SkillOpt(arXiv 2605.23904)的 validation-gated 验证机制 + human in the loop 三层守关。 > > 借鉴 Karpathy autoresearch 的自主实验循环,对 skills 进行持续优化。 > 核心理念:**评估 → 改进 → 实测验证 → 人类确认 → 保留或回滚 → 生成成果卡片** > GitHub: https://github.com/alchaincyf/darwin-skill --- ## 设计哲学 autoresearch 的精髓: 1. **单一可编辑资产** — 每次只改一个 SKILL.md 2. **双重评估** — 结构评分(静态分析)+ 效果验证(跑测试看输出) 3. **棘轮机制** — 只保留改进,自动回滚退步 4. **独立评分** — 评分用子agent,避免「自己改自己评」的偏差 5. **人在回路** — 每个skill优化完后暂停,用户确认再继续 与纯结构审查的区别:不只看 SKILL.md 写得规不规范,更看改完后**实际跑出来的效果是否更好**。
Частые вопросы
Почему оценивает не тот же агент, который правит?
Автор ссылается на исследование, где самооценка модели оказалась ненадежной, поэтому оценку делают независимые подагенты, и в каждом раунде новые.
Может ли скилл испортить мои файлы?
Каждая правка коммитится отдельно, а неудачные откатываются через git revert, без git reset --hard. Перед следующим раундом агент показывает дифф.
Похожие
Открытый личный AI-ассистент на своем компьютере: отвечает в Telegram, Slack, Discord и WhatsApp, расширяется скиллами и плагинами
Самообучающийся агент от Nous Research: терминал, мессенджеры, cron-задачи и скиллы, которые он пишет сам
Открытый агент для программирования в терминале и на десктопе с режимами разработки и планирования
Агент Anthropic для терминала, IDE и GitHub: понимает кодовую базу, выполняет задачи и работает с git