Darwin Skill

darwin-skill

Скилл для улучшения других скиллов: оценка SKILL.md по девяти критериям, правка, проверка тестовыми запросами и откат

СкиллСредний риск

alchaincyf/darwin-skill

Установка

npx skills add alchaincyf/darwin-skill

Это чужой код. Посмотрите файлы в репозитории перед установкой.

Что делает

Darwin Skill переносит идею автоматических экспериментов Карпатого из обучения моделей в работу со скиллами. Он оценивает SKILL.md по девяти критериям: структура, ясность шагов, описание сбоев, контрольные точки, конкретность, архитектура, результат на тестовых запросах и список запрещенных действий. Затем находит самое слабое место с учетом веса, правит только его, коммитит в git и отдает оценку двум независимым подагентам. Если результат не стал лучше, правка откатывается через git revert, а при слабом приросте цикл останавливается. После каждого скилла агент ждет подтверждения пользователя.

Для кого. Для тех, кто пишет и поддерживает десятки собственных скиллов и хочет улучшать их по измеримым критериям.

Подходит, если

  • Скиллов накопилось много, и нужно понять, какие из них слабые
  • Нужно улучшить конкретный скилл и проверить, что правка действительно помогла
  • Нужно добавить в скилл обработку сбоев и список опасных действий

Не подходит, если

  • Скиллы лежат вне git-репозитория
  • Нужно написать скилл с нуля: для этого у автора есть отдельный скилл

Пример запроса к агенту

Оцени и улучши скилл release-notes, после каждой правки покажи дифф и изменение оценки

Ограничения

SKILL.md и основной README на китайском, есть английская версия README. Работать нужно в git-репозитории, а локальные изменения скиллов перед запуском стоит закоммитить. Оценка подагентами и прогон тестовых запросов расходуют много токенов. Часть критериев отражает стилевые предпочтения автора.

Как отключить. Удалите папку darwin-skill из каталога скиллов, например ~/.claude/skills/darwin-skill.

Проверка безопасности

  • Правит файлы скиллов и делает коммиты и откаты в git
  • Запускает подагентов и тестовые запросы

Коротко о README

README объясняет связь с autoresearch Карпатого и изменения версии 2.0, основанные на двух статьях Microsoft Research о качестве скиллов. Описаны пять принципов, девять критериев оценки, пять этапов цикла оптимизации и механизм храповика, при котором оценка только растет. Установка одной командой npx skills или архивом. Лицензия MIT.

SKILL.md

---
name: darwin-skill
description: "Darwin Skill 2.0 (达尔文.skill 2.0): autonomous skill optimizer, v2.0 integrates Microsoft Research SkillLens (arXiv 2605.23899) 9-dim rubric + SkillOpt (arXiv 2605.23904) validation-gated design + human-in-the-loop checkpoints. Evaluates SKILL.md files using a 9-dimension rubric (structure + effectiveness + meta-skill blacklists), runs hill-climbing with git version control, spawns independent judge agents for blind evaluation, validates improvements through test prompts with auto-break on diminishing returns, and generates visual result cards. Use when user mentions "优化skill", "skill评分", "自动优化", "auto optimize", "skill质量检查", "达尔文", "darwin", "帮我改改skill", "skill怎么样", "提升skill质量", "skill review", "skill打分"."
---

# Darwin Skill 2.0

> **v2.0 · 2026-05-28** — 吸收 Microsoft Research SkillLens(arXiv 2605.23899)的 9 维评分药方 + SkillOpt(arXiv 2605.23904)的 validation-gated 验证机制 + human in the loop 三层守关。
>
> 借鉴 Karpathy autoresearch 的自主实验循环,对 skills 进行持续优化。
> 核心理念:**评估 → 改进 → 实测验证 → 人类确认 → 保留或回滚 → 生成成果卡片**
> GitHub: https://github.com/alchaincyf/darwin-skill

---

## 设计哲学

autoresearch 的精髓:
1. **单一可编辑资产** — 每次只改一个 SKILL.md
2. **双重评估** — 结构评分(静态分析)+ 效果验证(跑测试看输出)
3. **棘轮机制** — 只保留改进,自动回滚退步
4. **独立评分** — 评分用子agent,避免「自己改自己评」的偏差
5. **人在回路** — 每个skill优化完后暂停,用户确认再继续

与纯结构审查的区别:不只看 SKILL.md 写得规不规范,更看改完后**实际跑出来的效果是否更好**。

Частые вопросы

Почему оценивает не тот же агент, который правит?

Автор ссылается на исследование, где самооценка модели оказалась ненадежной, поэтому оценку делают независимые подагенты, и в каждом раунде новые.

Может ли скилл испортить мои файлы?

Каждая правка коммитится отдельно, а неудачные откатываются через git revert, без git reset --hard. Перед следующим раундом агент показывает дифф.

Выбор редакции

Открытый личный AI-ассистент на своем компьютере: отвечает в Telegram, Slack, Discord и WhatsApp, расширяется скиллами и плагинами

CLIВысокий риск389,7 тыс.
Выбор редакции

Самообучающийся агент от Nous Research: терминал, мессенджеры, cron-задачи и скиллы, которые он пишет сам

CLIВысокий риск245,5 тыс.
Выбор редакции

Открытый агент для программирования в терминале и на десктопе с режимами разработки и планирования

CLIВысокий риск207,4 тыс.
Выбор редакции

Агент Anthropic для терминала, IDE и GitHub: понимает кодовую базу, выполняет задачи и работает с git

CLIВысокий риск145 тыс.