Skill Conductor
Скилл для создания, проверки и улучшения других скиллов: сначала архитектура, потом тесты, оценка и упаковка
Установка
npx skills add smixs/skill-conductorУстанавливает скилл в ~/.claude/skills через skills.sh.
Это чужой код. Посмотрите файлы в репозитории перед установкой.
Что делает
Ведет полный цикл работы со скиллом в шести режимах: создание, улучшение, валидация, ревью чужих скиллов, оптимизация описания и упаковка в .skill. Перед написанием SKILL.md заставляет выбрать один из пяти архитектурных паттернов и проверить, что агент без скилла действительно не справляется. Качество оценивается методом BinEval: бинарные вопросы с доказательствами и порог по критичным вопросам. В комплекте агенты grader, comparator, analyzer и bineval, а также Python-скрипты для прогона эвалов.
Для кого. Авторам скиллов для Claude Code и совместимых агентов, которым нужна измеримая проверка качества, а не оценка на глаз.
Подходит, если
- Нужно написать новый скилл и заранее выбрать его структуру
- Скилл не срабатывает или срабатывает не на те запросы
- Перед установкой чужого скилла хочется прогнать его через проверку качества
- Нужно упаковать скилл для распространения
Не подходит, если
- Вы просто пользуетесь готовыми скиллами и не пишете свои
- Обычные задачи программирования, не связанные со скиллами
Пример запроса к агенту
Сделай скилл, который учит агента оформлять changelog по нашим правилам, и прогони на нем эвалыОграничения
Режимы со скриптами требуют установленного uv и доступа к LLM, без uv скилл останавливается. Эвалы и циклы улучшения тратят заметное количество токенов. Кросс-модельная калибровка судей предполагает доступ ко второй модели.
Как отключить. Удалите плагин через /plugin в Claude Code или удалите папку skill-conductor из ~/.claude/skills.
Проверка безопасности
- Запускает Python-скрипты через uv
- Эвалы делают вызовы LLM и расходуют токены
Коротко о README
Skill Conductor описывает себя как мета-скилл для полного жизненного цикла скиллов: проектирование, сборка, тесты, оценка и упаковка. Методика собрана из skill-creator от Anthropic, раздела writing-skills из Superpowers и ряда исследований по оценке LLM. Версия 3 перешла на оценку BinEval и гейтированное самообновление с отложенной выборкой. Ставится через skills.sh или как плагин Claude Code. Распространяется по лицензии MIT.
SKILL.md
--- name: skill-conductor description: > Create, edit, evaluate, and package agent skills. Use when building a new skill from scratch, improving an existing skill, fixing a skill that never triggers or fires unreliably, running evals to test a skill, benchmarking skill performance, optimizing a skill's description, reviewing third-party skills for quality, or packaging skills for distribution — even if the user doesn't explicitly say "skill" (e.g. "teach Claude to do X", "make the agent always follow Y"). Not for using skills or general coding tasks. --- # Skill Conductor Full lifecycle management for agent skills: **draft → test → review → improve → repeat**. One skill to rule them all — from architecture to packaging. The core loop is always the same: write something, test it, see what fails, fix it, test again. ## Runtime requirements (pre-flight) Before any mode that touches scripts (CREATE, IMPROVE, VALIDATE, OPTIMIZE, PACKAGE), run the pre-flight block → **`references/runtime-setup.md`** (checks `uv`, sets `UV_BIN`/`SKILL_CONDUCTOR_DIR`, verifies LLM access). If `uv` is absent, stop and tell the user. ## How to communicate Read context cues. If the user is a skill author iterating on their own work, be direct and technical. If they're new to skills, explain the _why_ behind each step — not just what to do, but why it matters. Default to conversational, not robotic. - Explain trade-offs when there's a real choice to make - Use concrete examples over abstract rules - When something fails, explain the root cause, not just the fix - Imperative voice in instructions: "Extract the data", not "You should extract" ## Modes Detect mode from context. If ambiguous, ask. | Mode | When | What happens | | ----------- | ------------------------------------------------ | --------------------------------------------------------------- | | 1. CREATE | "build a skill", "new skill for..." | Full lifecycle: intent → architecture → scaffold → write → test | | 2. IMPROVE | "fix this skill", "it doesn't trigger" | Diagnose → eval loop → gated self-update → iterate | | 3. VALIDATE | "test this skill", "run evals" | Structural checks + trigger testing + BinEval scoring | | 4. REVIEW | "review this skill", third-party assessment | 11-point quality gate, quick and focused | | 5. OPTIMIZE | "improve triggering", "description optimization" | Automated description optimization with train/test split | | 6. PACKAGE | "package for distribution" | Validate + bundle into .skill file |
Частые вопросы
Чем он отличается от skill-creator от Anthropic?
Он берет из skill-creator инфраструктуру эвалов и добавляет выбор архитектуры до написания, проверку провала без скилла и оценку BinEval с порогом по критичным вопросам.
Что нельзя писать в описании скилла?
Шаги процесса. По наблюдению автора, модель выполняет то, что перечислено в description, и пропускает тело SKILL.md.
Похожие
Самообучающийся агент от Nous Research: терминал, мессенджеры, cron-задачи и скиллы, которые он пишет сам
Агент Anthropic для терминала, IDE и GitHub: понимает кодовую базу, выполняет задачи и работает с git
Агент OpenAI для программирования, который работает локально в терминале, с версиями для IDE и десктопа
Открытый агент от Google для терминала на моделях Gemini: работа с кодом, shell, веб-поиск и MCP