Skill Conductor

Скилл для создания, проверки и улучшения других скиллов: сначала архитектура, потом тесты, оценка и упаковка

СкиллСредний риск

smixs/skill-conductor

Установка

npx skills add smixs/skill-conductor

Устанавливает скилл в ~/.claude/skills через skills.sh.

Это чужой код. Посмотрите файлы в репозитории перед установкой.

Что делает

Ведет полный цикл работы со скиллом в шести режимах: создание, улучшение, валидация, ревью чужих скиллов, оптимизация описания и упаковка в .skill. Перед написанием SKILL.md заставляет выбрать один из пяти архитектурных паттернов и проверить, что агент без скилла действительно не справляется. Качество оценивается методом BinEval: бинарные вопросы с доказательствами и порог по критичным вопросам. В комплекте агенты grader, comparator, analyzer и bineval, а также Python-скрипты для прогона эвалов.

Для кого. Авторам скиллов для Claude Code и совместимых агентов, которым нужна измеримая проверка качества, а не оценка на глаз.

Подходит, если

  • Нужно написать новый скилл и заранее выбрать его структуру
  • Скилл не срабатывает или срабатывает не на те запросы
  • Перед установкой чужого скилла хочется прогнать его через проверку качества
  • Нужно упаковать скилл для распространения

Не подходит, если

  • Вы просто пользуетесь готовыми скиллами и не пишете свои
  • Обычные задачи программирования, не связанные со скиллами

Пример запроса к агенту

Сделай скилл, который учит агента оформлять changelog по нашим правилам, и прогони на нем эвалы

Ограничения

Режимы со скриптами требуют установленного uv и доступа к LLM, без uv скилл останавливается. Эвалы и циклы улучшения тратят заметное количество токенов. Кросс-модельная калибровка судей предполагает доступ ко второй модели.

Как отключить. Удалите плагин через /plugin в Claude Code или удалите папку skill-conductor из ~/.claude/skills.

Проверка безопасности

  • Запускает Python-скрипты через uv
  • Эвалы делают вызовы LLM и расходуют токены

Коротко о README

Skill Conductor описывает себя как мета-скилл для полного жизненного цикла скиллов: проектирование, сборка, тесты, оценка и упаковка. Методика собрана из skill-creator от Anthropic, раздела writing-skills из Superpowers и ряда исследований по оценке LLM. Версия 3 перешла на оценку BinEval и гейтированное самообновление с отложенной выборкой. Ставится через skills.sh или как плагин Claude Code. Распространяется по лицензии MIT.

SKILL.md

---
name: skill-conductor
description: >
  Create, edit, evaluate, and package agent skills. Use when building a new
  skill from scratch, improving an existing skill, fixing a skill that never
  triggers or fires unreliably, running evals to test a skill, benchmarking
  skill performance, optimizing a skill's description, reviewing third-party
  skills for quality, or packaging skills for distribution — even if the user
  doesn't explicitly say "skill" (e.g. "teach Claude to do X", "make the
  agent always follow Y"). Not for using skills or general coding
  tasks.
---

# Skill Conductor

Full lifecycle management for agent skills: **draft → test → review → improve → repeat**.

One skill to rule them all — from architecture to packaging. The core loop is always the same: write something, test it, see what fails, fix it, test again.

## Runtime requirements (pre-flight)

Before any mode that touches scripts (CREATE, IMPROVE, VALIDATE, OPTIMIZE, PACKAGE), run the pre-flight block → **`references/runtime-setup.md`** (checks `uv`, sets `UV_BIN`/`SKILL_CONDUCTOR_DIR`, verifies LLM access). If `uv` is absent, stop and tell the user.

## How to communicate

Read context cues. If the user is a skill author iterating on their own work, be direct and technical. If they're new to skills, explain the _why_ behind each step — not just what to do, but why it matters. Default to conversational, not robotic.

- Explain trade-offs when there's a real choice to make
- Use concrete examples over abstract rules
- When something fails, explain the root cause, not just the fix
- Imperative voice in instructions: "Extract the data", not "You should extract"

## Modes

Detect mode from context. If ambiguous, ask.

| Mode        | When                                             | What happens                                                    |
| ----------- | ------------------------------------------------ | --------------------------------------------------------------- |
| 1. CREATE   | "build a skill", "new skill for..."              | Full lifecycle: intent → architecture → scaffold → write → test |
| 2. IMPROVE  | "fix this skill", "it doesn't trigger"           | Diagnose → eval loop → gated self-update → iterate              |
| 3. VALIDATE | "test this skill", "run evals"                   | Structural checks + trigger testing + BinEval scoring           |
| 4. REVIEW   | "review this skill", third-party assessment      | 11-point quality gate, quick and focused                        |
| 5. OPTIMIZE | "improve triggering", "description optimization" | Automated description optimization with train/test split        |
| 6. PACKAGE  | "package for distribution"                       | Validate + bundle into .skill file                              |

Частые вопросы

Чем он отличается от skill-creator от Anthropic?

Он берет из skill-creator инфраструктуру эвалов и добавляет выбор архитектуры до написания, проверку провала без скилла и оценку BinEval с порогом по критичным вопросам.

Что нельзя писать в описании скилла?

Шаги процесса. По наблюдению автора, модель выполняет то, что перечислено в description, и пропускает тело SKILL.md.

Выбор редакции

Самообучающийся агент от Nous Research: терминал, мессенджеры, cron-задачи и скиллы, которые он пишет сам

CLIВысокий риск245,4 тыс.
Выбор редакции

Агент Anthropic для терминала, IDE и GitHub: понимает кодовую базу, выполняет задачи и работает с git

CLIВысокий риск145 тыс.
Выбор редакции

Агент OpenAI для программирования, который работает локально в терминале, с версиями для IDE и десктопа

CLIВысокий риск124,1 тыс.
Выбор редакции

Открытый агент от Google для терминала на моделях Gemini: работа с кодом, shell, веб-поиск и MCP

CLIВысокий риск107 тыс.