skill-up
CLI для оценки и доработки скиллов агентов: декларативные тесты в YAML, запуск на разных движках и структурированные отчеты
Средний риск
Средний уровень ставим, когда инструмент запускает код, ходит в сеть или читает файлы проекта. Перед установкой посмотрите, что именно он делает.
Почему такой уровень
- CLI запускает скиллы на движках агентов и выполняет скрипты оценки
- Прогоны и судья-агент ходят в модель и расходуют токены
Установка
Ручная установка
curl -fsSL https://raw.githubusercontent.com/alibaba/skill-up/main/install.sh | bashУстановка CLI skill-up напрямую. Обычно skill-upper ставит CLI сам при первом запуске.
Это чужой код. Посмотрите файлы в репозитории перед установкой.
Что делает
skill-up это CLI, который делает качество скилла измеримым и повторяемым. Тест-кейсы описываются декларативно в YAML, прогоняются на разных движках агентов и оцениваются правилами, скриптами или судьей-агентом, а результат собирается в отчеты локально или в CI. В комплекте идет скилл skill-upper: через диалог он читает провалы, чинит и расширяет набор тестов, снова запускает skill-up и повторяет цикл. Есть импорт формата evals.json от Anthropic и совместимые отчеты grading.json и benchmark.
Для кого. Для разработчиков и инженеров качества, которые пишут скиллы для агентов и хотят проверять их регрессиями.
Подходит, если
- Нужно измерить качество скилла тестами, а не на глаз
- Нужны регрессии на скилл в CI
- Нужно перенести evals.json от Anthropic в повторяемый прогон
Не подходит, если
- Вы не разрабатываете скиллы, а просто ими пользуетесь
- Нет доступа к движку агента для прогона кейсов
Пример запроса к агенту
Напиши eval для моего скилла и прогони его через skill-up, покажи отчет по проваламОграничения
Для прогона кейсов нужен движок агента: встроены Claude Code, Codex и Qoder CLI, плюс пользовательские движки. Оценка судьей-агентом и сами прогоны расходуют токены модели того движка, который вы подключили.
Как отключить. Удалите бинарь skill-up из PATH и папку скилла skill-upper из каталога скиллов агента.
Проверка безопасности
- CLI запускает скиллы на движках агентов и выполняет скрипты оценки
- Прогоны и судья-агент ходят в модель и расходуют токены
Коротко о README
README описывает skill-up как инструмент оценки и доработки скиллов на Go. Оценка задается через eval.yaml и файлы cases, работает на движках Claude Code, Codex и Qoder CLI, плюс пользовательские движки, а судить можно правилами, скриптом или агентом. Отчеты совместимы с форматом Anthropic, есть импорт evals.json и режимы для CI. Рекомендованный путь работы это скилл skill-upper, который через диалог чинит и расширяет тесты и гоняет цикл заново. Лицензия Apache-2.0.
Частые вопросы
Нужно ли ставить skill-up перед skill-upper?
Обычно нет. skill-upper при запуске проверяет наличие CLI и проводит агента через установку, если ее нет.
Как оцениваются ответы?
Тремя стратегиями: по правилам, скриптом и судьей-агентом, результат собирается в структурированные отчеты.
Похожие
CLI для тестирования и ред-тиминга LLM-приложений: сравнение моделей, автоматические проверки в CI и поиск уязвимостей
Playwright CLI
playwright-cli
Официальный CLI Playwright со скиллом для агентов: управление браузером короткими командами без тяжелых MCP-схем
Официальный отладчик MCP-серверов: веб-интерфейс, CLI для автоматизации и терминальный интерфейс в одном пакете
Официальный MCP-сервер SonarSource: проблемы качества и безопасности, quality gates и анализ кода из SonarQube Server и Cloud