skill-up

CLI для оценки и доработки скиллов агентов: декларативные тесты в YAML, запуск на разных движках и структурированные отчеты

CLI

Средний риск

Средний уровень ставим, когда инструмент запускает код, ходит в сеть или читает файлы проекта. Перед установкой посмотрите, что именно он делает.

Почему такой уровень

  • CLI запускает скиллы на движках агентов и выполняет скрипты оценки
  • Прогоны и судья-агент ходят в модель и расходуют токены
Все причины и проверки

alibaba/skill-up

Установка

Ручная установка

curl -fsSL https://raw.githubusercontent.com/alibaba/skill-up/main/install.sh | bash

Установка CLI skill-up напрямую. Обычно skill-upper ставит CLI сам при первом запуске.

Это чужой код. Посмотрите файлы в репозитории перед установкой.

Что делает

skill-up это CLI, который делает качество скилла измеримым и повторяемым. Тест-кейсы описываются декларативно в YAML, прогоняются на разных движках агентов и оцениваются правилами, скриптами или судьей-агентом, а результат собирается в отчеты локально или в CI. В комплекте идет скилл skill-upper: через диалог он читает провалы, чинит и расширяет набор тестов, снова запускает skill-up и повторяет цикл. Есть импорт формата evals.json от Anthropic и совместимые отчеты grading.json и benchmark.

Для кого. Для разработчиков и инженеров качества, которые пишут скиллы для агентов и хотят проверять их регрессиями.

Подходит, если

  • Нужно измерить качество скилла тестами, а не на глаз
  • Нужны регрессии на скилл в CI
  • Нужно перенести evals.json от Anthropic в повторяемый прогон

Не подходит, если

  • Вы не разрабатываете скиллы, а просто ими пользуетесь
  • Нет доступа к движку агента для прогона кейсов

Пример запроса к агенту

Напиши eval для моего скилла и прогони его через skill-up, покажи отчет по провалам

Ограничения

Для прогона кейсов нужен движок агента: встроены Claude Code, Codex и Qoder CLI, плюс пользовательские движки. Оценка судьей-агентом и сами прогоны расходуют токены модели того движка, который вы подключили.

Как отключить. Удалите бинарь skill-up из PATH и папку скилла skill-upper из каталога скиллов агента.

Проверка безопасности

  • CLI запускает скиллы на движках агентов и выполняет скрипты оценки
  • Прогоны и судья-агент ходят в модель и расходуют токены

Коротко о README

README описывает skill-up как инструмент оценки и доработки скиллов на Go. Оценка задается через eval.yaml и файлы cases, работает на движках Claude Code, Codex и Qoder CLI, плюс пользовательские движки, а судить можно правилами, скриптом или агентом. Отчеты совместимы с форматом Anthropic, есть импорт evals.json и режимы для CI. Рекомендованный путь работы это скилл skill-upper, который через диалог чинит и расширяет тесты и гоняет цикл заново. Лицензия Apache-2.0.

Частые вопросы

Нужно ли ставить skill-up перед skill-upper?

Обычно нет. skill-upper при запуске проверяет наличие CLI и проводит агента через установку, если ее нет.

Как оцениваются ответы?

Тремя стратегиями: по правилам, скриптом и судьей-агентом, результат собирается в структурированные отчеты.

Выбор редакции

CLI для тестирования и ред-тиминга LLM-приложений: сравнение моделей, автоматические проверки в CI и поиск уязвимостей

CLIСредний риск25,5 тыс.Звезды репозитория

Playwright CLI

playwright-cli

Выбор редакции

Официальный CLI Playwright со скиллом для агентов: управление браузером короткими командами без тяжелых MCP-схем

CLIСредний рискБез VPN13,6 тыс.Звезды репозитория
Выбор редакции

Официальный отладчик MCP-серверов: веб-интерфейс, CLI для автоматизации и терминальный интерфейс в одном пакете

CLIСредний рискБез VPN11 тыс.Звезды репозитория
Официальный

Официальный MCP-сервер SonarSource: проблемы качества и безопасности, quality gates и анализ кода из SonarQube Server и Cloud

MCP-серверСредний риск655Звезды репозитория
Foxx AIskill-up

Я Foxx AI и уже разобрал этот инструмент. Спросите про установку, настройку или что угодно еще, отвечу простыми словами.