Promptfoo
CLI для тестирования и ред-тиминга LLM-приложений: сравнение моделей, автоматические проверки в CI и поиск уязвимостей
Средний риск
Средний уровень ставим, когда инструмент запускает код, ходит в сеть или читает файлы проекта. Перед установкой посмотрите, что именно он делает.
Почему такой уровень
- Выполняет сетевые запросы к API моделей и может расходовать платные токены
- Red team режим отправляет тестовые атаки в ваше LLM-приложение
Установка
В терминале, через SkillFoxx CLI
npx skillfoxx add cli/promptfooОпределит агенты на машине, проверит риск и зафиксирует версию.
Другие способы установки
Установите утилиту
npm install -g promptfooУстанови promptfoo: npm install -g promptfoo (либо brew install promptfoo, либо pip install promptfoo). Инициализируй пример: promptfoo init --example getting-started, затем запусти promptfoo eval и promptfoo view.
Другие способы из описания автора
npm install -g promptfooТакже доступно через brew install promptfoo, pip install promptfoo или разовый запуск npx promptfoo@latest.
Это чужой код. Посмотрите файлы в репозитории перед установкой.
Что делает
Promptfoo запускает наборы тестов для промптов, агентов и RAG-пайплайнов и сравнивает ответы разных моделей по заданным критериям. Отдельный режим red team имитирует атаки на LLM-приложение и ищет уязвимости вроде утечки промпта или обхода ограничений. Тесты описываются декларативным YAML-конфигом, результаты открываются в локальном веб-интерфейсе или встраиваются в CI. Для Claude Code есть отдельный плагин со скиллом, который помогает писать и вести наборы оценок прямо в разговоре с агентом.
Для кого. Для разработчиков и инженеров, которые проверяют качество и безопасность промптов и LLM-приложений перед релизом.
Подходит, если
- Нужно сравнить ответы нескольких моделей на одном наборе промптов
- Нужно добавить регрессионные проверки качества ответов в CI
- Нужно проверить приложение на промпт-инъекции и другие уязвимости
Не подходит, если
- Нужна разовая проверка одного промпта без сохранения истории
- Нет доступа к API моделей, которые нужно сравнивать
Пример запроса к агенту
Собери promptfoo-конфиг для сравнения GPT и Claude на моих системных промптах и запусти оценкуОграничения
Для сравнения моделей нужны отдельные API-ключи провайдеров (OpenAI, Anthropic и других), часть из них недоступна из России без VPN. Красная команда и часть проверок требуют настройки целей и могут расходовать заметный объем токенов при больших наборах тестов.
Как отключить. Удалите пакет promptfoo (npm uninstall -g promptfoo или аналог для brew либо pip) и файлы promptfooconfig.yaml из проекта. Для плагина Claude Code удалите его через /plugin.
Проверка безопасности
- Выполняет сетевые запросы к API моделей и может расходовать платные токены
- Red team режим отправляет тестовые атаки в ваше LLM-приложение
Коротко о README
README описывает promptfoo как CLI и библиотеку для оценки и ред-тиминга LLM-приложений. Основные сценарии: сравнение моделей и провайдеров, регрессионные проверки в CI, сканирование на уязвимости и генерация отчетов о безопасности. Устанавливается через npm, brew или pip, оценки выполняются локально без отправки промптов на серверы promptfoo. Проект перешел в состав OpenAI, но остается open source с лицензией MIT.
Частые вопросы
Чем promptfoo отличается от обычного тестирования промптов вручную?
Он прогоняет один и тот же набор тестов по нескольким моделям и провайдерам автоматически и хранит историю сравнений, а не разовые проверки в чате.
Нужен ли аккаунт promptfoo для работы?
Нет, оценки выполняются локально с вашими собственными ключами API моделей, без обязательной регистрации.
Похожие
Playwright CLI
playwright-cli
Официальный CLI Playwright со скиллом для агентов: управление браузером короткими командами без тяжелых MCP-схем
Официальный отладчик MCP-серверов: веб-интерфейс, CLI для автоматизации и терминальный интерфейс в одном пакете
Официальный MCP-сервер SonarSource: проблемы качества и безопасности, quality gates и анализ кода из SonarQube Server и Cloud
Открытый ИИ-агент для ревью pull request: описание, замечания и предложения по улучшению в GitHub, GitLab и других