agent-vision-toolkit
Набор CLI-инструментов и скилл, которые дают текстовому агенту зрение: разбор изображений, OCR длинных скриншотов, восстановление UI
Средний риск
Средний уровень ставим, когда инструмент запускает код, ходит в сеть или читает файлы проекта. Перед установкой посмотрите, что именно он делает.
Почему такой уровень
- Отправляет изображения во внешний мультимодальный API
- Запускает CLI и может автоматизировать GUI
Установка
В терминале, через SkillFoxx CLI
npx skillfoxx add skills/agent-vision-toolkitОпределит агенты на машине, проверит риск и зафиксирует версию.
Другие способы установки
Выполните в терминале в папке проекта
npx skills add anionex/agent-vision-toolkit --skill vision-skills -a claude-code -yУтилита skills ставит текущую версию из репозитория. Чтобы скилл работал во всех проектах, добавьте флаг -g.
Без сторонних утилит, из коммита bf68366
tmp=$(mktemp -d)
git clone --filter=blob:none --no-checkout https://github.com/anionex/agent-vision-toolkit.git "$tmp"
git -C "$tmp" sparse-checkout set --no-cone /skills/vision-skills/
git -C "$tmp" checkout bf68366d2a2250691ef42f3ca1b464d2eba1ab36
mkdir -p .claude/skills
cp -R "$tmp/skills/vision-skills" .claude/skills/vision-skillsКоманды для macOS и Linux, на Windows выполните их в Git Bash.
Выполните в терминале в папке проекта
npx skills add anionex/agent-vision-toolkit --skill vision-skills -a cursor -yУтилита skills ставит текущую версию из репозитория. Чтобы скилл работал во всех проектах, добавьте флаг -g.
Без сторонних утилит, из коммита bf68366
tmp=$(mktemp -d)
git clone --filter=blob:none --no-checkout https://github.com/anionex/agent-vision-toolkit.git "$tmp"
git -C "$tmp" sparse-checkout set --no-cone /skills/vision-skills/
git -C "$tmp" checkout bf68366d2a2250691ef42f3ca1b464d2eba1ab36
mkdir -p .agents/skills
cp -R "$tmp/skills/vision-skills" .agents/skills/vision-skillsКоманды для macOS и Linux, на Windows выполните их в Git Bash.
Выполните в терминале в папке проекта
npx skills add anionex/agent-vision-toolkit --skill vision-skills -a github-copilot -yУтилита skills ставит текущую версию из репозитория. Чтобы скилл работал во всех проектах, добавьте флаг -g.
Без сторонних утилит, из коммита bf68366
tmp=$(mktemp -d)
git clone --filter=blob:none --no-checkout https://github.com/anionex/agent-vision-toolkit.git "$tmp"
git -C "$tmp" sparse-checkout set --no-cone /skills/vision-skills/
git -C "$tmp" checkout bf68366d2a2250691ef42f3ca1b464d2eba1ab36
mkdir -p .github/skills
cp -R "$tmp/skills/vision-skills" .github/skills/vision-skillsКоманды для macOS и Linux, на Windows выполните их в Git Bash.
Выполните в терминале в папке проекта
npx skills add anionex/agent-vision-toolkit --skill vision-skills -a codex -yУтилита skills ставит текущую версию из репозитория. Чтобы скилл работал во всех проектах, добавьте флаг -g.
Без сторонних утилит, из коммита bf68366
tmp=$(mktemp -d)
git clone --filter=blob:none --no-checkout https://github.com/anionex/agent-vision-toolkit.git "$tmp"
git -C "$tmp" sparse-checkout set --no-cone /skills/vision-skills/
git -C "$tmp" checkout bf68366d2a2250691ef42f3ca1b464d2eba1ab36
mkdir -p .agents/skills
cp -R "$tmp/skills/vision-skills" .agents/skills/vision-skillsКоманды для macOS и Linux, на Windows выполните их в Git Bash.
Выполните в терминале в папке проекта
npx skills add anionex/agent-vision-toolkit --skill vision-skills -a gemini-cli -yУтилита skills ставит текущую версию из репозитория. Чтобы скилл работал во всех проектах, добавьте флаг -g.
Без сторонних утилит, из коммита bf68366
tmp=$(mktemp -d)
git clone --filter=blob:none --no-checkout https://github.com/anionex/agent-vision-toolkit.git "$tmp"
git -C "$tmp" sparse-checkout set --no-cone /skills/vision-skills/
git -C "$tmp" checkout bf68366d2a2250691ef42f3ca1b464d2eba1ab36
mkdir -p .agents/skills
cp -R "$tmp/skills/vision-skills" .agents/skills/vision-skillsКоманды для macOS и Linux, на Windows выполните их в Git Bash.
Выполните в терминале в папке проекта
tmp=$(mktemp -d)
git clone --filter=blob:none --no-checkout https://github.com/anionex/agent-vision-toolkit.git "$tmp"
git -C "$tmp" sparse-checkout set --no-cone /skills/vision-skills/
git -C "$tmp" checkout bf68366d2a2250691ef42f3ca1b464d2eba1ab36
mkdir -p .devin/skills
cp -R "$tmp/skills/vision-skills" .devin/skills/vision-skillsКоманды для macOS и Linux, на Windows выполните их в Git Bash.
Бывший Windsurf.
Выполните в терминале в папке проекта
npx skills add anionex/agent-vision-toolkit --skill vision-skills -a cline -yУтилита skills ставит текущую версию из репозитория. Чтобы скилл работал во всех проектах, добавьте флаг -g.
Без сторонних утилит, из коммита bf68366
tmp=$(mktemp -d)
git clone --filter=blob:none --no-checkout https://github.com/anionex/agent-vision-toolkit.git "$tmp"
git -C "$tmp" sparse-checkout set --no-cone /skills/vision-skills/
git -C "$tmp" checkout bf68366d2a2250691ef42f3ca1b464d2eba1ab36
mkdir -p .cline/skills
cp -R "$tmp/skills/vision-skills" .cline/skills/vision-skillsКоманды для macOS и Linux, на Windows выполните их в Git Bash.
Выполните в терминале в папке проекта
npx skills add anionex/agent-vision-toolkit --skill vision-skills -a roo -yУтилита skills ставит текущую версию из репозитория. Чтобы скилл работал во всех проектах, добавьте флаг -g.
Без сторонних утилит, из коммита bf68366
tmp=$(mktemp -d)
git clone --filter=blob:none --no-checkout https://github.com/anionex/agent-vision-toolkit.git "$tmp"
git -C "$tmp" sparse-checkout set --no-cone /skills/vision-skills/
git -C "$tmp" checkout bf68366d2a2250691ef42f3ca1b464d2eba1ab36
mkdir -p .roo/skills
cp -R "$tmp/skills/vision-skills" .roo/skills/vision-skillsКоманды для macOS и Linux, на Windows выполните их в Git Bash.
Форк Roo Code, папки .roo те же.
Выполните в терминале в папке проекта
npx skills add anionex/agent-vision-toolkit --skill vision-skills -a opencode -yУтилита skills ставит текущую версию из репозитория. Чтобы скилл работал во всех проектах, добавьте флаг -g.
Без сторонних утилит, из коммита bf68366
tmp=$(mktemp -d)
git clone --filter=blob:none --no-checkout https://github.com/anionex/agent-vision-toolkit.git "$tmp"
git -C "$tmp" sparse-checkout set --no-cone /skills/vision-skills/
git -C "$tmp" checkout bf68366d2a2250691ef42f3ca1b464d2eba1ab36
mkdir -p .agents/skills
cp -R "$tmp/skills/vision-skills" .agents/skills/vision-skillsКоманды для macOS и Linux, на Windows выполните их в Git Bash.
Выполните в терминале в папке проекта
tmp=$(mktemp -d)
git clone --filter=blob:none --no-checkout https://github.com/anionex/agent-vision-toolkit.git "$tmp"
git -C "$tmp" sparse-checkout set --no-cone /skills/vision-skills/
git -C "$tmp" checkout bf68366d2a2250691ef42f3ca1b464d2eba1ab36
mkdir -p .agents/skills
cp -R "$tmp/skills/vision-skills" .agents/skills/vision-skillsКоманды для macOS и Linux, на Windows выполните их в Git Bash.
Выполните в терминале в папке проекта
tmp=$(mktemp -d)
git clone --filter=blob:none --no-checkout https://github.com/anionex/agent-vision-toolkit.git "$tmp"
git -C "$tmp" sparse-checkout set --no-cone /skills/vision-skills/
git -C "$tmp" checkout bf68366d2a2250691ef42f3ca1b464d2eba1ab36
mkdir -p .agents/skills
cp -R "$tmp/skills/vision-skills" .agents/skills/vision-skillsКоманды для macOS и Linux, на Windows выполните их в Git Bash.
Установи скилл: npx skills add Anionex/agent-vision-toolkit --skill vision-skills. Затем пропиши VISION_API_KEY, VISION_BASE_URL и VISION_MODEL в конфигурацию.
Другие способы из описания автора
npx skills add Anionex/agent-vision-toolkit --skill vision-skills -gПосле установки задайте VISION_API_KEY, VISION_BASE_URL и VISION_MODEL.
Это чужой код. Посмотрите файлы в репозитории перед установкой.
Что делает
agent-vision-toolkit добавляет зрение агентам на текстовых моделях, например DeepSeek, у которых нет мультимодальности. Он состоит из нескольких CLI и скилла, который объясняет агенту, когда какой инструмент применять: вопросы по изображению, OCR длинных скриншотов, восстановление верстки фронтенда, GUI-автоматизация. Любой агент, умеющий вызывать команды оболочки, может ими пользоваться. Отдельно есть прозрачный локальный прокси и однофайловые плагины, чтобы вставленные картинки и встроенные инструменты работы с изображениями работали без лишней настройки.
Для кого. Для тех, кто запускает агента на текстовой модели и хочет дать ему работу с изображениями.
Подходит, если
- Модель агента не видит изображения, а работать с ними надо
- Нужен OCR длинного скриншота или разбор картинки
- Хотите восстановить верстку по изображению интерфейса
Не подходит, если
- Модель агента и так мультимодальная
- Нет доступа к внешнему мультимодальному API
Пример запроса к агенту
Распознай текст на этом длинном скриншоте и опиши, что на нем изображеноОграничения
Для работы нужен мультимодальный API, совместимый с OpenAI Chat Completions, OpenAI Responses или Anthropic Messages: его базовый адрес, ключ и модель. Доступность зависит от выбранного провайдера.
Как отключить. Уберите каталог bin из PATH и удалите установленные скилл или плагины из каталога агента.
Проверка безопасности
- Отправляет изображения во внешний мультимодальный API
- Запускает CLI и может автоматизировать GUI
Коротко о README
README объясняет, что зрение агента можно вынести из модели в оснастку: набор CLI и скилл учат текстового агента разбирать изображения, делать OCR длинных скриншотов, восстанавливать UI и автоматизировать GUI. Опционально ставятся локальный прокси и однофайловые плагины для бесшовной работы с картинками. Нужен внешний мультимодальный API. Лицензия MIT.
SKILL.md
--- name: vision-skills description: >- Local vision CLIs: glance (describe/ask/OCR an image), ground (locate a target, pixel box), detect (element inventory), trace (image to SVG geometry), crop (cut a pixel box to a file), and scripts/html_shot.py (HTML file to image). Use for any task involving an image — questions, text, splitting and transcribing long screenshots or chat histories, locating elements, comparing, rebuilding as HTML/SVG, digitizing a sketch or diagram, reading values off a chart, operating a GUI from screenshots — and to re-check an image yourself when a description you were given lacks a detail. --- # vision-skills Five local CLIs that give a text-only agent eyes. They read one shared vision config (`VISION_API_KEY` / `VISION_BASE_URL` / `VISION_MODEL` / `LANG`), plus the optional Python-client settings `VISION_API_PROTOCOL`, `VISION_REASONING_EFFORT`, and `VISION_USER_AGENT` — no extra credentials. Pick the tool by the question you are answering: | Question | Tool | |---|---| | "What does this image show / say?" | `glance` | | "Where is X?" — a thing you can name | `ground` | | "Where are all the Xs?" — every instance of a kind | `detect` | | "What is its exact shape, size, offset?" | `trace` | | "Cut this box out as its own image file" | `crop` | | "OCR this long screenshot / scrolling page / chat history" | `scripts/long_screenshot_ocr.py` | | "Extract the icon/logo foreground as transparent PNG — manual region or auto (cropped+scaled screenshots)" | `scripts/extract_fg.py` | | "Turn this HTML file into a viewport or full-page screenshot" | `scripts/html_shot.py` | | "Which colours dominate a region, and which palette value fits it?" | `scripts/dominant_colors.py` | | A relation none of them return — a gap, a distance between two located things | code over the pixels (Pillow) | `glance` answers what something is; `ground` and `detect` answer where. You give `ground` a description of a particular thing; you give `detect` a kind and it enumerates the instances. Both give real coordinates, but they are not pixel-exact: the box arrives on a 0-1000 grid and is scaled to your image, so the last pixel or few are not reliable. That is accurate enough to crop with, to click, to compare positions against. When a number has to be exact, `trace` derives it from the actual pixels — offsets, sizes, shapes. ## Use the provided tools before hand-rolled pixels Everything this toolkit ships a tool for, call the tool — do not rewrite
Частые вопросы
Что нужно подготовить?
Мультимодальный API, совместимый с OpenAI или Anthropic: базовый адрес, ключ и имя модели.
С какими агентами работает?
С Codex, Claude Code, Pi, Oh My Pi и OpenCode.
Похожие
Открытый личный AI-ассистент на своем компьютере: отвечает в Telegram, Slack, Discord и WhatsApp, расширяется скиллами и плагинами
Самообучающийся агент от Nous Research: терминал, мессенджеры, cron-задачи и скиллы, которые он пишет сам
Открытый агент для программирования в терминале и на десктопе с режимами разработки и планирования
Открытая библиотека промптов с плагином Claude Code, MCP-сервером и CLI: поиск, получение и улучшение промптов и скиллов из агента