Claude Vision Skill

Скилл дает распознавание картинок моделям без своего зрения: отправляет изображение в vision-модель и возвращает текстовое описание

Скилл

Средний риск

Средний уровень ставим, когда инструмент запускает код, ходит в сеть или читает файлы проекта. Перед установкой посмотрите, что именно он делает.

Почему такой уровень

  • Запускает скрипт vision.js, читает файлы и буфер обмена и отправляет изображения во внешний vision-сервис
  • Требует ключ API, который хранится в файле рядом со скриптом
Все причины и проверки

asuojun/claude-vision-skill

Установка

В терминале, через SkillFoxx CLI

npx skillfoxx add skills/claude-vision-skill

Определит агенты на машине, проверит риск и зафиксирует версию.

Другие способы установки

Выполните в терминале в папке проекта

npx skills add asuojun/claude-vision-skill --skill claude-vision-skill -a claude-code -y

Утилита skills ставит текущую версию из репозитория. Чтобы скилл работал во всех проектах, добавьте флаг -g.

Выполните в терминале в папке проекта

npx skills add asuojun/claude-vision-skill --skill claude-vision-skill -a cursor -y

Утилита skills ставит текущую версию из репозитория. Чтобы скилл работал во всех проектах, добавьте флаг -g.

Выполните в терминале в папке проекта

npx skills add asuojun/claude-vision-skill --skill claude-vision-skill -a github-copilot -y

Утилита skills ставит текущую версию из репозитория. Чтобы скилл работал во всех проектах, добавьте флаг -g.

Выполните в терминале в папке проекта

npx skills add asuojun/claude-vision-skill --skill claude-vision-skill -a codex -y

Утилита skills ставит текущую версию из репозитория. Чтобы скилл работал во всех проектах, добавьте флаг -g.

Выполните в терминале в папке проекта

npx skills add asuojun/claude-vision-skill --skill claude-vision-skill -a gemini-cli -y

Утилита skills ставит текущую версию из репозитория. Чтобы скилл работал во всех проектах, добавьте флаг -g.

Выполните в терминале в папке проекта

npx skills add asuojun/claude-vision-skill --skill claude-vision-skill -a cline -y

Утилита skills ставит текущую версию из репозитория. Чтобы скилл работал во всех проектах, добавьте флаг -g.

Выполните в терминале в папке проекта

npx skills add asuojun/claude-vision-skill --skill claude-vision-skill -a roo -y

Утилита skills ставит текущую версию из репозитория. Чтобы скилл работал во всех проектах, добавьте флаг -g.

Форк Roo Code, папки .roo те же.

Выполните в терминале в папке проекта

npx skills add asuojun/claude-vision-skill --skill claude-vision-skill -a opencode -y

Утилита skills ставит текущую версию из репозитория. Чтобы скилл работал во всех проектах, добавьте флаг -g.

Понадобится: Node.js

Сверено с репозиторием 25 сент. 2026, коммит fa5ca17.

Текст для агента

Склонируй репозиторий: git clone https://github.com/asuojun/claude-vision-skill.git. Скопируй vision.js в проект, пропиши ключ API, имя модели и при необходимости адрес API, добавь содержимое CLAUDE.md в проект. В SKILL.md замени путь к vision.js на свой.

Другие способы из описания автора
git clone https://github.com/asuojun/claude-vision-skill.git

После клонирования попросите агента прочитать README и настроить скилл, он спросит сервис и ключ.

Это чужой код. Посмотрите файлы в репозитории перед установкой.

Что делает

Скилл добавляет распознавание изображений моделям, у которых нет собственного зрения, например DeepSeek. Когда пользователь дает путь к файлу, ссылку или вставляет картинку, агент вместо прямого просмотра запускает встроенный скрипт vision.js. Скрипт читает изображение, кодирует в base64 и отправляет в vision-модель через формат, совместимый с OpenAI, а ответ возвращает текстом. По умолчанию рекомендуется Qwen на платформе Aliyun DashScope, но подходит любая vision-модель с OpenAI-совместимым API, включая gpt-4o-mini. Есть чтение картинки из буфера обмена: на macOS через встроенный помощник на Swift, на Windows через сценарий PowerShell, и автоматический откат к буферу, если файл не найден.

Для кого. Для тех, кто работает с моделью без зрения и хочет, чтобы агент все равно разбирал скриншоты и картинки.

Подходит, если

  • Основная модель не умеет читать изображения, а разобрать скриншот или картинку нужно
  • Хочется вставлять изображение в чат и получать описание без ручных команд
  • Нужна дешевая или бесплатная vision-модель через OpenAI-совместимый API

Не подходит, если

  • Модель и так умеет читать изображения напрямую
  • Нельзя отправлять картинки во внешний vision-сервис из соображений приватности

Пример запроса к агенту

Посмотри, что на этом скриншоте, и опиши текстом

Ограничения

Скилл сам не распознает изображения, он лишь пересылает их во внешнюю vision-модель, поэтому нужен ключ API и оплата по тарифам сервиса, а картинки уходят на сторону провайдера. Нужен Node, а для буфера обмена на macOS помощник на Swift, на Windows сценарий PowerShell. По умолчанию описания даются на китайском, если не попросить иначе. Рекомендуемый Qwen на Aliyun доступен из России без VPN, а вариант через OpenAI без VPN не работает. В SKILL.md зашит абсолютный путь автора, при установке его нужно заменить на свой. Лицензия в репозитории не указана.

Как отключить. Удалите папку скилла из каталога скиллов, уберите файл vision.js из проекта и снимите упоминания скилла из CLAUDE.md.

Проверка безопасности

  • Запускает скрипт vision.js, читает файлы и буфер обмена и отправляет изображения во внешний vision-сервис
  • Требует ключ API, который хранится в файле рядом со скриптом

Коротко о README

README на китайском объясняет, что скилл дает зрение моделям без него, отправляя картинку в vision-модель и возвращая текст. Основа это скрипт vision.js на OpenAI-совместимом формате, который не привязан к одному провайдеру. Описаны три сценария для Claude Code: обычный проект, интеграция с cyberboss и краткое объяснение устройства. Рекомендуется Qwen на Aliyun из-за бесплатного лимита, но подойдет OpenAI или любой совместимый сервис со сменой адреса и модели. Установка автоматическая через агента по README или ручная копированием vision.js и CLAUDE.md в проект.

SKILL.md

---
name: claude-vision-skill
description: Use when the user shares, pastes, or references an image (local path or URL) and you need to describe, analyze, or recognize its content, especially when the current model cannot read images directly. Run the bundled vision.js helper to convert the image into text.
---

# Vision Helper

The current model may not support native image input. When the user provides an image path or URL, do not rely on viewing the image directly. Instead run:

node /path/to/claude-vision-skill/vision.js "<absolute image path>" "<prompt>"

For an image URL use --url, for a pasted image use --clipboard. The --clipboard mode reads the current image from the system clipboard (macOS uses a bundled Swift helper, Windows a bundled PowerShell script). If a local path does not exist, vision.js falls back to the clipboard automatically; pass --no-fallback to disable this.

Rules: always use the absolute path to vision.js; use an absolute image path for local files or --url for remote images; configuration lives in .env next to vision.js (DASHSCOPE_API_KEY, VISION_MODEL, DASHSCOPE_BASE_URL); never print or commit the API key.

Частые вопросы

Какую vision-модель использовать?

Автор рекомендует Qwen на Aliyun DashScope из-за бесплатного лимита для новых пользователей. Подойдет и любая другая модель с OpenAI-совместимым API, включая gpt-4o-mini, тогда меняются адрес и имя модели.

Уходят ли мои картинки на сторону?

Да, скрипт отправляет изображение во внешнюю vision-модель. Ключ API берется из файла .env рядом с vision.js и не должен попадать в репозиторий.

Выбор редакции

Открытый личный AI-ассистент на своем компьютере: отвечает в Telegram, Slack, Discord и WhatsApp, расширяется скиллами и плагинами

CLIВысокий риск390,7 тыс.Звезды репозитория
Выбор редакции

Самообучающийся агент от Nous Research: терминал, мессенджеры, cron-задачи и скиллы, которые он пишет сам

CLIВысокий риск249,8 тыс.Звезды репозитория
Выбор редакции

Открытый агент для программирования в терминале и на десктопе с режимами разработки и планирования

CLIВысокий риск210,6 тыс.Звезды репозитория
Выбор редакции

Открытая библиотека промптов с плагином Claude Code, MCP-сервером и CLI: поиск, получение и улучшение промптов и скиллов из агента

ПлагинСредний риск171,5 тыс.Звезды репозитория
Foxx AIClaude Vision Skill

Я Foxx AI и уже разобрал этот инструмент. Спросите про установку, настройку или что угодно еще, отвечу простыми словами.