DSH Vision Toolkit
Набор визуальных инструментов и скилл для DeepSeek Harness: разбор картинок, OCR длинных скриншотов, восстановление интерфейса
Средний риск
Средний уровень ставим, когда инструмент запускает код, ходит в сеть или читает файлы проекта. Перед установкой посмотрите, что именно он делает.
Почему такой уровень
- Запускает код и обращается к внешним сервисам модели зрения
- Читает переданные скриншоты и файлы проекта
Установка
Ручная установка
dsh plugin --profile web add @anionex/dsh-vision-toolkitКоманда для веб-профиля DeepSeek Harness, после установки задайте провайдер модели зрения в настройках.
Это чужой код. Посмотрите файлы в репозитории перед установкой.
Что делает
Плагин дает текстовым моделям в DeepSeek Harness работу с изображениями. Вставленную картинку агент разбирает по задаче: где ошибка, где кнопка, что на длинном скриншоте. В набор входят распознавание текста, поиск и вырезание элементов, сравнение картинок по пикселям и восстановление интерфейса из макета в код. Вместе с инструментами идет скилл, который подсказывает, что смотреть под конкретную задачу и как проверить результат. Ставится одной командой в профиль DeepSeek Harness.
Для кого. Для разработчиков и дизайнеров, которые работают в DeepSeek Harness с текстовой моделью, но им нужно понимать скриншоты и макеты.
Подходит, если
- Нужно достать текст с длинного скриншота
- Нужно понять, что не так на скриншоте интерфейса
- Нужно восстановить верстку по макету или картинке
Не подходит, если
- Вы работаете не в DeepSeek Harness, а в другом агенте
- Нет доступа к модели зрения или нечем оплатить провайдера
Пример запроса к агенту
Посмотри на этот скриншот и скажи, где именно всплывает ошибкаОграничения
Инструмент рассчитан на DeepSeek Harness и его профили, вне этой среды не работает. Нужен провайдер модели зрения и ключ, часть возможностей опирается на сторонние сервисы. Часть документации на китайском.
Как отключить. Удалите плагин командой dsh plugin remove для нужного профиля.
Проверка безопасности
- Запускает код и обращается к внешним сервисам модели зрения
- Читает переданные скриншоты и файлы проекта
Коротко о README
README представляет набор как первый крупный визуальный плагин экосистемы DeepSeek Harness. Он интегрирует инструменты из проекта agent-vision-toolkit прямо в профили, сессии, настройки и веб-интерфейс. Вставка картинки автоматически переключает текстовую модель на вариант со зрением. Установка одной командой, дальше настраивается провайдер модели зрения. В документации есть примеры по OCR, разбору интерфейса и восстановлению верстки.
Частые вопросы
С какими агентами это работает?
Инструмент сделан для DeepSeek Harness, его веб и headless профилей. Отдельно от этой среды он не запускается.
Нужен ли отдельный ключ?
Да, нужен провайдер модели зрения. README перечисляет несколько вариантов, в том числе с бесплатными моделями.
Похожие
Набор скиллов, который задает агенту процесс разработки: уточнение задачи, план, TDD, субагенты и ревью кода
Скиллы Мэтта Покока для инженеров
Skills For Real Engineers
Небольшие компонуемые скиллы для инженерной работы с агентом: интервью по плану, TDD, диагностика багов, ревью и архитектура
Набор GitHub для разработки от спецификации: CLI specify ставит в проект команды и скиллы для агента, от принципов до реализации
Референсные MCP-серверы
Model Context Protocol servers
Официальные референсные MCP-серверы: Filesystem, Fetch, Git, Memory, Sequential Thinking, Time и Everything