Hyper-Extract
CLI и MCP-сервер для извлечения структурированных знаний из документов: графы, гиперграфы и поиск по фактам с источниками
Средний риск
Средний уровень ставим, когда инструмент запускает код, ходит в сеть или читает файлы проекта. Перед установкой посмотрите, что именно он делает.
Почему такой уровень
- Отправляет содержимое документов провайдеру LLM и embedding для построения графа
- Локально хранит ключи провайдеров в конфигурационном файле
Установка
В терминале, через SkillFoxx CLI
npx skillfoxx add cli/hyper-extractОпределит агенты на машине, проверит риск и зафиксирует версию.
Другие способы установки
Установите утилиту
pipx install hyperextractБез pipx подойдет pip install hyperextract.
Установи CLI: uv tool install hyperextract (или pipx install hyperextract). Настрой провайдера: he config init -p openai -k ВАШ_КЛЮЧ. Для MCP-сервера поставь pip install 'hyperextract[mcp]' и запусти he-mcp.
Другие способы из описания автора
uv tool install hyperextractАльтернатива: pipx install hyperextract.
Это чужой код. Посмотрите файлы в репозитории перед установкой.
Что делает
Hyper-Extract разбирает неструктурированный текст и строит из него граф знаний по одному из готовых шаблонов, например биографию, хронологию или отчет. Каждый факт в графе привязан к источнику в исходном документе, что позволяет проверить, откуда взято утверждение. Построенную базу знаний можно опрашивать поиском или вопросами в стиле RAG, а также экспортировать в Obsidian, GraphML, CSV, JSON-LD или Cypher. Отдельный MCP-сервер дает агентам вроде Claude Desktop доступ на чтение и экспорт к уже построенным базам без изменения их содержимого.
Для кого. Для аналитиков и технических писателей, которым нужно превратить набор документов в проверяемую базу знаний.
Подходит, если
- Нужно построить граф знаний из статей, отчетов или документации
- Нужно быстро находить факты с привязкой к источнику внутри большого документа
- Нужно экспортировать извлеченные знания в Obsidian или граф-базу
Не подходит, если
- Нужна просто суммаризация текста без структуры графа
- Нет доступа ни к одному LLM- или embedding-провайдеру
Пример запроса к агенту
Построй граф знаний из этого отчета по шаблону biography_graph и найди в нем все упомянутые достиженияОграничения
Для извлечения и поиска нужен ключ LLM- и embedding-провайдера (OpenAI, DeepSeek, Anthropic, Google Gemini, Alibaba Bailian или локальный vLLM). Часть облачных провайдеров недоступна из России без VPN, при этом связка DeepSeek с любым embedder работает как более дешевый вариант.
Как отключить. Удалите пакет: uv tool uninstall hyperextract (или pipx uninstall hyperextract) и файл конфигурации ~/.he/config.toml.
Проверка безопасности
- Отправляет содержимое документов провайдеру LLM и embedding для построения графа
- Локально хранит ключи провайдеров в конфигурационном файле
Коротко о README
README описывает Hyper-Extract как CLI для превращения документов в структурированные знания одной командой. Инструмент строит графы и гиперграфы по шаблонам, поддерживает несколько LLM- и embedding-провайдеров и экспорт в разные форматы, включая Obsidian. Отдельно документирован MCP-сервер только для чтения, который подключает базы знаний к Claude Desktop и другим MCP-клиентам. Лицензия Apache-2.0, пакет распространяется через PyPI.
Частые вопросы
Чем это отличается от обычного RAG?
Hyper-Extract сначала строит явный граф фактов с привязкой к источникам, и только потом по нему можно искать или задавать вопросы, а не просто индексирует чанки текста.
Может ли MCP-сервер изменить мою базу знаний?
Нет, он работает только на чтение и экспорт уже построенных баз, создавать или удалять их через него нельзя.
Похожие
166 скиллов для научных задач: биоинформатика, хемоинформатика, клинические данные, геоданные и доступ к 100+ базам
Открытый MCP-сервер Google для баз данных: готовые инструменты для Postgres, MySQL, BigQuery, Spanner и других, плюс свои инструменты в tools.yaml
Официальные скиллы Hugging Face: работа с Hub через CLI hf, датасеты, обучение моделей, Spaces, оценка и деплой
Язык визуализации для агентов и MCP-сервер: из простой семантической спецификации собираются аккуратные графики