Скиллы PaddleOCR

PaddleOCR Agent Skills

Два официальных скилла PaddleOCR: распознавание текста с картинок и PDF и разбор сложных документов в Markdown

СкиллСредний риск

paddlepaddle/paddleocr

Установка

pip install "paddleocr>=3.7.0"
npx skills add PaddlePaddle/PaddleOCR -g --skill paddleocr-text-recognition -y
npx skills add PaddlePaddle/PaddleOCR -g --skill paddleocr-doc-parsing -y

Ставьте только нужный скилл. После установки задайте PADDLEOCR_ACCESS_TOKEN.

Это чужой код. Посмотрите файлы в репозитории перед установкой.

Что делает

Скилл paddleocr-text-recognition извлекает текст построчно с координатами рамок и уверенностью из скриншотов, фото, сканов и PDF. Скилл paddleocr-doc-parsing разбирает документы со сложной версткой: таблицы, формулы в LaTeX, графики, печати, многоколоночный текст и порядок чтения, а на выходе дает Markdown или JSON. Оба скилла вызывают команду paddleocr api, которая обращается к облачному API PaddleOCR, и описывают агенту, какой скилл выбрать и как обрабатывать ошибки.

Для кого. Для тех, кому агент должен вытаскивать текст и таблицы из сканов, счетов, отчетов и научных PDF.

Подходит, если

  • Нужно получить текст со скриншота, фото или скана
  • Нужно превратить PDF с таблицами и формулами в Markdown
  • Нужно разобрать многоколоночную верстку в правильном порядке чтения

Не подходит, если

  • Документы нельзя отправлять во внешний облачный сервис
  • PDF уже содержит текстовый слой и хватит обычного извлечения текста

Пример запроса к агенту

Разбери этот PDF с отчетом и верни основной текст и все таблицы в Markdown

Ограничения

Нужны Python 3.9+, пакет paddleocr версии 3.7.0 или новее и токен PADDLEOCR_ACCESS_TOKEN из Baidu AI Studio. Файлы обрабатываются в облачном API, действуют квоты. Доступность AI Studio и регистрации в нем из России не проверена.

Как отключить. Удалите папки paddleocr-text-recognition и paddleocr-doc-parsing из каталога скиллов агента и уберите PADDLEOCR_ACCESS_TOKEN из настроек.

Проверка безопасности

  • Отправляет документы в облачный API PaddleOCR
  • Использует токен доступа AI Studio

Коротко о README

Документация скиллов описывает выбор между двумя скиллами, требования (Python, пакет paddleocr, токен AI Studio) и три способа установки: skills CLI, clawhub для OpenClaw и ручное копирование. Отдельно показано, как задать PADDLEOCR_ACCESS_TOKEN в .claude/settings.local.json и в OpenClaw, и приведены примеры запросов. Скиллы лежат в папке skills основного репозитория PaddleOCR, лицензия Apache-2.0.

SKILL.md

---
name: paddleocr-doc-parsing
description: >-
  Use this skill to extract structured Markdown/JSON from PDFs and document images—tables with
  cell-level precision, formulas as LaTeX, figures, seals, charts, headers/footers, multi-column
  layout and correct reading order.
  Trigger terms: 文档解析, 版面分析, 版面还原, 表格提取, 公式识别, 多栏排版, 扫描件结构化,
  发票, 财报, 复杂 PDF, PDF转Markdown, 图表, 阅读顺序; reading order, formula, LaTeX,
  layout parsing, structure extraction, PP-StructureV3, PaddleOCR-VL.
license: Apache-2.0
metadata:
  openclaw:
    requires:
      env:
        - PADDLEOCR_ACCESS_TOKEN
      bins:
        - paddleocr
    primaryEnv: PADDLEOCR_ACCESS_TOKEN
    install:
      - kind: uv
        package: paddleocr
        bins: [paddleocr]
---

# PaddleOCR Document Parsing

## When to Use This Skill

**Use this skill for**:

- Documents with tables (invoices, financial reports, spreadsheets)
- Documents with mathematical formulas (academic papers, scientific documents)
- Documents with charts and diagrams
- Multi-column layouts (newspapers, magazines, brochures)
- Complex document structures requiring layout analysis

## Usage

### Basic Document Parsing

From URL:

```bash
paddleocr api \
  --model_type doc_parsing \
  --file_url "https://example.com/report.pdf"
```

Частые вопросы

Какой скилл выбрать?

Для простого текста с рамками подходит text-recognition, для таблиц, формул и сохранения структуры документа нужен doc-parsing.

Что делать, если npx skills add зависает?

Репозиторий большой: клонируйте его и ставьте скиллы из локального пути ./PaddleOCR/skills/...

Выбор редакции

Утилита Microsoft и MCP-сервер, которые переводят PDF, Word, Excel, PowerPoint, HTML и другие файлы в Markdown для модели

MCP-серверСредний риск184 тыс.
Выбор редакции

Официальные примеры скиллов Anthropic: документы docx, pdf, pptx, xlsx, дизайн, MCP builder и спецификация Agent Skills

СкиллСредний риск176,3 тыс.
Выбор редакции

Скилл, который собирает редактируемые PPTX-презентации из PDF, DOCX, ссылок и Markdown с настоящими фигурами, диаграммами и анимациями

СкиллСредний риск54,3 тыс.
Выбор редакции

Набор плагинов Anthropic для юристов: договоры, приватность, трудовое право, IP, судебные дела, AI-регулирование и обучение

ПлагинСредний риск9,4 тыс.