Скиллы PaddleOCR
PaddleOCR Agent Skills
Два официальных скилла PaddleOCR: распознавание текста с картинок и PDF и разбор сложных документов в Markdown
Установка
pip install "paddleocr>=3.7.0"
npx skills add PaddlePaddle/PaddleOCR -g --skill paddleocr-text-recognition -y
npx skills add PaddlePaddle/PaddleOCR -g --skill paddleocr-doc-parsing -yСтавьте только нужный скилл. После установки задайте PADDLEOCR_ACCESS_TOKEN.
Это чужой код. Посмотрите файлы в репозитории перед установкой.
Что делает
Скилл paddleocr-text-recognition извлекает текст построчно с координатами рамок и уверенностью из скриншотов, фото, сканов и PDF. Скилл paddleocr-doc-parsing разбирает документы со сложной версткой: таблицы, формулы в LaTeX, графики, печати, многоколоночный текст и порядок чтения, а на выходе дает Markdown или JSON. Оба скилла вызывают команду paddleocr api, которая обращается к облачному API PaddleOCR, и описывают агенту, какой скилл выбрать и как обрабатывать ошибки.
Для кого. Для тех, кому агент должен вытаскивать текст и таблицы из сканов, счетов, отчетов и научных PDF.
Подходит, если
- Нужно получить текст со скриншота, фото или скана
- Нужно превратить PDF с таблицами и формулами в Markdown
- Нужно разобрать многоколоночную верстку в правильном порядке чтения
Не подходит, если
- Документы нельзя отправлять во внешний облачный сервис
- PDF уже содержит текстовый слой и хватит обычного извлечения текста
Пример запроса к агенту
Разбери этот PDF с отчетом и верни основной текст и все таблицы в MarkdownОграничения
Нужны Python 3.9+, пакет paddleocr версии 3.7.0 или новее и токен PADDLEOCR_ACCESS_TOKEN из Baidu AI Studio. Файлы обрабатываются в облачном API, действуют квоты. Доступность AI Studio и регистрации в нем из России не проверена.
Как отключить. Удалите папки paddleocr-text-recognition и paddleocr-doc-parsing из каталога скиллов агента и уберите PADDLEOCR_ACCESS_TOKEN из настроек.
Проверка безопасности
- Отправляет документы в облачный API PaddleOCR
- Использует токен доступа AI Studio
Коротко о README
Документация скиллов описывает выбор между двумя скиллами, требования (Python, пакет paddleocr, токен AI Studio) и три способа установки: skills CLI, clawhub для OpenClaw и ручное копирование. Отдельно показано, как задать PADDLEOCR_ACCESS_TOKEN в .claude/settings.local.json и в OpenClaw, и приведены примеры запросов. Скиллы лежат в папке skills основного репозитория PaddleOCR, лицензия Apache-2.0.
SKILL.md
---
name: paddleocr-doc-parsing
description: >-
Use this skill to extract structured Markdown/JSON from PDFs and document images—tables with
cell-level precision, formulas as LaTeX, figures, seals, charts, headers/footers, multi-column
layout and correct reading order.
Trigger terms: 文档解析, 版面分析, 版面还原, 表格提取, 公式识别, 多栏排版, 扫描件结构化,
发票, 财报, 复杂 PDF, PDF转Markdown, 图表, 阅读顺序; reading order, formula, LaTeX,
layout parsing, structure extraction, PP-StructureV3, PaddleOCR-VL.
license: Apache-2.0
metadata:
openclaw:
requires:
env:
- PADDLEOCR_ACCESS_TOKEN
bins:
- paddleocr
primaryEnv: PADDLEOCR_ACCESS_TOKEN
install:
- kind: uv
package: paddleocr
bins: [paddleocr]
---
# PaddleOCR Document Parsing
## When to Use This Skill
**Use this skill for**:
- Documents with tables (invoices, financial reports, spreadsheets)
- Documents with mathematical formulas (academic papers, scientific documents)
- Documents with charts and diagrams
- Multi-column layouts (newspapers, magazines, brochures)
- Complex document structures requiring layout analysis
## Usage
### Basic Document Parsing
From URL:
```bash
paddleocr api \
--model_type doc_parsing \
--file_url "https://example.com/report.pdf"
```Частые вопросы
Какой скилл выбрать?
Для простого текста с рамками подходит text-recognition, для таблиц, формул и сохранения структуры документа нужен doc-parsing.
Что делать, если npx skills add зависает?
Репозиторий большой: клонируйте его и ставьте скиллы из локального пути ./PaddleOCR/skills/...
Похожие
Утилита Microsoft и MCP-сервер, которые переводят PDF, Word, Excel, PowerPoint, HTML и другие файлы в Markdown для модели
Скиллы Anthropic
Skills
Официальные примеры скиллов Anthropic: документы docx, pdf, pptx, xlsx, дизайн, MCP builder и спецификация Agent Skills
Скилл, который собирает редактируемые PPTX-презентации из PDF, DOCX, ссылок и Markdown с настоящими фигурами, диаграммами и анимациями
Набор плагинов Anthropic для юристов: договоры, приватность, трудовое право, IP, судебные дела, AI-регулирование и обучение