DataChain
Python-библиотека для типизированных версионируемых датасетов над S3, GCS и Azure с командой datachain skill install, которая учит Claude Code, Cursor и Codex р
Средний риск
Средний уровень ставим, когда инструмент запускает код, ходит в сеть или читает файлы проекта. Перед установкой посмотрите, что именно он делает.
Почему такой уровень
- Выполняет пайплайны и обращается к бакетам S3, GCS или Azure по вашим учетным данным
- Генерирует и запускает Python-код для обработки датасетов
Установка
В терминале, через SkillFoxx CLI
npx skillfoxx add skills/datachainОпределит агенты на машине, проверит риск и зафиксирует версию.
Другие способы установки
Собрано автоматически, проверьте перед установкой.
Выполните в терминале в папке проекта
npx skills add datachain-ai/datachain --skill core knowledge -a claude-code -yУтилита skills ставит текущую версию из репозитория. Чтобы скилл работал во всех проектах, добавьте флаг -g.
Без сторонних утилит, из коммита 0509279
tmp=$(mktemp -d)
git clone --filter=blob:none --no-checkout https://github.com/datachain-ai/datachain.git "$tmp"
git -C "$tmp" sparse-checkout set --no-cone /src/datachain/skill/core/ /src/datachain/skill/knowledge/
git -C "$tmp" checkout 0509279ffd26a187ae9525bf039cc57d88090984
mkdir -p .claude/skills
cp -R "$tmp/src/datachain/skill/core" .claude/skills/core
cp -R "$tmp/src/datachain/skill/knowledge" .claude/skills/knowledgeКоманды для macOS и Linux, на Windows выполните их в Git Bash.
Выполните в терминале в папке проекта
npx skills add datachain-ai/datachain --skill core knowledge -a cursor -yУтилита skills ставит текущую версию из репозитория. Чтобы скилл работал во всех проектах, добавьте флаг -g.
Без сторонних утилит, из коммита 0509279
tmp=$(mktemp -d)
git clone --filter=blob:none --no-checkout https://github.com/datachain-ai/datachain.git "$tmp"
git -C "$tmp" sparse-checkout set --no-cone /src/datachain/skill/core/ /src/datachain/skill/knowledge/
git -C "$tmp" checkout 0509279ffd26a187ae9525bf039cc57d88090984
mkdir -p .agents/skills
cp -R "$tmp/src/datachain/skill/core" .agents/skills/core
cp -R "$tmp/src/datachain/skill/knowledge" .agents/skills/knowledgeКоманды для macOS и Linux, на Windows выполните их в Git Bash.
Выполните в терминале в папке проекта
npx skills add datachain-ai/datachain --skill core knowledge -a github-copilot -yУтилита skills ставит текущую версию из репозитория. Чтобы скилл работал во всех проектах, добавьте флаг -g.
Без сторонних утилит, из коммита 0509279
tmp=$(mktemp -d)
git clone --filter=blob:none --no-checkout https://github.com/datachain-ai/datachain.git "$tmp"
git -C "$tmp" sparse-checkout set --no-cone /src/datachain/skill/core/ /src/datachain/skill/knowledge/
git -C "$tmp" checkout 0509279ffd26a187ae9525bf039cc57d88090984
mkdir -p .github/skills
cp -R "$tmp/src/datachain/skill/core" .github/skills/core
cp -R "$tmp/src/datachain/skill/knowledge" .github/skills/knowledgeКоманды для macOS и Linux, на Windows выполните их в Git Bash.
Выполните в терминале в папке проекта
npx skills add datachain-ai/datachain --skill core knowledge -a codex -yУтилита skills ставит текущую версию из репозитория. Чтобы скилл работал во всех проектах, добавьте флаг -g.
Без сторонних утилит, из коммита 0509279
tmp=$(mktemp -d)
git clone --filter=blob:none --no-checkout https://github.com/datachain-ai/datachain.git "$tmp"
git -C "$tmp" sparse-checkout set --no-cone /src/datachain/skill/core/ /src/datachain/skill/knowledge/
git -C "$tmp" checkout 0509279ffd26a187ae9525bf039cc57d88090984
mkdir -p .agents/skills
cp -R "$tmp/src/datachain/skill/core" .agents/skills/core
cp -R "$tmp/src/datachain/skill/knowledge" .agents/skills/knowledgeКоманды для macOS и Linux, на Windows выполните их в Git Bash.
Выполните в терминале в папке проекта
npx skills add datachain-ai/datachain --skill core knowledge -a gemini-cli -yУтилита skills ставит текущую версию из репозитория. Чтобы скилл работал во всех проектах, добавьте флаг -g.
Без сторонних утилит, из коммита 0509279
tmp=$(mktemp -d)
git clone --filter=blob:none --no-checkout https://github.com/datachain-ai/datachain.git "$tmp"
git -C "$tmp" sparse-checkout set --no-cone /src/datachain/skill/core/ /src/datachain/skill/knowledge/
git -C "$tmp" checkout 0509279ffd26a187ae9525bf039cc57d88090984
mkdir -p .agents/skills
cp -R "$tmp/src/datachain/skill/core" .agents/skills/core
cp -R "$tmp/src/datachain/skill/knowledge" .agents/skills/knowledgeКоманды для macOS и Linux, на Windows выполните их в Git Bash.
Выполните в терминале в папке проекта
tmp=$(mktemp -d)
git clone --filter=blob:none --no-checkout https://github.com/datachain-ai/datachain.git "$tmp"
git -C "$tmp" sparse-checkout set --no-cone /src/datachain/skill/core/ /src/datachain/skill/knowledge/
git -C "$tmp" checkout 0509279ffd26a187ae9525bf039cc57d88090984
mkdir -p .devin/skills
cp -R "$tmp/src/datachain/skill/core" .devin/skills/core
cp -R "$tmp/src/datachain/skill/knowledge" .devin/skills/knowledgeКоманды для macOS и Linux, на Windows выполните их в Git Bash.
Бывший Windsurf.
Выполните в терминале в папке проекта
npx skills add datachain-ai/datachain --skill core knowledge -a cline -yУтилита skills ставит текущую версию из репозитория. Чтобы скилл работал во всех проектах, добавьте флаг -g.
Без сторонних утилит, из коммита 0509279
tmp=$(mktemp -d)
git clone --filter=blob:none --no-checkout https://github.com/datachain-ai/datachain.git "$tmp"
git -C "$tmp" sparse-checkout set --no-cone /src/datachain/skill/core/ /src/datachain/skill/knowledge/
git -C "$tmp" checkout 0509279ffd26a187ae9525bf039cc57d88090984
mkdir -p .cline/skills
cp -R "$tmp/src/datachain/skill/core" .cline/skills/core
cp -R "$tmp/src/datachain/skill/knowledge" .cline/skills/knowledgeКоманды для macOS и Linux, на Windows выполните их в Git Bash.
Выполните в терминале в папке проекта
npx skills add datachain-ai/datachain --skill core knowledge -a roo -yУтилита skills ставит текущую версию из репозитория. Чтобы скилл работал во всех проектах, добавьте флаг -g.
Без сторонних утилит, из коммита 0509279
tmp=$(mktemp -d)
git clone --filter=blob:none --no-checkout https://github.com/datachain-ai/datachain.git "$tmp"
git -C "$tmp" sparse-checkout set --no-cone /src/datachain/skill/core/ /src/datachain/skill/knowledge/
git -C "$tmp" checkout 0509279ffd26a187ae9525bf039cc57d88090984
mkdir -p .roo/skills
cp -R "$tmp/src/datachain/skill/core" .roo/skills/core
cp -R "$tmp/src/datachain/skill/knowledge" .roo/skills/knowledgeКоманды для macOS и Linux, на Windows выполните их в Git Bash.
Форк Roo Code, папки .roo те же.
Выполните в терминале в папке проекта
npx skills add datachain-ai/datachain --skill core knowledge -a opencode -yУтилита skills ставит текущую версию из репозитория. Чтобы скилл работал во всех проектах, добавьте флаг -g.
Без сторонних утилит, из коммита 0509279
tmp=$(mktemp -d)
git clone --filter=blob:none --no-checkout https://github.com/datachain-ai/datachain.git "$tmp"
git -C "$tmp" sparse-checkout set --no-cone /src/datachain/skill/core/ /src/datachain/skill/knowledge/
git -C "$tmp" checkout 0509279ffd26a187ae9525bf039cc57d88090984
mkdir -p .agents/skills
cp -R "$tmp/src/datachain/skill/core" .agents/skills/core
cp -R "$tmp/src/datachain/skill/knowledge" .agents/skills/knowledgeКоманды для macOS и Linux, на Windows выполните их в Git Bash.
Выполните в терминале в папке проекта
tmp=$(mktemp -d)
git clone --filter=blob:none --no-checkout https://github.com/datachain-ai/datachain.git "$tmp"
git -C "$tmp" sparse-checkout set --no-cone /src/datachain/skill/core/ /src/datachain/skill/knowledge/
git -C "$tmp" checkout 0509279ffd26a187ae9525bf039cc57d88090984
mkdir -p .agents/skills
cp -R "$tmp/src/datachain/skill/core" .agents/skills/core
cp -R "$tmp/src/datachain/skill/knowledge" .agents/skills/knowledgeКоманды для macOS и Linux, на Windows выполните их в Git Bash.
Выполните в терминале в папке проекта
tmp=$(mktemp -d)
git clone --filter=blob:none --no-checkout https://github.com/datachain-ai/datachain.git "$tmp"
git -C "$tmp" sparse-checkout set --no-cone /src/datachain/skill/core/ /src/datachain/skill/knowledge/
git -C "$tmp" checkout 0509279ffd26a187ae9525bf039cc57d88090984
mkdir -p .agents/skills
cp -R "$tmp/src/datachain/skill/core" .agents/skills/core
cp -R "$tmp/src/datachain/skill/knowledge" .agents/skills/knowledgeКоманды для macOS и Linux, на Windows выполните их в Git Bash.
Установи библиотеку: pip install datachain. Подключи агентский скилл: datachain skill install --target claude (вместо claude подставь cursor, codex, copilot или pi под нужного агента). После этого агент сможет использовать базу знаний и генерацию кода DataChain для работы с вашими датасетами.
Другие способы из описания автора
pip install datachainУстанавливает библиотеку и CLI datachain
Это чужой код. Посмотрите файлы в репозитории перед установкой.
Что делает
DataChain превращает файлы в облачном хранилище в типизированные версионируемые датасеты: вычислительный движок обрабатывает файлы параллельно с асинхронным вводом-выводом и восстановлением после сбоев, а база датасетов хранит Pydantic-схемы, версии и происхождение данных с быстрой фильтрацией, join и group_by, включая векторный поиск по тем же строкам без отдельного хранилища. Поверх этого стоит база знаний: markdown-конспекты по датасетам, читаемые и человеком, и агентом. Команда datachain skill install добавляет агентский скилл, который подключает базу знаний и генерацию кода к Claude Code, Cursor, Codex, GitHub Copilot и Pi, а в облачном Studio агенты обращаются к тем же датасетам через MCP.
Для кого. Для дата-инженеров и разработчиков, которые хотят, чтобы агент сам находил, фильтровал и обрабатывал файлы в облачном хранилище вместо разовых скриптов.
Подходит, если
- Нужно, чтобы агент сам построил пайплайн по файлам в S3, GCS или Azure и сохранил результат как переиспользуемый датасет
- Нужны версии и происхождение данных для больших наборов файлов, а не просто список путей
- Агенту нужен векторный поиск по тем же датасетам без отдельной базы
Не подходит, если
- Данные не лежат в облачном хранилище файлов и уже структурированы в обычной базе данных
- Нужен только простой векторный поиск без версионирования и происхождения данных
Пример запроса к агенту
Найди в s3://bucket/oxford-pets/ фотографии собак, похожие на это изображение, исключи снимки без маски и собак породы кокер-спаниель, оставь только шире 400 пикселейОграничения
Скилл собирает базу знаний из датасетов, уже посчитанных DataChain, для остальных данных ее сначала нужно построить. Распределенные вычисления и доступ агентов к датасетам через MCP работают только в облачном Studio, локально доступен только вычислительный движок на одной машине. Нужны учетные данные для облачного хранилища.
Как отключить. Удалите папку установленного скилла из каталога скиллов агента (например ~/.claude/skills) и при необходимости уберите пакет командой pip uninstall datachain.
Проверка безопасности
- Выполняет пайплайны и обращается к бакетам S3, GCS или Azure по вашим учетным данным
- Генерирует и запускает Python-код для обработки датасетов
Коротко о README
README описывает DataChain как контекстный слой для неструктурированных данных: библиотека превращает файлы в S3, GCS и Azure в типизированные версионируемые датасеты, которые можно фильтровать, соединять и группировать с скоростью склада данных. Для агентских сценариев есть необязательная база знаний и агентский харнесс, устанавливаемый одной командой под конкретного агента. В примере быстрого старта показано, как агент через естественный запрос строит пайплайн поиска похожих изображений собак по метаданным пород и маскам в S3.
SKILL.md
---
name: datachain-core
description: Use ONLY for abstract DataChain SDK questions, API usage, method signatures, or code patterns, when no specific dataset or bucket is referenced. If the request mentions creating, saving, listing, exploring datasets or buckets, use datachain-knowledge instead.
---
Read {skill_dir}/SDK.md in full before answering DataChain SDK questions or generating DataChain Python code. It holds the SDK rules: API usage, UDF signatures, settings, delta semantics, materialization patterns, saving, exporting. The last section holds the steps that need a local checkout and the dc-knowledge/ knowledge base.
## Scope of this skill
This skill does not own methodology. Decisions about which datasets to build, what scope, what shape, what fields to save, and when to dialogue with the user about layer choices belong to the CAST methodology in the datachain-knowledge skill.
## Before writing any pipeline code
1. If dc-knowledge/index.md exists, read it first.
2. When the task overlaps an existing dataset, read its .md under dc-knowledge/datasets/ for schema, code patterns, and lineage.
3. Check bucket access: anonymous or authenticated, via dc-knowledge/buckets/ or datachain bucket status.Частые вопросы
Обязательно ли использовать облачный Studio?
Нет, вычислительный движок и база датасетов работают локально, Studio нужен только для распределенных вычислений и доступа агентов к тем же датасетам через MCP.
Чем это отличается от обычного векторного хранилища?
DataChain хранит типизированные версии датасетов с происхождением данных и делает векторный поиск по тем же строкам, без отдельной базы под эмбеддинги.
Похожие
166 скиллов для научных задач: биоинформатика, хемоинформатика, клинические данные, геоданные и доступ к 100+ базам
Открытый MCP-сервер Google для баз данных: готовые инструменты для Postgres, MySQL, BigQuery, Spanner и других, плюс свои инструменты в tools.yaml
Официальные скиллы Hugging Face: работа с Hub через CLI hf, датасеты, обучение моделей, Spaces, оценка и деплой
Язык визуализации для агентов и MCP-сервер: из простой семантической спецификации собираются аккуратные графики