Autoresearch для скиллов
autoresearch
Скилл, который улучшает другой скилл: гоняет его на тестовых запросах, оценивает бинарными проверками и правит промпт
Установка
git clone https://github.com/olelehmann1337/autoresearch-skill ~/.claude/skills/autoresearchЗатем создайте ~/.claude/skills/autoresearch/references/ и перенесите туда eval-guide.md.
Это чужой код. Посмотрите файлы в репозитории перед установкой.
Что делает
Скилл переносит подход autoresearch Андрея Карпаты с обучения моделей на промпты скиллов Claude Code. Сначала он собирает у пользователя путь к целевому SKILL.md, 3-5 тестовых запросов и 3-6 проверок вида да или нет. Затем в цикле запускает скилл, оценивает каждый результат, вносит одну правку в промпт и оставляет ее, только если счет вырос. На выходе получается улучшенный SKILL.md, журнал результатов results.tsv, changelog всех попыток и HTML-дашборд для наблюдения за прогрессом.
Для кого. Для авторов скиллов, у которых скилл срабатывает нестабильно и нужно поднять качество измеримо.
Подходит, если
- Скилл иногда выдает плохой результат и непонятно, что править
- Нужно сравнить версии промпта по одинаковым проверкам
- Нужно написать набор бинарных тестов для скилла
Не подходит, если
- Качество результата нельзя свести к проверкам да или нет
- Бюджет на токены ограничен: цикл запускает скилл десятки раз
Пример запроса к агенту
Запусти autoresearch на моем скилле ~/.claude/skills/newsletter/SKILL.md, бюджет 10 цикловОграничения
Отдельного README нет, вся документация внутри SKILL.md и eval-guide.md. Цикл по умолчанию не ограничен числом итераций и расходует много запросов к модели, лимит стоит задать заранее. SKILL.md ссылается на references/eval-guide.md, а в репозитории файл лежит в корне, при установке его стоит переложить. Работа Claude Code из России требует VPN.
Как отключить. Удалите папку autoresearch из ~/.claude/skills/.
Проверка безопасности
- Многократно запускает другой скилл и переписывает его SKILL.md
- Может расходовать много токенов без заданного лимита
Коротко о README
README в репозитории нет. SKILL.md описывает сбор контекста перед стартом, построение набора проверок, базовый прогон, цикл мутаций и формат выходных файлов. eval-guide.md объясняет, как формулировать хорошие бинарные проверки и каких ошибок избегать.
SKILL.md
--- name: autoresearch description: "Autonomously optimize any Claude Code skill by running it repeatedly, scoring outputs against binary evals, mutating the prompt, and keeping improvements. Based on Karpathy's autoresearch methodology. Use when: optimize this skill, improve this skill, run autoresearch on, make this skill better, self-improve skill, benchmark skill, eval my skill, run evals on. Outputs: an improved SKILL.md, a results log, and a changelog of every mutation tried." --- # Autoresearch for Skills Most skills work about 70% of the time. The other 30% you get garbage. The fix isn't to rewrite the skill from scratch. It's to let an agent run it dozens of times, score every output, and tighten the prompt until that 30% disappears. This skill adapts Andrej Karpathy's autoresearch methodology (autonomous experimentation loops) to Claude Code skills. Instead of optimizing ML training code, we optimize skill prompts. --- ## the core job Take any existing skill, define what "good output" looks like as binary yes/no checks, then run an autonomous loop that: 1. Generates outputs from the skill using test inputs 2. Scores every output against the eval criteria 3. Mutates the skill prompt to fix failures 4. Keeps mutations that improve the score, discards the rest 5. Repeats until the score ceiling is hit or the user stops it **Output:** An improved SKILL.md + `results.tsv` log + `changelog.md` of every mutation attempted + a live HTML dashboard you can watch in your browser.
Частые вопросы
Почему проверки только бинарные?
Шкалы оценок шумят между запусками, а да или нет дает стабильный счет, по которому можно сравнивать правки.
Сколько запусков на одну правку?
По умолчанию пять, число можно изменить до старта.
Похожие
Открытый личный AI-ассистент на своем компьютере: отвечает в Telegram, Slack, Discord и WhatsApp, расширяется скиллами и плагинами
Самообучающийся агент от Nous Research: терминал, мессенджеры, cron-задачи и скиллы, которые он пишет сам
Открытый агент для программирования в терминале и на десктопе с режимами разработки и планирования
Открытая библиотека промптов с плагином Claude Code, MCP-сервером и CLI: поиск, получение и улучшение промптов и скиллов из агента