Аудит кэширования промптов

LLM Cache Audit Skill

Скилл для Codex и Claude Code, который ищет в коде и настройках причины промахов кэша промптов LLM и предлагает проверку

СкиллСредний риск

sernote/audit-prompt-caching

Установка

npx skills add https://github.com/sernote/audit-prompt-caching --skill audit-prompt-caching

Выполняется из проекта, который нужно проверить. Требует Node.js.

Это чужой код. Посмотрите файлы в репозитории перед установкой.

Что делает

Агент проходит путь запроса к LLM: сборку промпта, порядок сообщений, инструменты и схемы, настройки провайдера и маршрутизацию. Результат аудита бывает трех видов: находка с доказательством и шагом проверки, обоснованный вывод, что менять ничего не нужно, или список недостающих измерений. Есть справочники по OpenAI, Anthropic, Gemini, Bedrock, OpenRouter, vLLM, SGLang, YandexGPT и другим провайдерам. Локальные Python-скрипты сравнивают префиксы, проверяют payload и считают экономику.

Для кого. Разработчикам LLM-приложений и агентов, у которых выросли стоимость или задержка, а cached_tokens остается нулевым.

Подходит, если

  • cached_tokens или cache_read_input_tokens равны нулю на повторяющихся запросах
  • После изменения инструментов, схем или цикла агента выросла стоимость
  • Нужно понять, стоит ли вообще оптимизировать кэширование в проекте
  • Упало переиспользование KV-кэша после масштабирования vLLM или SGLang

Не подходит, если

  • Обычная работа над качеством промпта без вопросов стоимости и задержки
  • Подсчет токенов или выбор размера контекстного окна

Пример запроса к агенту

Используй audit-prompt-caching и проверь LLM-вызовы этого проекта: начни с кода и конфигурации, покажи находки, доказательства и проверки

Ограничения

Скилл не перехватывает живой трафик и опирается на код, конфигурацию и выгрузки телеметрии. Анализатор маршрутизации экспериментальный и не имеет адаптера для нативных логов роутера. Утверждения о ценах, TTL и поддержке моделей агент должен сверять с актуальной документацией провайдера.

Как отключить. Удалите папку audit-prompt-caching из каталога скиллов агента.

Проверка безопасности

  • Запускает локальные Python-скрипты для анализа

Коротко о README

Скилл помогает Codex, Claude Code и совместимым агентам находить, что ломает кэширование промптов LLM в проекте. Аудит начинается с кода и конфигурации и связывает вывод с доказательством и шагом проверки. В README есть пример с перестановкой блоков, при которой общий префикс вырос с 43 до 254 байт, и таблица типовых вопросов. Проверки для провайдеров и self-hosted инференса вынесены в отдельные справочники. Лицензия MIT.

SKILL.md

---
name: audit-prompt-caching
description: "Use whenever the user mentions cached_tokens=0,total_cached_tokens,cache_read_input_tokens,cache_creation_input_tokens,cache_write_tokens,prompt_cache_key,prompt_cache_options,prompt_cache_breakpoint,previous_interaction_id,cache_control/cachePoint,TTFT,KV reuse; prefix_cache_retention_interval,prefix_caching_hash_algo,Mamba/SWA/hybrid,cross-process block hash; LLM cost or speed regressed,repeated long prompts,speeding up agents; LLM request shape changes: tools,schemas,response_format,model/router,agent loops,compaction; Not for generic prompt writing,RAG,token counts,non-LLM perf"
---

# Prompt Cache Audit

Diagnose LLM prompt/prefix cache misses as request-path engineering problems:
stable reusable prefixes, provider telemetry, cache-aware routing, and entries
that live long enough to be reused. Caching is worth changing only when the
prefix is stable, long enough, repeated, measurable, and safe. Do not add cache
controls, keys, salts, provider pins, routing hints, or broader cache sharing
until the applicability, telemetry, and trust-boundary checks justify them.

## When to use

Use this skill for LLM calls where repeated prompt prefixes may affect cost,
TTFT, prefill latency, or self-hosted KV reuse. Typical triggers:

- `cached_tokens=0`, `cache_read_input_tokens=0`, `cache_write_tokens`, writes without reads, or unclear usage fields; GPT-5.6/GPT-6 Astra `prompt_cache_options`/`prompt_cache_breakpoint`; or migration from `prompt_cache_retention`.
- Effort or reasoning changes inside a cached conversation: per-step `reasoning.effort`, GPT-6 Astra `configuration_update`, Claude per-message `output_config.effort`, thinking toggles.
- Cache hit rate, TTFT, prefill latency, or input-token cost changed; LLM cost or speed regressed around repeated long prompts, shared context, long agents, or tool loops, or a reported hit rate is not trusted.
- LLM request shape changed where repeated long prompts, TTFT, cached-token telemetry, or LLM cost matter: inspect prompt text, message order, request builders, tools, schemas, `response_format`, provider API surface, model/router settings, agent loops, or context compaction.
- Long system prompts, tool catalogs, schemas, static documents, few-shot/RAG context, provider cache APIs, or vLLM/SGLang multi-replica KV deployments with KV pressure, tokenizer/chat-template drift, cache salts, or APC benchmarks such as `vllm bench serve`, `prefix_repetition`, and `benchmark_prefix_caching.py`.

## When not to use

Do not use this skill for:
- generic prompt writing, prompt-quality editing, or ordinary short prompt edits without repeated-prefix, TTFT, cache telemetry, or LLM cost concern
- generic RAG design unless repeated context placement/cacheability is part of the task
- token counting or context-window sizing only
- response caching only, unless comparing it with prompt prefix caching
- non-LLM frontend/backend performance or non-inference Kubernetes routing
- speculative savings claims without usage data or explicitly stated assumptions

Частые вопросы

Можно установить без Node.js?

Да, через install.sh из локальной копии репозитория: bash install.sh --source-dir . --agent claude, codex или both.

Что нужно для локальных скриптов?

Python 3.10+, используется только стандартная библиотека.

Выбор редакции

Самообучающийся агент от Nous Research: терминал, мессенджеры, cron-задачи и скиллы, которые он пишет сам

CLIВысокий риск245,4 тыс.
Выбор редакции

Агент Anthropic для терминала, IDE и GitHub: понимает кодовую базу, выполняет задачи и работает с git

CLIВысокий риск145 тыс.
Выбор редакции

Агент OpenAI для программирования, который работает локально в терминале, с версиями для IDE и десктопа

CLIВысокий риск124,1 тыс.
Выбор редакции

Открытый агент от Google для терминала на моделях Gemini: работа с кодом, shell, веб-поиск и MCP

CLIВысокий риск107 тыс.