Caveman — экономим токены, заставляя ИИ-агентов говорить коротко

· 1 мин чтения
tokens optimization ai-agents skills proxy
📂 Исходный код на GitHub

Почему использовать много токенов, когда мало работает. Вирусный скилл + прокси для coding-агентов, сокращающий 65% токенов благодаря стилю речи кавмана.

Caveman — экономим токены, заставляя ИИ-агентов говорить коротко

Caveman — это набор инструментов, который сокращает расходы на ИИ-агентов заставляя их говорить коротко. Основная идея: агенты пишут слишком длинно, потому что привыкли к шаблонным ответам. Caveman заставляет их отбрасывать лишние слова, сохраняя при этом точность и корректность кода.

Как это работает

Caveman работает на трёх уровнях:

Скилл — файл правил, который заставляет агента отвечать в стиле кавмана. Код, команды, пути к файлам и сообщения об ошибках остаются без изменений. Сокращается только проза вокруг них. Уровень сжатия настраивается: lite (вежливо и коротко), full (по умолчанию), ultra (максимально сжато), wenyan (классический китайский — потому что кто-то попросил).

Прокси — локальный процесс между вашим агентом и провайдером ИИ. Сжимает то, что агент читает: логи, вывод тестов, JSON, diff'ы, результаты поиска. Сжатые данные заменяются на оригиналы по запросу агента через хэндл восстановления. Все бэкапы хранятся в локальной SQLite.

Middleware — обёртка для собственных агентов на TypeScript или Python. Работает так же, как прокси, но встраивается в ваш код одной строкой. Поддерживает LangChain, Vercel AI SDK, OpenAI, Anthropic и другие фреймворки.

Результаты измерений

Кавман прошёл независимую проверку:

Кто измерял Что измеряли Результат
Adobe Research (CAVEWOMAN) 8 моделей, 5 датасетов, 5 уровней сжатия Стоимость снижается 1.4–2.4×, до в лучшем случае
JetBrains 86 реальных задач, A/B сравнение, Claude Code 2.1.200 8.5% fewer output tokens, качество без изменений (p = 0.82)
Репозиторий 10 вопросов, скилл vs контроль Answer concisely., claude-opus-4-6 50% fewer output tokens поверх краткого контроля

Прокси показал результаты в закреплённом бенчмарке на 54 прогонах:

Кейс Claude Code напрямую Через Caveman Изменение
CSV outlier hunt 165,823 74,484 -55.1%
Log needle in haystack 148,807 74,068 -50.2%
YAML config drift 132,124 71,027 -46.2%
Test output failure 150,377 108,514 -27.8%
Deployment JSON drift 147,975 108,939 -26.4%
Dashboard HTML alert 140,687 154,641 +9.9%
Итого 885,793 591,673 -33.2%

18 из 18 проверок ответов пройдены. Кейс HTML остался красным — в нём не было трансформации сжатия, и Caveman заплатил накладные расходы без выгоды.

Установка

Самый простой способ — скилл:

npx skills add JuliusBrussee/caveman -g

Работает в 30+ агентах: Claude Code, Codex, Gemini, Cursor, Windsurf, Cline, Copilot и других.

Прокси:

npm install -g @caveman-ai/cli && caveman setup --install
caveman claude        # или codex · gemini · aider · kilo · qwen · opencode

Middleware:

npm install @caveman-ai/middleware @caveman-ai/sdk
pip install 'caveman-middleware[langchain]' caveman-sdk

Использование

После установки скилла:

  • /caveman lite — вежливо и коротко
  • /caveman ultra — максимально сжато
  • /caveman-commit — компактные сообщения коммитов
  • /caveman-review — одно исправление на строку: L42: 🔴 null deref. Guard it.
  • /caveman-compress CLAUDE.md — сжатие файлов памяти

Прокси анализирует токены:

caveman learn             # читает историю агента и ранжирует токен-криминалов
caveman learn implement   # исправляет проблемы по одной, с откатом при неудаче
caveman trial -- claude   # A/B сравнение сессий

Сравнение с альтернативами

Инструмент Что сжимает Возврат оригинала Телефон домой
Caveman Вывод (скилл) + чтение (прокси) Всегда, byte-exact в SQLite Анонимные счётчики, caveman telemetry off
RTK Только вывод shell-команд При ошибке или по запросу Отключен по умолчанию
Headroom Инструменты, логи, файлы, история Да, обратимый кэш Включен по умолчанию

В прямом сравнении на одном бенчмарке: Caveman -33.2% входных токенов (18/18 ответов верны), Headroom -6.7% (15/18 ответов верны).

Лицензия

Скилл и CLI — MIT. Движок прокси — BSL-1.1 с конвертацией в Apache-2.0 после 2030-06-21 или через 4 года после релиза.

Когда использовать

Caveman выгоден, если вы читаете ответы агента больше, чем копируете их куда-то, запускаете длинные сессии с логами и выводом тестов, и платите за токены. Не выгоден, если платите за запросы (GitHub Copilot premium requests) или генерируете почти чистый код без прозы. Правила добавляют ~1000 input-токенов на каждый вызов, и на коротких вопросах-ответах это может перекрыть экономию.

Источник: https://github.com/JuliusBrussee/caveman