Caveman — экономим токены, заставляя ИИ-агентов говорить коротко
📂 Исходный код на GitHubПочему использовать много токенов, когда мало работает. Вирусный скилл + прокси для coding-агентов, сокращающий 65% токенов благодаря стилю речи кавмана.
Caveman — это набор инструментов, который сокращает расходы на ИИ-агентов заставляя их говорить коротко. Основная идея: агенты пишут слишком длинно, потому что привыкли к шаблонным ответам. Caveman заставляет их отбрасывать лишние слова, сохраняя при этом точность и корректность кода.
Как это работает
Caveman работает на трёх уровнях:
Скилл — файл правил, который заставляет агента отвечать в стиле кавмана. Код, команды, пути к файлам и сообщения об ошибках остаются без изменений. Сокращается только проза вокруг них. Уровень сжатия настраивается: lite (вежливо и коротко), full (по умолчанию), ultra (максимально сжато), wenyan (классический китайский — потому что кто-то попросил).
Прокси — локальный процесс между вашим агентом и провайдером ИИ. Сжимает то, что агент читает: логи, вывод тестов, JSON, diff'ы, результаты поиска. Сжатые данные заменяются на оригиналы по запросу агента через хэндл восстановления. Все бэкапы хранятся в локальной SQLite.
Middleware — обёртка для собственных агентов на TypeScript или Python. Работает так же, как прокси, но встраивается в ваш код одной строкой. Поддерживает LangChain, Vercel AI SDK, OpenAI, Anthropic и другие фреймворки.
Результаты измерений
Кавман прошёл независимую проверку:
| Кто измерял | Что измеряли | Результат |
|---|---|---|
| Adobe Research (CAVEWOMAN) | 8 моделей, 5 датасетов, 5 уровней сжатия | Стоимость снижается 1.4–2.4×, до 3× в лучшем случае |
| JetBrains | 86 реальных задач, A/B сравнение, Claude Code 2.1.200 | 8.5% fewer output tokens, качество без изменений (p = 0.82) |
| Репозиторий | 10 вопросов, скилл vs контроль Answer concisely., claude-opus-4-6 |
50% fewer output tokens поверх краткого контроля |
Прокси показал результаты в закреплённом бенчмарке на 54 прогонах:
| Кейс | Claude Code напрямую | Через Caveman | Изменение |
|---|---|---|---|
| CSV outlier hunt | 165,823 | 74,484 | -55.1% |
| Log needle in haystack | 148,807 | 74,068 | -50.2% |
| YAML config drift | 132,124 | 71,027 | -46.2% |
| Test output failure | 150,377 | 108,514 | -27.8% |
| Deployment JSON drift | 147,975 | 108,939 | -26.4% |
| Dashboard HTML alert | 140,687 | 154,641 | +9.9% |
| Итого | 885,793 | 591,673 | -33.2% |
18 из 18 проверок ответов пройдены. Кейс HTML остался красным — в нём не было трансформации сжатия, и Caveman заплатил накладные расходы без выгоды.
Установка
Самый простой способ — скилл:
npx skills add JuliusBrussee/caveman -g
Работает в 30+ агентах: Claude Code, Codex, Gemini, Cursor, Windsurf, Cline, Copilot и других.
Прокси:
npm install -g @caveman-ai/cli && caveman setup --install
caveman claude # или codex · gemini · aider · kilo · qwen · opencode
Middleware:
npm install @caveman-ai/middleware @caveman-ai/sdk
pip install 'caveman-middleware[langchain]' caveman-sdk
Использование
После установки скилла:
/caveman lite— вежливо и коротко/caveman ultra— максимально сжато/caveman-commit— компактные сообщения коммитов/caveman-review— одно исправление на строку:L42: 🔴 null deref. Guard it./caveman-compress CLAUDE.md— сжатие файлов памяти
Прокси анализирует токены:
caveman learn # читает историю агента и ранжирует токен-криминалов
caveman learn implement # исправляет проблемы по одной, с откатом при неудаче
caveman trial -- claude # A/B сравнение сессий
Сравнение с альтернативами
| Инструмент | Что сжимает | Возврат оригинала | Телефон домой |
|---|---|---|---|
| Caveman | Вывод (скилл) + чтение (прокси) | Всегда, byte-exact в SQLite | Анонимные счётчики, caveman telemetry off |
| RTK | Только вывод shell-команд | При ошибке или по запросу | Отключен по умолчанию |
| Headroom | Инструменты, логи, файлы, история | Да, обратимый кэш | Включен по умолчанию |
В прямом сравнении на одном бенчмарке: Caveman -33.2% входных токенов (18/18 ответов верны), Headroom -6.7% (15/18 ответов верны).
Лицензия
Скилл и CLI — MIT. Движок прокси — BSL-1.1 с конвертацией в Apache-2.0 после 2030-06-21 или через 4 года после релиза.
Когда использовать
Caveman выгоден, если вы читаете ответы агента больше, чем копируете их куда-то, запускаете длинные сессии с логами и выводом тестов, и платите за токены. Не выгоден, если платите за запросы (GitHub Copilot premium requests) или генерируете почти чистый код без прозы. Правила добавляют ~1000 input-токенов на каждый вызов, и на коротких вопросах-ответах это может перекрыть экономию.
Источник: https://github.com/JuliusBrussee/caveman