AgentSystem — единый скилл /ship для AI-кодинг-агентов
📂 Исходный код на GitHubSkill pack для AI-кодинг-агентов: вы описываете цель, а единый скилл /ship классифицирует намерение (CREATE, EVOLVE, POLISH, REMOVE, FIX, AUDIT), выбирает глубину (fast, balanced, production), запускает встроенные плейбуки и read-only ревьюер-сабагентов. Никогда не коммитит, не пушит и не открывает PR — вы публикуете сами. MIT.
AgentSystem — это skill pack для AI-кодинг-агентов, который существует ради одной идеи: вы описываете цель, а агент сам выбирает правильный инженерный workflow и глубину, запускает нужные проверки и останавливается, когда код готов. Вся логика спрятана в одном единственном скилле /ship — вам не нужно запоминать каталог команд или угадывать, заслуживает ли изменение быстрого твика или продакшен-гейта. Сайт проекта — agentsystem.dev, репозиторий идёт на GitHub, лицензия — MIT.
Результаты подтверждены бенчмарком
Чтобы доказать, что подход работает, авторы провели контролируемый эксперимент: те же 5 брифов фич, та же продакшен-кодовая база, та же модель (Opus 4.8, xhigh) — тремя способами: обычным промптом, промптом «думай как сеньор» и /ship. Все 15 реализаций вслепую оценивались более сильной моделью по фиксированному рубрику. Результаты:
| Обычный промпт | Промпт «сеньор-инженер» | /ship | |
|---|---|---|---|
| Среднее качество /50 | 43.2 | 41.0 | 47.0 |
| Выигранные фичи | 0/5 | 0/5 | 5/5 |
| Релизнутые краши | 0 | 1 ветка (2 класса крашей) | 0 |
| Инвариантные тесты | 1/5 веток | 0/5 | 5/5 |
Итого: +9% к качеству против обычного промптинга, +15% против персоны-промпта, ноль крашей, а HIGH-severity дыра в авторизации была поймана ревью-гейтом до релиза. Показательно, что префикс персоны оказался даже хуже обычного промпта. Стоимость пайплайна — примерно на 81% больше токенов. Каждый промпт, PR, оценка, стоимость и — важно — все ограничения (маленькая выборка, LLM-судья, конфликт интересов) задокументированы, чтобы вы могли решить сами: полный бенчмарк.
Использование
Весь интерфейс — одна команда:
/ship add stripe webhook handler
/ship the login button doesn't redirect
/ship delete the old beta-flags page
Либо опишите цель обычным текстом и на конце добавьте «use ship skill» (в Cursor скилл можно просто прикрепить). /ship классифицирует, насколько тщательно нужно работать, запускает нужный пайплайн и отчитывается о том, что сделал. Он никогда не коммитит, не пушит и не открывает PR — выбор остаётся за вами после просмотра диффа.
Примеры маршрутизации:
| Вы говорите | /ship решает |
|---|---|
| «добавить страницу настроек» | CREATE → balanced |
| «сделать навбар зелёным» | EVOLVE → fast (косметика) |
| «добавить OAuth» | CREATE → production (auth) |
| «полировать дашборд» | POLISH → UX-чеклист |
| «аудит кодовой базы» | AUDIT → полный обход |
Доступны и явные переопределения: mode=fast, mode=balanced, mode=production, а также подсказки фаз skip= / include=.
Как это устроено
/ship — единственный скилл, видимый в списке инструментов. Всё остальное — плейбуки доставки и ревьюер-сабагенты — упаковано внутри него и оркестрируется автоматически:
- Классификация намерения — CREATE, EVOLVE, POLISH, REMOVE, FIX или AUDIT по формулировке запроса.
- Выбор глубины —
fast(мелкие/косметические правки),balanced(по умолчанию) илиproduction(auth, платежи, миграции, вебхуки, джобы, задачи с несколькими подсистемами). - Чтение соответствующего встроенного плейбука — по одному на запуск, с анонсом пайплайна до начала работы.
- Ред-тим рискованных планов — продакшен-планы и планы с высоким риском по нескольким подсистемам до одобрения проходят независимый read-only ред-тим.
- Запуск встроенных сабагентов — плейбук раскрывается в саб-скилл плейбуки и read-only ревьюеров (опросы, тесты, аудиты безопасности/перф/контрактов) только когда срабатывают соответствующие гейты.
- Сверка и верификация — параллельные находки дедуплицируются в единый сводный реестр; сложные продакшен-изменения после каждой мутации проверяются свежим комбинированным верификатором.
- Честный финальный статус —
diagnosed,locally-verified,partialилиblocked; вам отдаётся только локально проверенный кандидат, который вы сами публикуете.
Работа с высоким риском (production-режим) требует подтверждения перед выполнением. balanced анонсирует план и продолжает, fast просто делает.
Установка
Для Claude Code (плагин-маркетплейс):
/plugin marketplace add https://github.com/AgentSystemLabs/core
/plugin install agentsystem-core@agentsystem
Обновление — /plugin marketplace update agentsystem, удаление — /plugin uninstall agentsystem-core@agentsystem.
Для любого агента, читающего SKILL.md (Cursor, Codex, OpenCode и кастомные):
npx @agentsystemlabs/core init # → ./.claude/skills/ship/
npx @agentsystemlabs/core init --harness cursor # → ./.cursor/skills/ship/
npx @agentsystemlabs/core init --harness codex # → ./.codex/skills/ship/
npx @agentsystemlabs/core init --global # установка на уровне пользователя
npx @agentsystemlabs/core list # что доступно
Поддерживаемые харнессы: claude, codex, cursor, opencode. Устанавливается единственный скилл ship с встроенным деревом — плейбуки доставки и ревьюер-сабагенты идут вместе с ним. Флаг --force позволяет перезаписать существующие файлы.
Что внутри (под капотом)
Ничего из перечисленного не регистрируется отдельно и не появляется в списке инструментов. Плейбуки лежат в skills/ship/playbooks/<name>/PLAYBOOK.md, ревьюер-сабагенты — в skills/ship/subagents/<name>.md.
Плейбуки доставки (один читается и исполняется за запуск): add-feature (CREATE: clarify → explore → design → implement → verify → гейтовые ревью → тесты), modify-feature (EVOLVE: расширение существующего поведения, аудит сдвинутых контрактов), polish-ui (POLISH: UX-чеклист без изменения поведения), remove-feature (REMOVE: безопасное удаление с учётом персистентных данных), fix-bug (FIX: трассировка контрактов рантайма до гипотез, регрессионный тест после фикса), audit (AUDIT: обход техдолга всей кодовой базы).
Саб-скилл плейбуки (запускаются при срабатывании гейтов): add-migration, write-tests, add-e2e-test, add-regression-test, add-empty-error-states, add-observability, simplify, propagate-ui-pattern, realign, harden-types. Скоупные аудиты — audit-authz, audit-a11y.
Ревьюер-сабагенты (read-only, никогда не редактируют файлы): reviewer-code, reviewer-authz, reviewer-security-regression, reviewer-data-integrity, reviewer-contracts, reviewer-boundary-validation, reviewer-concurrency, reviewer-error-boundaries, reviewer-loading-states, reviewer-accessibility-regression, reviewer-client-bundle, reviewer-observability-coverage, reviewer-perf, reviewer-dependencies, reviewer-test-quality, а также мапперы типа crud-surface-mapper, ui-pattern-inspector, utility-finder и runtime-contract-tracer. Продакшен-роли тоже read-only: plan-red-team (вызов рискованных планов против реального кода), findings-reconciler (объединяет параллельные отчёты, разрешает конфликты, ведёт реестр), integration-verifier (атакует стыки комбинированного дерева и перегоняет финальные гейты после всех мутирующих шагов).
Эти роли адаптивны, а не фиксированный налог на каждое изменение: маленькие и обычные правки идут по существующим быстрым путям. Здесь нет ничего, что нужно @-ать или вызывать слеш-командой — панели существуют, чтобы /ship мог запускать параллельные аудиты и возвращать ранжированные по severity находки со ссылками file:line.
Есть только /ship
Других слеш-команд учить не нужно — ship единственный зарегистрированный скилл. Публикация (commit, push, PR) — это ваш собственный git-workflow, а не встроенная команда. Для фич, багов, полировки, удаления и аудитов кодовой базы: используйте /ship.
Больше документации
docs/ship-diagrams.md— Mermaid-диаграммы полной маршрутизации и развёртывания гейтов (для обучения и контрибьюторов).
Лицензия
Проект распространяется под лицензией MIT (см. LICENSE).
Источник: https://github.com/AgentSystemLabs/core