Visual Skills — два навыка для промптинга изображений и видео в AI-агентах

· 3 мин чтения
ai-agents skills claude-code prompt-engineering tools
📂 Исходный код на GitHub

Два профессиональных Claude-навыка для AI-визуала: image-скилл пишет промпты под Nano Banana и GPT Image 2, video-скилл выступает гибридом режиссёра/сценариста/монтажёра и пишет промпты под Seedance, Kling и Veo. Работают в Claude Code, Cursor, Windsurf, OpenCode, Hermes-agent.

Visual Skills — два навыка для промптинга изображений и видео в AI-агентах

Что это

Visual Skills — два профессиональных Claude-навыка для AI-визуала. Они заменяют подход «сделай cinematic, 4k, masterpiece» на полноценные продакшн-промпты: навык сам выбирает модель под задачу, применяет её синтаксис и возвращает готовый к копипасте промпт с заголовком (модель, качество, размер).

В репозитории два независимых навыка:

  • image — промптинг для генерации картинок (Nano Banana и GPT Image 2);
  • video — промптинг для генерации видео (Seedance, Kling, Veo).

Оба поставляются и как исходные папки, и как запакованные .skill-архивы. Лицензия — MIT.

Поддерживаемые модели

Генерация изображений

  • Nano Banana 2 (Flash) — Google Gemini 3 Flash Image. Дефолтная рабочая лошадка: быстро и дёшево, около $0.04 за картинку.
  • Nano Banana Pro — Google Gemini 3 Pro Image. Сложные многослойные сцены, до 14 референсов, image grounding (узнавание реальных мест и видов). Около $0.15 за картинку.
  • GPT Image 2 — OpenAI. Брендовые ассеты, плотный текст, UI-моки, правки с жёстким сохранением исходника, до 16 референсов. Параметр quality: low / medium / high.
  • GPT Image 1.5 / 1 — legacy, только для миграции.
  • GPT Image 1-mini — дешёвые exploratory-пакеты.

Генерация видео

  • Seedance 1.0 / 1.5 / 2.0 Pro — ByteDance. Мульти-шот в одном клипе, быстрый монтажный драматизм, 1080p, до 12 секунд. Флаги --resolution / --duration / --camerafixed, лок персонажа через @img1.
  • Seedance Lite — дешевле, 720p, для пакетной генерации.
  • Kling 1.6 / 2.1 / 2.5 Turbo / 2.6 Pro — Kuaishou. Консистентность персонажа через Element Binding, Motion Brush, Motion Transfer, социальные вертикали. Отдельное поле negative prompt.
  • Kling 3.0 (pro / standard) — нативный мульти-шот до 6 шотов в одной генерации, нативный диалог + lip-sync, управление тоном голоса, 15 секунд непрерывной выдачи, разметка персонажей прямо в промпте через [Character A: ...].
  • Veo 3 / Veo (flagship) — Google. Нативный диалог, lip-sync, синхронный SFX, JSON-промпты, коммерческий лоск. До 8 секунд.
  • Runway Gen-4, Luma Dream Machine, Pika 2, Sora — generic-указания через универсальные правила, выделенных референсов пока нет.

Совместимость

Навыки — это просто markdown плюс запакованный .skill-архив. Формат Claude Skill поддерживают:

  • Claude Code — ~/.claude/skills/ или claude install image.skill;
  • Claude.ai Projects — загрузить папку в knowledge base проекта;
  • Claude Agent SDK — указать папку в определении агента;
  • Cursor / Windsurf — копировать в rules проекта;
  • Cline / Roo Code — положить папку в контекст агента;
  • OpenCode / opencode-ai — зарегистрировать как skill в конфиге;
  • Hermes-agent — загрузить через skill loader.

Контент — model-agnostic, поэтому навыки работают и на Opus / Sonnet / Haiku, и деградируют мягко на GPT / Gemini / open-weights агентах.

image — что делает

Навык пишет промпты для генерации картинок. Сам выбирает между Nano Banana и GPT Image 2, применяет синтаксис выбранной модели, возвращает готовый промпт с заголовком (модель, качество, размер).

Покрываемые задачи:

  • редакционная фотография, постеры, рекламные креативы;
  • продуктовая съёмка, упаковка, моки;
  • UI-моки и скриншоты продуктов;
  • инфографика, диаграммы, слайды;
  • правки — try-on, замена света и погоды, удаление объектов, реставрация, локализация;
  • консистентность персонажа между картинками;
  • раскадровки, комиксы, последовательный нарратив;
  • sketch-to-photo, wireframe → 2D → 3D, поэтажные планы.

Правило выбора модели:

  • реальное место или вид (image grounding) → Nano Banana;
  • экстремальные соотношения сторон (1:8, 8:1, 4:1) → Nano Banana;
  • правка с жёстким сохранением (try-on, swap) → GPT Image 2;
  • плотный мелкий текст, много шрифтов, бренд-ассеты → GPT Image 2 с quality: high;
  • UI-мок или продуктовый скриншот → GPT Image 2;
  • дефолт, дёшево и быстро → Nano Banana 2.

Внутри image/ лежат референсные файлы: models.md, nano-banana.md, gpt-image.md, golden-rules.md, prompt-framework.md, creative-direction.md, text-rendering.md, editing.md, characters.md, slides.md, storyboards.md, structural.md, dimensional.md.

video — что делает

Навык пишет промпты для генерации видео. Работает как гибрид режиссёра / сценариста / монтажёра: применяет кинодраматургию (scene formula, правило шести Мёрча, blocking, staging) и специфический синтаксис модели (Seedance multi-shot, Kling Element Binding, Veo JSON / dialogue).

Покрываемые задачи:

  • одиночные 5-секундные клипы и сшитые истории на 15 / 30 / 60+ секунд;
  • режиссёрские трактовки и шот-листы (shot card на 14 полей);
  • раскадровка по сценарию;
  • аудит промпта («вот мой промпт, почини»);
  • перевод сценария и сюжетной линии в покадровые промпты;
  • континуитет между клипами (лок персонажа, костюм, логика света);
  • жанровые шаблоны: коммерция, музыкальный клип, драма, экшн, мода, UGC, продуктовое видео.

Правило выбора модели:

  • мульти-шот в одном клипе, быстрый монтажный драматизм, синтаксис «Cut to», аудио не нужно → Seedance;
  • мульти-шот с диалогом и lip-sync, до 15 секунд, разные голоса у разных персонажей → Kling 3.0;
  • консистентный персонаж в серии соц-роликов без диалога, Motion Brush, дешевле → Kling 2.6 Pro;
  • диалог, lip-sync, синхронный SFX, полированный рекламный ролик с закадровым голосом, JSON-промпты → Veo.

Внутри video/ лежат референсные файлы: dramaturgy.md, universal-rules.md, seedance.md, kling.md, veo.md, role-modes.md, patterns-and-genres.md, camera-lighting-vocabulary.md, fixes-and-skeletons.md.

Установка

Вариант A — установить запакованный .skill:

# Claude Code
claude install image.skill
claude install video.skill

Вариант B — клонировать исходники и положить папки в нужное место:

git clone https://github.com/smixs/visual-skills.git
# Claude Code
cp -r visual-skills/image  ~/.claude/skills/
cp -r visual-skills/video  ~/.claude/skills/

# Cursor / Windsurf — в rules проекта
cp -r visual-skills/image  .cursor/rules/

Примеры использования

Быстрые image-промпты:

«Сделай промпт для постера офисной кружки с надписью BEST DAY EVER, фон #f5f5dc, 16:9»

«Edit this product shot — change the background to plain white, keep the bottle exactly as is»

Image с явным выбором модели:

«Use GPT Image 2 to mock up a Spotify-like UI for a meditation app, quality high»

«Use Nano Banana Pro — cinematic photograph of the Charles Bridge in Prague at golden hour, must be architecturally accurate»

Видео — одиночный промпт:

«Напиши промпт для Seedance — голодный мужик ночью находит последнюю сосиску в холодильнике, 5 секунд, мульти-шот»

Видео — полная раскладка:

«Раскадруй 30-секундный ролик про чувство вины. Главная эмоция — guilt. Опорный объект — телефон с непрочитанным сообщением»

«Audit this prompt: [...]. What's broken, how to fix?»

«Translate this script into 6 × 5-second Seedance prompts»

Как это устроено

Каждый SKILL.md — это тонкий роутер. В теле написано «перед генерацией промпта загрузи эти референсы именно в таком порядке». Все настоящие правила — синтаксис конкретной модели, драматургия, Details Law, забаненные фразы, которые ломают модель — лежат только в references/. Так агент вынужден идти в референсы и не выдаёт ленивый generic-результат.

Для видео действует жёсткое правило: каждый шот обязан содержать три конкретные детали — environmental pressure (холодный свет холодильника, мокрый асфальт, мигающий люминесцент), physical micro-action (челюсть сжимается, костяшки белеют) и звуковой или визуальный мотив. Слова «cinematic», «epic», «stunning», «masterpiece» забанены — они не рендерятся.

Кредиты и источники

  • Nano Banana — Google Gemini 3 Pro Image / Flash Image, промптинг по гайдам fal.ai и Google AI Studio.
  • GPT Image 2 — OpenAI, по OpenAI developers cookbook и fal.ai GPT Image 2 prompting guide.
  • Seedance — ByteDance Seed, официальная документация Seedance 2.0.
  • Kling — Kuaishou, официальная документация Kling.
  • Veo — Google DeepMind, официальная документация Veo.
  • Видеодраматургия — Уолтер Мёрч (In the Blink of an Eye, Rule of Six), Акира Куросава (среда как персонаж), Дэвид Финчер (мотивированная камера), Стивен Спилберг (пространственная ясность), Джонатан Глейзер (однопредложечный клип), Пон Чжун-хо (раскадровка после локаций).

Сравнение с Disruptor

Disruptor от того же автора — это процесс-пайплайн из 12 навыков с роутером и гейтами. Visual Skills — узкая доменная пара: image + video. Они естественно складываются: Disruptor задаёт рамку процесса, Visual Skills дают предметный вкус для визуальной части. Сборщики Disruptor на этапе 5 могут подхватить визуальный вкус через подключение image/ и video/ как дополнительных доменных пакетов.

Лицензия

MIT — форкайте, адаптируйте, выпускайте визуал лучше.

Источник: https://github.com/smixs/visual-skills