Visual Skills — два навыка для промптинга изображений и видео в AI-агентах
📂 Исходный код на GitHubДва профессиональных Claude-навыка для AI-визуала: image-скилл пишет промпты под Nano Banana и GPT Image 2, video-скилл выступает гибридом режиссёра/сценариста/монтажёра и пишет промпты под Seedance, Kling и Veo. Работают в Claude Code, Cursor, Windsurf, OpenCode, Hermes-agent.
Что это
Visual Skills — два профессиональных Claude-навыка для AI-визуала. Они заменяют подход «сделай cinematic, 4k, masterpiece» на полноценные продакшн-промпты: навык сам выбирает модель под задачу, применяет её синтаксис и возвращает готовый к копипасте промпт с заголовком (модель, качество, размер).
В репозитории два независимых навыка:
image— промптинг для генерации картинок (Nano Banana и GPT Image 2);video— промптинг для генерации видео (Seedance, Kling, Veo).
Оба поставляются и как исходные папки, и как запакованные .skill-архивы. Лицензия — MIT.
Поддерживаемые модели
Генерация изображений
- Nano Banana 2 (Flash) — Google Gemini 3 Flash Image. Дефолтная рабочая лошадка: быстро и дёшево, около $0.04 за картинку.
- Nano Banana Pro — Google Gemini 3 Pro Image. Сложные многослойные сцены, до 14 референсов, image grounding (узнавание реальных мест и видов). Около $0.15 за картинку.
- GPT Image 2 — OpenAI. Брендовые ассеты, плотный текст, UI-моки, правки с жёстким сохранением исходника, до 16 референсов. Параметр
quality: low / medium / high. - GPT Image 1.5 / 1 — legacy, только для миграции.
- GPT Image 1-mini — дешёвые exploratory-пакеты.
Генерация видео
- Seedance 1.0 / 1.5 / 2.0 Pro — ByteDance. Мульти-шот в одном клипе, быстрый монтажный драматизм, 1080p, до 12 секунд. Флаги
--resolution / --duration / --camerafixed, лок персонажа через@img1. - Seedance Lite — дешевле, 720p, для пакетной генерации.
- Kling 1.6 / 2.1 / 2.5 Turbo / 2.6 Pro — Kuaishou. Консистентность персонажа через Element Binding, Motion Brush, Motion Transfer, социальные вертикали. Отдельное поле negative prompt.
- Kling 3.0 (pro / standard) — нативный мульти-шот до 6 шотов в одной генерации, нативный диалог + lip-sync, управление тоном голоса, 15 секунд непрерывной выдачи, разметка персонажей прямо в промпте через
[Character A: ...]. - Veo 3 / Veo (flagship) — Google. Нативный диалог, lip-sync, синхронный SFX, JSON-промпты, коммерческий лоск. До 8 секунд.
- Runway Gen-4, Luma Dream Machine, Pika 2, Sora — generic-указания через универсальные правила, выделенных референсов пока нет.
Совместимость
Навыки — это просто markdown плюс запакованный .skill-архив. Формат Claude Skill поддерживают:
- Claude Code —
~/.claude/skills/илиclaude install image.skill; - Claude.ai Projects — загрузить папку в knowledge base проекта;
- Claude Agent SDK — указать папку в определении агента;
- Cursor / Windsurf — копировать в rules проекта;
- Cline / Roo Code — положить папку в контекст агента;
- OpenCode / opencode-ai — зарегистрировать как skill в конфиге;
- Hermes-agent — загрузить через skill loader.
Контент — model-agnostic, поэтому навыки работают и на Opus / Sonnet / Haiku, и деградируют мягко на GPT / Gemini / open-weights агентах.
image — что делает
Навык пишет промпты для генерации картинок. Сам выбирает между Nano Banana и GPT Image 2, применяет синтаксис выбранной модели, возвращает готовый промпт с заголовком (модель, качество, размер).
Покрываемые задачи:
- редакционная фотография, постеры, рекламные креативы;
- продуктовая съёмка, упаковка, моки;
- UI-моки и скриншоты продуктов;
- инфографика, диаграммы, слайды;
- правки — try-on, замена света и погоды, удаление объектов, реставрация, локализация;
- консистентность персонажа между картинками;
- раскадровки, комиксы, последовательный нарратив;
- sketch-to-photo, wireframe → 2D → 3D, поэтажные планы.
Правило выбора модели:
- реальное место или вид (image grounding) → Nano Banana;
- экстремальные соотношения сторон (1:8, 8:1, 4:1) → Nano Banana;
- правка с жёстким сохранением (try-on, swap) → GPT Image 2;
- плотный мелкий текст, много шрифтов, бренд-ассеты → GPT Image 2 с
quality: high; - UI-мок или продуктовый скриншот → GPT Image 2;
- дефолт, дёшево и быстро → Nano Banana 2.
Внутри image/ лежат референсные файлы: models.md, nano-banana.md, gpt-image.md, golden-rules.md, prompt-framework.md, creative-direction.md, text-rendering.md, editing.md, characters.md, slides.md, storyboards.md, structural.md, dimensional.md.
video — что делает
Навык пишет промпты для генерации видео. Работает как гибрид режиссёра / сценариста / монтажёра: применяет кинодраматургию (scene formula, правило шести Мёрча, blocking, staging) и специфический синтаксис модели (Seedance multi-shot, Kling Element Binding, Veo JSON / dialogue).
Покрываемые задачи:
- одиночные 5-секундные клипы и сшитые истории на 15 / 30 / 60+ секунд;
- режиссёрские трактовки и шот-листы (shot card на 14 полей);
- раскадровка по сценарию;
- аудит промпта («вот мой промпт, почини»);
- перевод сценария и сюжетной линии в покадровые промпты;
- континуитет между клипами (лок персонажа, костюм, логика света);
- жанровые шаблоны: коммерция, музыкальный клип, драма, экшн, мода, UGC, продуктовое видео.
Правило выбора модели:
- мульти-шот в одном клипе, быстрый монтажный драматизм, синтаксис «Cut to», аудио не нужно → Seedance;
- мульти-шот с диалогом и lip-sync, до 15 секунд, разные голоса у разных персонажей → Kling 3.0;
- консистентный персонаж в серии соц-роликов без диалога, Motion Brush, дешевле → Kling 2.6 Pro;
- диалог, lip-sync, синхронный SFX, полированный рекламный ролик с закадровым голосом, JSON-промпты → Veo.
Внутри video/ лежат референсные файлы: dramaturgy.md, universal-rules.md, seedance.md, kling.md, veo.md, role-modes.md, patterns-and-genres.md, camera-lighting-vocabulary.md, fixes-and-skeletons.md.
Установка
Вариант A — установить запакованный .skill:
# Claude Code
claude install image.skill
claude install video.skill
Вариант B — клонировать исходники и положить папки в нужное место:
git clone https://github.com/smixs/visual-skills.git
# Claude Code
cp -r visual-skills/image ~/.claude/skills/
cp -r visual-skills/video ~/.claude/skills/
# Cursor / Windsurf — в rules проекта
cp -r visual-skills/image .cursor/rules/
Примеры использования
Быстрые image-промпты:
«Сделай промпт для постера офисной кружки с надписью BEST DAY EVER, фон #f5f5dc, 16:9»
«Edit this product shot — change the background to plain white, keep the bottle exactly as is»
Image с явным выбором модели:
«Use GPT Image 2 to mock up a Spotify-like UI for a meditation app, quality high»
«Use Nano Banana Pro — cinematic photograph of the Charles Bridge in Prague at golden hour, must be architecturally accurate»
Видео — одиночный промпт:
«Напиши промпт для Seedance — голодный мужик ночью находит последнюю сосиску в холодильнике, 5 секунд, мульти-шот»
Видео — полная раскладка:
«Раскадруй 30-секундный ролик про чувство вины. Главная эмоция — guilt. Опорный объект — телефон с непрочитанным сообщением»
«Audit this prompt: [...]. What's broken, how to fix?»
«Translate this script into 6 × 5-second Seedance prompts»
Как это устроено
Каждый SKILL.md — это тонкий роутер. В теле написано «перед генерацией промпта загрузи эти референсы именно в таком порядке». Все настоящие правила — синтаксис конкретной модели, драматургия, Details Law, забаненные фразы, которые ломают модель — лежат только в references/. Так агент вынужден идти в референсы и не выдаёт ленивый generic-результат.
Для видео действует жёсткое правило: каждый шот обязан содержать три конкретные детали — environmental pressure (холодный свет холодильника, мокрый асфальт, мигающий люминесцент), physical micro-action (челюсть сжимается, костяшки белеют) и звуковой или визуальный мотив. Слова «cinematic», «epic», «stunning», «masterpiece» забанены — они не рендерятся.
Кредиты и источники
- Nano Banana — Google Gemini 3 Pro Image / Flash Image, промптинг по гайдам fal.ai и Google AI Studio.
- GPT Image 2 — OpenAI, по OpenAI developers cookbook и fal.ai GPT Image 2 prompting guide.
- Seedance — ByteDance Seed, официальная документация Seedance 2.0.
- Kling — Kuaishou, официальная документация Kling.
- Veo — Google DeepMind, официальная документация Veo.
- Видеодраматургия — Уолтер Мёрч (In the Blink of an Eye, Rule of Six), Акира Куросава (среда как персонаж), Дэвид Финчер (мотивированная камера), Стивен Спилберг (пространственная ясность), Джонатан Глейзер (однопредложечный клип), Пон Чжун-хо (раскадровка после локаций).
Сравнение с Disruptor
Disruptor от того же автора — это процесс-пайплайн из 12 навыков с роутером и гейтами. Visual Skills — узкая доменная пара: image + video. Они естественно складываются: Disruptor задаёт рамку процесса, Visual Skills дают предметный вкус для визуальной части. Сборщики Disruptor на этапе 5 могут подхватить визуальный вкус через подключение image/ и video/ как дополнительных доменных пакетов.
Лицензия
MIT — форкайте, адаптируйте, выпускайте визуал лучше.
Источник: https://github.com/smixs/visual-skills