video-use: монтаж видео через Claude Code и других агентов

· 1 мин чтения
video-editing agent-skills claude-code ffmpeg ai-agents
📂 Исходный код на GitHub

Open-source скилл для монтажа видео через Claude Code: транскрипция с таймкодами, вырезание filler words, цветокоррекция, субтитры, самопроверка рендера.

video-use: монтаж видео через Claude Code и других агентов

video-use: монтаж видео через Claude Code и других агентов

Команда Browser Use — авторы известного браузерного агента — выпустила video-use: полностью open-source скилл, который позволяет монтировать видео обычным разговором с Claude Code. Кладёшь сырые снимки в папку, пишешь агенту «собери из этого launch-видео» — и получаешь final.mp4. Без таймлайнов, пресетов и меню редактора.

Что умеет video-use

По описанию из README, скилл закрывает типовой монтажный конвейер:

  • Вырезает слова-паразиты (umm, uh, обрывки фраз) и паузы между дублями.
  • Автоматически красит картинку — тёплый кинематографичный грейд, нейтральный «пунш» или любая своя цепочка ffmpeg-фильтров.
  • Ставит 30-миллисекундные аудио-фейды на каждом склейке, чтобы не слышать щелчков.
  • Вшивает субтитры в вашем стиле — по умолчанию куски из двух слов капсом, но формат полностью настраивается.
  • Генерирует анимационные оверлеи через HyperFrames, Remotion, Manim или PIL: каждая анимация запускается в отдельном суб-агенте, параллельно с остальными.
  • Сам проверяет отрендеренный результат на каждой границе склейки, прежде чем показать превью.
  • Сохраняет память сессии в project.md, поэтому через неделю агент продолжает с того места, где вы остановились.

Установка одним промптом

video-use рассчитан не на конкретный редактор, а на любого агента с доступом к шеллу — Claude Code, Codex, Hermes, Openclaw. В README лежит готовый setup-промпт: вставляете его агенту, и он сам клонирует репозиторий, ставит зависимости, регистрирует скилл и один раз просит вставить API-ключ ElevenLabs (нужен для транскрипции, получить можно на elevenlabs.io/app/settings/api-keys). После установки агенту не надо ничего досоздавать самому — он ждёт, пока вы бросите исходники в папку.

Дальше — рутина:

cd /path/to/your/videos
claude    # или codex, hermes и т.д.

В сессии просто пишете: «смонтируй из этого launch-видео». Агент инвентаризирует исходники, предлагает стратегию, ждёт вашего «ок» и собирает edit/final.mp4 рядом с источниками. Все результаты складываются в <videos_dir>/edit/ — каталог скилла остаётся чистым.

Для монтажа «всегда на связи» с собственного VPS или из Telegram README предлагает гонять агента через Browser Use Box.

Ручная установка

Если не хочется возиться с промптом:

# 1. Клонировать и сделать симлинк в каталог скиллов агента
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use        # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use       # Codex

# 2. Зависимости
cd ~/Developer/video-use
uv sync                         # или: pip install -e .
brew install ffmpeg             # обязательно
brew install yt-dlp             # опционально, для скачивания онлайн-источников

# 3. API-ключ ElevenLabs
cp .env.example .env
$EDITOR .env                    # ELEVENLABS_API_KEY=...

Для кого это

video-use позиционируется как инструмент для любого контента: talking heads, монтажки, туториалы, travel-ролики, интервью — скилл не завязан на один формат и не требует заранее выбрать пресет. Это отличает его от классических NLE-подходов, где сначала выбираешь шаблон, а потом подгоняешь материал: здесь агент сначала смотрит (через транскрипт), спрашивает при необходимости, и только потом режет.

Отдельно стоит функция персистентной памяти. project.md хранит состояние проекта между запусками — через неделю новая сессия Claude Code подхватывает уже принятые решения по стилю субтитров, грейду и структуре ролика, без повторного брифа.

Как LLM «смотрит» видео

Ключевая идея: модель никогда не смотрит видео кадрами. Она его читает — через два слоя, вместе дающих всё нужное для склейки с точностью до границы слова.

Слой 1 — аудио-транскрипт (загружается всегда). Один вызов ElevenLabs Scribe на каждый исходник даёт таймкоды на уровне слов, разделение спикеров и аудио-события ((laughter), (applause), (sigh)). Все дубли упаковываются в один файл takes_packed.md размером около 12 КБ — это основной «рабочий стол» LLM:

## C0103  (duration: 43.0s, 8 phrases)
  [002.52-005.36] S0 Ninety percent of what a web agent does is completely wasted.
  [006.08-006.74] S0 We fixed this.

Слой 2 — визуальная композиция (по запросу). Утилита timeline_view для любого тайм-диапазона собирает PNG: плёночную ленту, волну, подписи слов. Вызывается только в моменты решений — спорные паузы, сравнение дублей, проверка точки склейки.

README прямо сравнивает это с наивным подходом: 30 000 кадров × 1 500 токенов = 45 миллионов токенов шума. video-use: 12 КБ текста + горсть PNG. Тот же ход, что и у самого browser-use — давать LLM структурированный DOM вместо скриншота, только для видео.

Конвейер обработки

Transcribe ──> Pack ──> LLM Reasons ──> EDL ──> Render ──> Self-Eval
                                                              │
                                                              └─ issue? fix + re-render (max 3)

После рендера запускается самопроверка: timeline_view прогоняется по итоговому файлу на каждой границе склейки — ловятся визуальные скачки, аудио-щелчки, спрятанные субтитры. Превью вы увидите только после того, как оно пройдёт проверку.

Принципы дизайна

  1. Текст + визуал по запросу. Никакого сброса кадров — поверхность для работы транскрипт.
  2. Аудио главное, картинка следует. Склейки берутся из границ речи и пауз тишины.
  3. Спросить → подтвердить → выполнить → самопроверить → сохранить. Без одобрения стратегии к склейке не прикасаются.
  4. Нулевые предположения о типе контента. Сначала смотрим и спрашиваем, потом монтируем.
  5. 12 жёстких правил, дальше — артистическая свобода. Корректность продакшена не обсуждается, вкус — обсуждается.

Полный свод производственных правил и монтажного ремесла лежит в SKILL.md.

Итог

video-use — это перенос идеи browser-use на монтаж: не кормить модель кадрами, а отдавать структурированные данные и включать визуал только там, где без него не обойтись. Для тех, кто уже живёт в Claude Code и регулярно собирает ролики из сырых дублей, скилл превращает агента в достаточно аккуратного монтажёра: со стратегией, самопроверкой и памятью между сессиями.

Источник: https://github.com/browser-use/video-use