video-use: монтаж видео через Claude Code и других агентов
📂 Исходный код на GitHubOpen-source скилл для монтажа видео через Claude Code: транскрипция с таймкодами, вырезание filler words, цветокоррекция, субтитры, самопроверка рендера.
video-use: монтаж видео через Claude Code и других агентов
Команда Browser Use — авторы известного браузерного агента — выпустила video-use: полностью open-source скилл, который позволяет монтировать видео обычным разговором с Claude Code. Кладёшь сырые снимки в папку, пишешь агенту «собери из этого launch-видео» — и получаешь final.mp4. Без таймлайнов, пресетов и меню редактора.
Что умеет video-use
По описанию из README, скилл закрывает типовой монтажный конвейер:
- Вырезает слова-паразиты (
umm,uh, обрывки фраз) и паузы между дублями. - Автоматически красит картинку — тёплый кинематографичный грейд, нейтральный «пунш» или любая своя цепочка ffmpeg-фильтров.
- Ставит 30-миллисекундные аудио-фейды на каждом склейке, чтобы не слышать щелчков.
- Вшивает субтитры в вашем стиле — по умолчанию куски из двух слов капсом, но формат полностью настраивается.
- Генерирует анимационные оверлеи через HyperFrames, Remotion, Manim или PIL: каждая анимация запускается в отдельном суб-агенте, параллельно с остальными.
- Сам проверяет отрендеренный результат на каждой границе склейки, прежде чем показать превью.
- Сохраняет память сессии в
project.md, поэтому через неделю агент продолжает с того места, где вы остановились.
Установка одним промптом
video-use рассчитан не на конкретный редактор, а на любого агента с доступом к шеллу — Claude Code, Codex, Hermes, Openclaw. В README лежит готовый setup-промпт: вставляете его агенту, и он сам клонирует репозиторий, ставит зависимости, регистрирует скилл и один раз просит вставить API-ключ ElevenLabs (нужен для транскрипции, получить можно на elevenlabs.io/app/settings/api-keys). После установки агенту не надо ничего досоздавать самому — он ждёт, пока вы бросите исходники в папку.
Дальше — рутина:
cd /path/to/your/videos
claude # или codex, hermes и т.д.
В сессии просто пишете: «смонтируй из этого launch-видео». Агент инвентаризирует исходники, предлагает стратегию, ждёт вашего «ок» и собирает edit/final.mp4 рядом с источниками. Все результаты складываются в <videos_dir>/edit/ — каталог скилла остаётся чистым.
Для монтажа «всегда на связи» с собственного VPS или из Telegram README предлагает гонять агента через Browser Use Box.
Ручная установка
Если не хочется возиться с промптом:
# 1. Клонировать и сделать симлинк в каталог скиллов агента
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use # Codex
# 2. Зависимости
cd ~/Developer/video-use
uv sync # или: pip install -e .
brew install ffmpeg # обязательно
brew install yt-dlp # опционально, для скачивания онлайн-источников
# 3. API-ключ ElevenLabs
cp .env.example .env
$EDITOR .env # ELEVENLABS_API_KEY=...
Для кого это
video-use позиционируется как инструмент для любого контента: talking heads, монтажки, туториалы, travel-ролики, интервью — скилл не завязан на один формат и не требует заранее выбрать пресет. Это отличает его от классических NLE-подходов, где сначала выбираешь шаблон, а потом подгоняешь материал: здесь агент сначала смотрит (через транскрипт), спрашивает при необходимости, и только потом режет.
Отдельно стоит функция персистентной памяти. project.md хранит состояние проекта между запусками — через неделю новая сессия Claude Code подхватывает уже принятые решения по стилю субтитров, грейду и структуре ролика, без повторного брифа.
Как LLM «смотрит» видео
Ключевая идея: модель никогда не смотрит видео кадрами. Она его читает — через два слоя, вместе дающих всё нужное для склейки с точностью до границы слова.
Слой 1 — аудио-транскрипт (загружается всегда). Один вызов ElevenLabs Scribe на каждый исходник даёт таймкоды на уровне слов, разделение спикеров и аудио-события ((laughter), (applause), (sigh)). Все дубли упаковываются в один файл takes_packed.md размером около 12 КБ — это основной «рабочий стол» LLM:
## C0103 (duration: 43.0s, 8 phrases)
[002.52-005.36] S0 Ninety percent of what a web agent does is completely wasted.
[006.08-006.74] S0 We fixed this.
Слой 2 — визуальная композиция (по запросу). Утилита timeline_view для любого тайм-диапазона собирает PNG: плёночную ленту, волну, подписи слов. Вызывается только в моменты решений — спорные паузы, сравнение дублей, проверка точки склейки.
README прямо сравнивает это с наивным подходом: 30 000 кадров × 1 500 токенов = 45 миллионов токенов шума. video-use: 12 КБ текста + горсть PNG. Тот же ход, что и у самого browser-use — давать LLM структурированный DOM вместо скриншота, только для видео.
Конвейер обработки
Transcribe ──> Pack ──> LLM Reasons ──> EDL ──> Render ──> Self-Eval
│
└─ issue? fix + re-render (max 3)
После рендера запускается самопроверка: timeline_view прогоняется по итоговому файлу на каждой границе склейки — ловятся визуальные скачки, аудио-щелчки, спрятанные субтитры. Превью вы увидите только после того, как оно пройдёт проверку.
Принципы дизайна
- Текст + визуал по запросу. Никакого сброса кадров — поверхность для работы транскрипт.
- Аудио главное, картинка следует. Склейки берутся из границ речи и пауз тишины.
- Спросить → подтвердить → выполнить → самопроверить → сохранить. Без одобрения стратегии к склейке не прикасаются.
- Нулевые предположения о типе контента. Сначала смотрим и спрашиваем, потом монтируем.
- 12 жёстких правил, дальше — артистическая свобода. Корректность продакшена не обсуждается, вкус — обсуждается.
Полный свод производственных правил и монтажного ремесла лежит в SKILL.md.
Итог
video-use — это перенос идеи browser-use на монтаж: не кормить модель кадрами, а отдавать структурированные данные и включать визуал только там, где без него не обойтись. Для тех, кто уже живёт в Claude Code и регулярно собирает ролики из сырых дублей, скилл превращает агента в достаточно аккуратного монтажёра: со стратегией, самопроверкой и памятью между сессиями.
Источник: https://github.com/browser-use/video-use