Qwen3.8-Omni-Flash: омни-модальная модель для агентных сценариев

· 1 мин чтения
qwen multimodal llm models ai-agents
Qwen3.8-Omni-Flash: омни-модальная модель для агентных сценариев

Команда Qwen выпустила Qwen3.8-Omni-Flash — омни-модальную модель нового поколения, которая принимает на вход текст, изображения, аудио и видео. Главная заявка звучит амбициозно: двигаться от «понимания омни-модального контента» к «планированию задач, вызову инструментов и выполнению творческой работы». Модель ориентирована на реальные рабочие сценарии: монтаж видео, создание музыкальных клипов, комментарии к фильмам, сводки по аудио и видео и диалоги в реальном времени.

Что обещают

Модель поддерживает контекстное окно в 1 миллион токенов, сохраняя при этом качество работы с текстом на уровне сопоставимой текстовой модели. По среднему баллу на 29 бенчмарках Qwen3.8-Omni-Flash обходит Qwen3.5-Omni-Plus более чем на 25%, а цена API за час аудиовхода снизилась более чем на 98%, за час аудиовизуального входа — более чем на 93%.

По аудиовизуальным задачам модель приближается к Gemini 3.8 Flash, а по чисто аудио-задачам, по данным команды, превосходит её. Особенно заметен прогресс в агентных сценариях:

Бенчмарк Qwen3.8-Omni-Flash Qwen3.5-Omni-Plus Gemini 3.8 Flash
WildClawBench-MM 71.0 34.5 58.9
UniClawBench 69.6 67.1 69.0
AgenticVBench 36.8 14.5 45.0
OmniGAIA 74.0 57.2 78.6

Поразительно и качество распознавания многоголосых встреч: на AliMeeting метрики DER/cpWER улучшились с 88.11/89.61 у предыдущего поколения до 3.35/17.18.

Понимание длинного аудио и видео

Контролируемое описание видео. Раньше модель отвечала на вопрос «что я вижу», теперь — на вопрос «что хочет знать пользователь». Можно задать предмет описания, временной диапазон, уровень детализации и формат вывода: обзор ролика, поиск ключевых фрагментов или глубокий разбор действий персонажей, ракурсов, света и звука.

Агентный разбор длинных видео. Вместо того чтобы прогонять через модель многочасовую запись целиком, агент сам решает, что смотреть и слушать, и находит нужный фрагмент за несколько раундов поиска «от грубого к точному». На OmniVideoBench такой режим поднимает точность с 63.4 до 67.8 и снижает расход токенов с 145 736 до 79 117 — примерно на 46%.

Встречи от протокола к действиям. Модель нативно поддерживает до часа аудиовизуального входа и сквозной пайплайн: сегментация спикеров, транскрипция и сопоставление личностей по звуку и видео. На выходе — протокол встречи, список задач и анализ рисков проекта. А вместе с агентами и инструментами — отправка писем, организация задач и даже начало программирования по итогам созвона.

Глубокое исследование по видео. Модель сочетает запрос пользователя с содержимым ролика, собирает материалы из интернета (изображения, видео, документы) и выдаёт иллюстрированный исследовательский отчёт. Пример из блога: разбор туториала по устранению цветовой каймы при вырезании волос в Photoshop с объяснением режимов наложения.

Производство контента

  • Music2MV — модель разбирает структуру, ритм, настроение и партии трека, проектирует персонажей и кадры, а также выводит текст песни построчно с таймкодами для синхронизации вокала, субтитров и визуала.
  • Перевод коротких сериалов — одна фраза-запрос запускает полный пайплайн локализации: распознавание реплик по спикерам, перевод, клонирование голосов и озвучка, сведение звука и финальный контроль качества.
  • Комментарии к полнометражным фильмам — агент справляется с картинами на два-три часа: выделяет ключевые сюжетные точки, пишет сценарий комментария, делает озвучку и монтаж, автоматически балансируя громкость и темп речи между оригинальными диалогами и закадровым текстом.

Модель, которая обучает другую модель

Пожалуй, самый интересный эксперимент: Qwen3.8-Omni-Flash получила задачу за 12 часов улучшить распознавание сычуаньского диалекта у маленькой Qwen2.5-Omni-3B и выдать рабочую модель. Агент сам выбрала датасет WenetSpeech-Chuan, зафиксировала критерии оценки и базовый уровень, прослушала аудиопримеры, поставила диагноз ошибкам и собрала обучающие данные. За четыре раунда экспериментов было создано 3 413 обучающих примеров, удачные изменения сохранялись, неудачные откатывались. Итог: character error rate снизился с 25.79% до 15.30% — относительное улучшение около 40.7%.

Сжатие знаний из видео

  • Video2Note (открытый код внутри Qwen-MM-Plugins) — превращает многочасовые видео в PDF-конспекты: ключевые шаги, иллюстрации-кадры, текст и таймкоды.
  • Omni Skill Creator — извлекает из демонстраций стандартные операционные процедуры (SOP) и превращает одно показанное действие в проверенный и пригодный к переиспользованию файл Agent Skill.md.

Версия реального времени

Для непрерывного низколатентного взаимодействия представлена Qwen3.8-Omni-Flash-Realtime: подключение по WebSocket и WebRTC, восприятие живого аудио- и видеопотока, вызов инструментов прямо в разговоре. Три показательных сценария:

  • Тренировка произношения — модель моделирует произношение и семантику совместно, понимает акцентированную речь и в реальном времени генерирует эталонные примеры.
  • Пространственное аудио — первая омни-модальная модель, определяющая направление и расстояние до источника звука: команды вроде «подойди сюда» или «посмотри, что там звенит» завершаются локализацией, планированием маршрута и навигацией.
  • Внешние знания через Skills — в клиентский сценарий (например, поддержка) подгружаются стиль бренда, регламенты и правила общения.

По цифрам API: около 85 токенов в секунду при генерации текста, первый аудиопакет — примерно через секунду, коэффициент реального времени генерации аудио около 0.15.

Код и текст не просели

Частый риск мультимодальных моделей — деградация текстовых способностей. Здесь её не видно: Qwen3.8-Omni-Flash держится близко к текстовой Qwen3.8-Flash и уверенно выглядит на фоне конкурентов:

Бенчмарк Qwen3.8-Omni-Flash
SWE-bench Pro 63.3
SWE-bench Multilingual 80.5
LiveCodeBench v6 92.6
GPQA Diamond 91.0
DeepSWE 1.1 57.8

Распознавание речи работает на 74 языках (включая русский) и 39 китайских диалектах, генерация речи — на 29 языках, включая русский.

Как попробовать

Модель доступна на платформе Qianwen AI и через API Alibaba Cloud Model Studio. API совместим с OpenAI Chat Completions и Responses, поддерживает параметр reasoning_effort (xhigh по умолчанию, medium, low) для управления глубиной рассуждений и опцию preserve_thinking, включённую по умолчанию.

Для агентных сценариев расширен набор плагинов Qwen-MM-Plugins: core (чтение изображений, кадров видео, PDF и Office-документов), api (OCR, транскрипция, диаризация спикеров), omni-chatcut (клипы и киноверсии), omni-video2note, omni-skill-creator и omni-memory. Плагины ставятся в Qwen Code, Claude Code, Codex, Gemini CLI, Qoder, CodeBuddy и OpenClaw — руками или по команде:

curl -fsSL https://raw.githubusercontent.com/QwenLM/Qwen-MM-Plugins/main/install.sh | bash

Для realtime-взаимодействия анонсирован опенсорсный Qwen-Live Harness — раннер вокруг Realtime API с делегированием задач, проактивным взаимодействием, долговременной памятью и управлением контекстом:

npm install -g qwen-live-harness
qwen-live-harness init
qwen-live-harness

Главная мысль релиза: аудио и видео перестают быть просто «входными данными» и становятся основной средой, через которую агенты воспринимают мир, рассуждают и выполняют задачи — от понимания ролика до готового смонтированного результата.

Источник: https://qwen.ai/blog?id=qwen3.8-omni-flash