Xiaomi MiMo-V2.6: открытая омнимодальная серия с масштабируемым RL

· 2 мин чтения
xiaomi mimo llm benchmarks reinforcement-learning
Xiaomi MiMo-V2.6: открытая омнимодальная серия с масштабируемым RL

Xiaomi выпустила и открыла серию моделей MiMo-V2.6 — очередной шаг на заявленном пути к RSI (recursive self-improvement): масштабирование RL-вычислений на проверяемых сложных задачах, чтобы модель расширяла собственный фронтир способностей через исследование и обратную связь. В серию входят две нативно омнимодальные модели: MiMo-V2.6-Pro — самая способная модель компании на сегодня, и MiMo-V2.6-Flash — баланс интеллекта, эффективности и цены. Для тех, кому нужна экстремальная скорость генерации, выпущен ещё и MiMo-V2.6-Pro-UltraSpeed — до 20-кратной скорости вывода при том же качестве. Веса, технический отчёт, RL-код и тренировочные окружения выложены в открытый доступ: коллекция на HuggingFace и технический отчёт (PDF).

Бенчмарки: кодинг, агенты, визуал, кибербезопасность

Pro близка к фронтирным закрытым моделям, хотя не везде их обгоняет. На DeepSWE v1.1 она набирает 71.9 против 74.2 у DeepSeek V4.1 Flash и 74.0 у Claude Opus 5 и GPT 6 Astra. На агентных задачах расклад похожий: GDPVal 2.1 (Elo по версии Artificial Analysis) — 1673 у Pro против 1735 у Claude Fable 5.1 и 1708 у Opus 5. В кибербезопасности серия и вовсе впереди всех: на CyberGym Flash показывает 95.1, Pro — 94.0 (у DeepSeek V4.1 Flash — 88.1, у GLM 5.3 — 84.5).

Бенчмарк MiMo-V2.6-Pro MiMo-V2.6-Flash Лучший конкурент
DeepSWE v1.1 71.9 67.9 DeepSeek V4.1 Flash — 74.2
MiMo Code Bench (in-house) 63.2 61.2 Claude Opus 5 — 68.6
GDPVal 2.1 (Elo, AA) 1673 Claude Fable 5.1 — 1735
Toolathlon-verified 76.9 73.6 Claude Opus 5 — 80.6
Automation Bench v1.0.6 53.1 52.3 DeepSeek V4.1 Flash — 54.8
Terminal Bench 4.0 34.9 28.8 GPT 6 Astra — 59.6
JobBench 62.0 61.2 Claude Opus 5 — 65.7
MiMo Visual Coding (in-house) 72.3 71.5 GPT 6 Astra — 82.2
OSWorld-Verified 82.0 80.8 Claude Fable 5 — 86.0
CyberGym 94.0 95.1 MiMo-V2.6-Flash — 95.1
ExploitGym 17.8 6.0 GPT 6 Astra — 42.4

Разрыв с собственной предыдущей версией драматичный: MiMo-V2.5-Pro набирала на DeepSWE v1.1 всего 19.0, на Automation Bench — 16.0, на Terminal Bench 4.0 — 1.5, на CyberGym — 40.0.

Сильнейшая открытая модель и парето-фронтир

На Artificial Analysis Intelligence Index (v4.3) MiMo-V2.6-Pro набирает 46.32, обходя Kimi K3 и Qwen3.8 Max — это самый высокий результат среди открытых моделей на сегодня. При этом API-цены не изменились по сравнению с серией V2.5: больше интеллекта за те же деньги сдвигает парето-фронтир «интеллект против стоимости» наружу.

Масштабирование RL — и выкладка всего в открытую

Самая интересная часть релиза — не цифры, а открытый RL-пайплайн. Производственный прогон транслировался вживую на специальной странице. Менее чем за шесть дней Flash и Pro прошли по 30 RL-шагов на roughly 750 тыс. траекторий, потратив около $0.85 млн и $2.62 млн соответственно. Средний pass rate на тренировочных задачах вырос на 25% и 12% в относительном выражении, а на холдаут-бенчмарке DeepSWE v1.1 — примерно на 17 пунктов у Flash (48.8 → 65.68) и на 14 у Pro (58.4 → 72.57). RL оказался sample-efficient, продолжал улучшаться до конца прогона и обобщился за пределы тренировочного распределения.

Масштабирование шло по трём осям:

  • Батчи и пропускная способность. Полностью асинхронная архитектура, 1568 сэмплов на апдейт, тренировка на контексте до 1M токенов и 3.5–3.7 млрд токенов на шаг.
  • Больше задач и сред. Мульти task-набор: кодинг, общие агенты, визуал и кибербезопасность, смешанные между несколькими harness — так прогресс в одной способности усиливает остальные.
  • Больше вычислений на грейдеры. Относительное сравнение внутри группы даёт долгим RL-задачам более точные и разнообразные reward-сигналы, замыкает петлю самоулучшения и подталкивает модель к более коротким путям и меньшему числу токенов на задачу.

Для стабильности на масштабе команда заморозила роутер против training drift и построила защиту от reward hacking: дизайн наград, состязательная оценка, детекция аномалий и перекрёстная проверка между верификаторами. На уровне инфраструктуры — единое представление траекторий и механизм штрафов для более тонких learning-сигналов, высококонкурентное взаимодействие с несколькими агентными фреймворками, разделение control plane и data plane для миграции траекторий, стабилизация per-task sampling ratios в смешанных батчах и оптимизация движков обучения и инференса с обеспечением их консистентности.

От vibe coding к Vibe World

Способности кодинга обобщились за пределы разработки ПО: модель берёт цель, harness и время — и делает реальную продуктивную работу. MiMo-V2.6 объединяет 3D-пространственное рассуждение, мультимодальное восприятие и computer-use агента (CUA), расширяя программирование на естественном языке от сборки софта до сборки интерактивных миров — то, что Xiaomi называет «Vibe World»:

  • Разработка игр. Из картинки, видео или текстового промпта модель декомпозирует запрос на задачи, координирует несколько агентов — строятся 3D-сцены, интерактивная логика, визуальная верификация, затем итеративное уточнение по рендерам до запускаемого мира.
  • 3D-моделирование. Генерация объектов и сцен в Blender из текстового описания или референсного изображения — ассеты для анимации, 3D-печати и геймдева.
  • Воплощённая симуляция. В средах embodied-симуляции модель принимает multicamera-видеопотоки, рассуждает и в замкнутом контуре через визуальный фидбек управляет манипулятором Franka Panda: захват объектов, подбор по цвету, точное размещение.

Визуал, дизайн и видео

Из короткой инструкции модель собирает законченный фронтенд-интерфейс или слайд-дек со структурной вёрсткой, проработанными компонентами, интерактивом и анимацией. Она уверенно работает с Figma и генераторами изображений и видео, удерживая типографику, цвет и компоновку текста с картинками. Показательные кейсы: три презентации, каждая из однострочного брифа — внутренний тренинг по обучению LLM, исследовательская заметка о суперцикле критических металлов и дизайн-ревью годового отчёта.

Отдельная история — видео «под ключ»: визуальный дизайн, раскадровка и монтаж движения, написание музыки и синхронизация монтажа с битом. В образовательном формате модель превращает абстракции вроде разложения Фурье в доступные объяснения с анимацией, а озвучку генерирует MiMo-V2.5-TTS, синхронизированную с картинкой.

Музыка

Первая попытка композиции тоже впечатляет. MiMo-V2.6-Pro попросили написать оркестровое произведение примерно на десять инструментов — модель сочинила партитуру и сама конвертировала её в MIDI. Результат прослушивали в DAW: струнные, гобой, кларнет, труба, тромбон, валторна, колокольчики и литавры — с пониманием того, как инструменты делят работу в оркестровке. Плюс две фортепианные пьесы в ля миноре — медленная Fading Light и умеренная Quiet Soliloquy — с уверенным владением динамикой и фактурой.

Исследования: материалы и формальная математика

Даже без специализированного RL под науку модель уже полезна в исследованиях:

  • Соучёный для материаловедения. Эксперты Xiaomi за несколько раундов промптинга поручили MiMo-V2.6-Pro спроектировать принципиально новый MOF-материал (metal-organic framework), адсорбирующий PFAS — класс «вечных химикатов». Модель провела веб-поиск, изучила литературу и патенты, выдвинула гипотезы, оценила новизну и перешла к «сухим экспериментам»: вызывала open-source вычислительные инструменты, сама разворачивала среду симуляции, считала энергии связывания MOF–PFAS и отобрала кандидатов на «мокрую» стадию. Полный кейс.
  • Формализация теорем. С помощью MiMo-V2.6-Pro исследователи завершили формализацию в Lean 4 основной теоремы классической статьи Ли и Йорке «Period Three Implies Chaos»: существование орбиты периода три у непрерывного отображения отрезка влечёт орбиты всех натуральных периодов и несчётное перемешанное множество. Модель работала через коллаборацию субагентов по стратегии, спроектированной исследователями; проект вырос до более чем 6000 строк Lean, доказательство полностью проверено ядром без заглушек — при том, что Lean-специфичного посттренинга у модели не было. Код можно скачать.

Доступность и цены

MiMo-V2.6-Pro и Flash доступны в AI Studio, MiMo Code, MiMo Desktop, через MiMo API Platform и на OpenRouter. MiMo Desktop одновременно выходит из early access в первом официальном релизе — со встроенными Pro и Flash и режимом UltraSpeed для чувствительных ко времени отклика сценариев.

Цены API (USD за миллион токенов), без изменений относительно V2.5:

Модель Вход (cache hit) Вход (cache miss) Выход
MiMo-V2.6-Flash $0.0028 $0.14 $0.28
MiMo-V2.6-Pro $0.0036 $0.435 $0.87
MiMo-V2.6-Pro-UltraSpeed $0.036 $4.35 $8.7

Запись в кэш временно бесплатна; для предсказуемого высокообъёмного использования есть Token Plan, цены в юанях для Китая — на странице тарифов.

Источник: https://mimo.xiaomi.com/mimo-v2-6