Xiaomi MiMo-V2.6: открытая омнимодальная серия с масштабируемым RL
Xiaomi выпустила и открыла серию моделей MiMo-V2.6 — очередной шаг на заявленном пути к RSI (recursive self-improvement): масштабирование RL-вычислений на проверяемых сложных задачах, чтобы модель расширяла собственный фронтир способностей через исследование и обратную связь. В серию входят две нативно омнимодальные модели: MiMo-V2.6-Pro — самая способная модель компании на сегодня, и MiMo-V2.6-Flash — баланс интеллекта, эффективности и цены. Для тех, кому нужна экстремальная скорость генерации, выпущен ещё и MiMo-V2.6-Pro-UltraSpeed — до 20-кратной скорости вывода при том же качестве. Веса, технический отчёт, RL-код и тренировочные окружения выложены в открытый доступ: коллекция на HuggingFace и технический отчёт (PDF).
Бенчмарки: кодинг, агенты, визуал, кибербезопасность
Pro близка к фронтирным закрытым моделям, хотя не везде их обгоняет. На DeepSWE v1.1 она набирает 71.9 против 74.2 у DeepSeek V4.1 Flash и 74.0 у Claude Opus 5 и GPT 6 Astra. На агентных задачах расклад похожий: GDPVal 2.1 (Elo по версии Artificial Analysis) — 1673 у Pro против 1735 у Claude Fable 5.1 и 1708 у Opus 5. В кибербезопасности серия и вовсе впереди всех: на CyberGym Flash показывает 95.1, Pro — 94.0 (у DeepSeek V4.1 Flash — 88.1, у GLM 5.3 — 84.5).
| Бенчмарк | MiMo-V2.6-Pro | MiMo-V2.6-Flash | Лучший конкурент |
|---|---|---|---|
| DeepSWE v1.1 | 71.9 | 67.9 | DeepSeek V4.1 Flash — 74.2 |
| MiMo Code Bench (in-house) | 63.2 | 61.2 | Claude Opus 5 — 68.6 |
| GDPVal 2.1 (Elo, AA) | 1673 | — | Claude Fable 5.1 — 1735 |
| Toolathlon-verified | 76.9 | 73.6 | Claude Opus 5 — 80.6 |
| Automation Bench v1.0.6 | 53.1 | 52.3 | DeepSeek V4.1 Flash — 54.8 |
| Terminal Bench 4.0 | 34.9 | 28.8 | GPT 6 Astra — 59.6 |
| JobBench | 62.0 | 61.2 | Claude Opus 5 — 65.7 |
| MiMo Visual Coding (in-house) | 72.3 | 71.5 | GPT 6 Astra — 82.2 |
| OSWorld-Verified | 82.0 | 80.8 | Claude Fable 5 — 86.0 |
| CyberGym | 94.0 | 95.1 | MiMo-V2.6-Flash — 95.1 |
| ExploitGym | 17.8 | 6.0 | GPT 6 Astra — 42.4 |
Разрыв с собственной предыдущей версией драматичный: MiMo-V2.5-Pro набирала на DeepSWE v1.1 всего 19.0, на Automation Bench — 16.0, на Terminal Bench 4.0 — 1.5, на CyberGym — 40.0.
Сильнейшая открытая модель и парето-фронтир
На Artificial Analysis Intelligence Index (v4.3) MiMo-V2.6-Pro набирает 46.32, обходя Kimi K3 и Qwen3.8 Max — это самый высокий результат среди открытых моделей на сегодня. При этом API-цены не изменились по сравнению с серией V2.5: больше интеллекта за те же деньги сдвигает парето-фронтир «интеллект против стоимости» наружу.
Масштабирование RL — и выкладка всего в открытую
Самая интересная часть релиза — не цифры, а открытый RL-пайплайн. Производственный прогон транслировался вживую на специальной странице. Менее чем за шесть дней Flash и Pro прошли по 30 RL-шагов на roughly 750 тыс. траекторий, потратив около $0.85 млн и $2.62 млн соответственно. Средний pass rate на тренировочных задачах вырос на 25% и 12% в относительном выражении, а на холдаут-бенчмарке DeepSWE v1.1 — примерно на 17 пунктов у Flash (48.8 → 65.68) и на 14 у Pro (58.4 → 72.57). RL оказался sample-efficient, продолжал улучшаться до конца прогона и обобщился за пределы тренировочного распределения.
Масштабирование шло по трём осям:
- Батчи и пропускная способность. Полностью асинхронная архитектура, 1568 сэмплов на апдейт, тренировка на контексте до 1M токенов и 3.5–3.7 млрд токенов на шаг.
- Больше задач и сред. Мульти task-набор: кодинг, общие агенты, визуал и кибербезопасность, смешанные между несколькими harness — так прогресс в одной способности усиливает остальные.
- Больше вычислений на грейдеры. Относительное сравнение внутри группы даёт долгим RL-задачам более точные и разнообразные reward-сигналы, замыкает петлю самоулучшения и подталкивает модель к более коротким путям и меньшему числу токенов на задачу.
Для стабильности на масштабе команда заморозила роутер против training drift и построила защиту от reward hacking: дизайн наград, состязательная оценка, детекция аномалий и перекрёстная проверка между верификаторами. На уровне инфраструктуры — единое представление траекторий и механизм штрафов для более тонких learning-сигналов, высококонкурентное взаимодействие с несколькими агентными фреймворками, разделение control plane и data plane для миграции траекторий, стабилизация per-task sampling ratios в смешанных батчах и оптимизация движков обучения и инференса с обеспечением их консистентности.
От vibe coding к Vibe World
Способности кодинга обобщились за пределы разработки ПО: модель берёт цель, harness и время — и делает реальную продуктивную работу. MiMo-V2.6 объединяет 3D-пространственное рассуждение, мультимодальное восприятие и computer-use агента (CUA), расширяя программирование на естественном языке от сборки софта до сборки интерактивных миров — то, что Xiaomi называет «Vibe World»:
- Разработка игр. Из картинки, видео или текстового промпта модель декомпозирует запрос на задачи, координирует несколько агентов — строятся 3D-сцены, интерактивная логика, визуальная верификация, затем итеративное уточнение по рендерам до запускаемого мира.
- 3D-моделирование. Генерация объектов и сцен в Blender из текстового описания или референсного изображения — ассеты для анимации, 3D-печати и геймдева.
- Воплощённая симуляция. В средах embodied-симуляции модель принимает multicamera-видеопотоки, рассуждает и в замкнутом контуре через визуальный фидбек управляет манипулятором Franka Panda: захват объектов, подбор по цвету, точное размещение.
Визуал, дизайн и видео
Из короткой инструкции модель собирает законченный фронтенд-интерфейс или слайд-дек со структурной вёрсткой, проработанными компонентами, интерактивом и анимацией. Она уверенно работает с Figma и генераторами изображений и видео, удерживая типографику, цвет и компоновку текста с картинками. Показательные кейсы: три презентации, каждая из однострочного брифа — внутренний тренинг по обучению LLM, исследовательская заметка о суперцикле критических металлов и дизайн-ревью годового отчёта.
Отдельная история — видео «под ключ»: визуальный дизайн, раскадровка и монтаж движения, написание музыки и синхронизация монтажа с битом. В образовательном формате модель превращает абстракции вроде разложения Фурье в доступные объяснения с анимацией, а озвучку генерирует MiMo-V2.5-TTS, синхронизированную с картинкой.
Музыка
Первая попытка композиции тоже впечатляет. MiMo-V2.6-Pro попросили написать оркестровое произведение примерно на десять инструментов — модель сочинила партитуру и сама конвертировала её в MIDI. Результат прослушивали в DAW: струнные, гобой, кларнет, труба, тромбон, валторна, колокольчики и литавры — с пониманием того, как инструменты делят работу в оркестровке. Плюс две фортепианные пьесы в ля миноре — медленная Fading Light и умеренная Quiet Soliloquy — с уверенным владением динамикой и фактурой.
Исследования: материалы и формальная математика
Даже без специализированного RL под науку модель уже полезна в исследованиях:
- Соучёный для материаловедения. Эксперты Xiaomi за несколько раундов промптинга поручили MiMo-V2.6-Pro спроектировать принципиально новый MOF-материал (metal-organic framework), адсорбирующий PFAS — класс «вечных химикатов». Модель провела веб-поиск, изучила литературу и патенты, выдвинула гипотезы, оценила новизну и перешла к «сухим экспериментам»: вызывала open-source вычислительные инструменты, сама разворачивала среду симуляции, считала энергии связывания MOF–PFAS и отобрала кандидатов на «мокрую» стадию. Полный кейс.
- Формализация теорем. С помощью MiMo-V2.6-Pro исследователи завершили формализацию в Lean 4 основной теоремы классической статьи Ли и Йорке «Period Three Implies Chaos»: существование орбиты периода три у непрерывного отображения отрезка влечёт орбиты всех натуральных периодов и несчётное перемешанное множество. Модель работала через коллаборацию субагентов по стратегии, спроектированной исследователями; проект вырос до более чем 6000 строк Lean, доказательство полностью проверено ядром без заглушек — при том, что Lean-специфичного посттренинга у модели не было. Код можно скачать.
Доступность и цены
MiMo-V2.6-Pro и Flash доступны в AI Studio, MiMo Code, MiMo Desktop, через MiMo API Platform и на OpenRouter. MiMo Desktop одновременно выходит из early access в первом официальном релизе — со встроенными Pro и Flash и режимом UltraSpeed для чувствительных ко времени отклика сценариев.
Цены API (USD за миллион токенов), без изменений относительно V2.5:
| Модель | Вход (cache hit) | Вход (cache miss) | Выход |
|---|---|---|---|
| MiMo-V2.6-Flash | $0.0028 | $0.14 | $0.28 |
| MiMo-V2.6-Pro | $0.0036 | $0.435 | $0.87 |
| MiMo-V2.6-Pro-UltraSpeed | $0.036 | $4.35 | $8.7 |
Запись в кэш временно бесплатна; для предсказуемого высокообъёмного использования есть Token Plan, цены в юанях для Китая — на странице тарифов.
Источник: https://mimo.xiaomi.com/mimo-v2-6