Ternary Bonsai 2 27B: 27B-модель в 5,9 ГБ с сохранением 98,2% качества
Два месяца назад команда PrismML показала, что 27B-классную мультимодальную модель можно сжать настолько, чтобы она комфортно работала на локальном устройстве. Теперь они пошли дальше: Ternary Bonsai 2 27B — самая способная модель в линейке Bonsai, которая сохраняет 98,2% качества полноразрядного оригинала при размере всего 5,9 ГБ. Это примерно в 9 раз меньше исходной модели.
Звучит как очередной маркетинговый заголовок про «сжатие без потерь», но на этот раз цифры вызывают интерес: модель построена на свежем Qwen3.8 27B, поддерживает контекст в 262 тысячи токенов, принимает на вход текст и картинки, распространяется под Apache 2.0 — и при этом выдаёт 143 токена в секунду на RTX 5090.
Разберёмся, как это устроено и что показали бенчмарки.
Что такое тернарная модель
Основа подхода — тернарные веса: каждый параметр модели принимает не произвольное значение из диапазона FP16, а одно из трёх: −1, 0 или +1. Поверх этого идут масштабные коэффициенты FP16, применяемые по группам (group-wise scaling).
Итоговая «эффективная разрядность» — 1,76 бита на вес. Для сравнения: обычная модель в FP16 занимает 16 бит на вес, в INT8 — 8 бит. Разница на порядок объясняет, почему 27-миллиардная модель помещается в 5,9 ГБ — объём, характерный скорее для 7B-моделей прежних лет.
Важно, что низкоразрядное представление применяется по всей языковой модели end-to-end, а не только к отдельным слоям. Именно это, по словам авторов, позволяет сохранить связность рассуждений: сжатие не ломает модель в самых чувствительных местах.
Скорость тоже напрямую следует из разрядности: операции умножения-накопления на тернарных весах сводятся к сложениям и вычитаниям, поэтому на том же железе инференс идёт заметно быстрее, а энергии на токен тратится меньше.
Что изменилось по сравнению с первым Bonsai 27B
Первая модель Bonsai 27B вышла в июле 2026 года и стала знаковой вехой: тогда это был первый 27B-класс, запускавшийся даже на телефоне. Но по качеству она сохраняла около 95% полноразрядного оригинала.
Bonsai 2 27B закрывает этот разрыв. Что нового:
- более сильная базовая модель — Qwen3.8 27B вместо предыдущего поколения;
- удержание качества выросло с 95% до 98,2% от полноточной модели;
- улучшены рассуждения, кодинг, зрение и длинные агентные сценарии (long-horizon).
Авторы называют уровень 98,2% практически «lossless»: разница с оригиналом уже сопоставима с шумом между соседними версиями базовых моделей.
Бенчмарки: где качество сохраняется лучше всего
Сводный балл по набору бенчмарков (рассуждения, математика, код, следование инструкциям, зрение, агентные инструменты) — 83,9 против 85,4 у полноразрядного Qwen3.8 27B. Вот детализация по группам:
| Способность | Bonsai 2 27B | Qwen3.8 27B | Qwen3.6 27B |
|---|---|---|---|
| Агенты и вызов инструментов (τ²-bench, BFCLv3) | 77,57 | 79,74 | 80,05 |
| Кодинг (HumanEval+, LiveCodeBench v6, MBPP+, BigCodeBench) | 81,58 | 82,17 | 82,57 |
| Следование инструкциям (IFBench, IFEval) | 82,66 | 81,25 | 74,53 |
| Знания и рассуждения (MMLU-Redux, GPQA Diamond, AA-LCR) | 83,95 | 86,66 | 84,71 |
| Математика (AIME 2026, AIME 2025, GSM8K, MATH-500) | 96,57 | 97,06 | 94,64 |
| Зрение (CharXiv, A-OKVQA, OmniDocBench v1.6, RealWorldQA, OCRBench v2) | 78,59 | 81,64 | 79,82 |
| Итого | 83,9 | 85,4 | 83,6 |
Замеры сделаны в режиме мышления (thinking mode). Полные результаты по каждому бенчмарку — в whitepaper проекта.
Любопытные детали за пределами сухого агрегата:
- Следование инструкциям — единственная группа, где сжатая модель обошла свой полноразрядный оригинал (82,66 против 81,25) и заметно опередила Qwen3.6 27B (74,53).
- Математика и код — деградация минимальна: −0,5 и −0,6 балла соответственно.
- Агентные сценарии просели сильнее прочих (−2,2 балла), и именно здесь авторы советуют относиться к цифрам вдумчиво: в многошаговых задачах малые ошибки накапливаются.
Ключевой тезис PrismML: важно не только сколько качества сохранено в среднем, а где именно. Кодинг-агенты, tool-use, мультимодальные воркфлоу и длинные цепочки действий — самые чувствительные к деградации области, потому что в них мелкие ошибки умножаются на каждом шаге. Bonsai 2 27B, по данным компании, удерживает полноточную производительность именно в этих зонах, работая при этом на крошечной доле памяти.
Авторы также вводят понятие intelligence density — полезного интеллекта на гигабайт. По их графику, Bonsai 2 27B — выброс на графике в хорошем смысле: многие низкоразрядные альтернативы становятся «деплойбельными» только ценой ощутимых потерь в кодинге, зрении или агентных инструментах.
Скорость и энергоэффективность
Числа по пропускной способности на consumer-железе:
| Железо | Скорость |
|---|---|
| NVIDIA GeForce RTX 5090 | до 143 токенов/с |
| Apple M5 Max | 46,8 токенов/с |
| NVIDIA RTX 4090 (энергия) | 0,714 мВт·ч/токен |
Самый недооценённый показатель в таблице — последний. На RTX 4090 модель на 40% энергоэффективнее, чем 8B-модель в полном формате: тернарная 27B-модель тратит меньше энергии на токен, чем значительно меньшая, но несжатая. Причина — в арифметике: с весами из {−1, 0, +1} умножения заменяются сложениями.
Практические следствия по версии PrismML:
- для кодинг-ассистентов — быстрее цикл «правка → отладка»;
- для мультимодальных агентов — шустрее итерации по скриншотам, документам и вызовам инструментов;
- для приватных локальных воркфлоу — больше полезного инференса на том же устройстве, дольше батарея и реалистичный сценарий «ассистент всегда в фоне», без постоянных обращений к облаку.
Компания показывает демо: кодинг-агент на Cline и computer-use-сценарии — всё это крутится локально на одной RTX 5090.
Зачем это нужно за пределами ноутбуков
Самое интересное в релизе — не «модель для ноута», а то, что авторы называют deployment unlock: почти то же качество в упаковке, которая запускается в куда большем числе мест.
Отсюда несколько практических сценариев, которые называет PrismML:
- кодинг-агентные циклы и computer-use воркфлоу на локальном железе;
- анализ чувствительных документов без отправки данных в облако;
- мультимодальная отладка (скриншоты, дашборды, PDF) локально;
- гибридная оркестрация: локальная модель обрабатывает чувствительные или частые задачи и только избирательно эскалирует в облако.
Более широкая мысль: низкоразрядные модели меняют экономику инференса на всех уровнях — от устройства до датацентра. В тот же объём памяти помещается модель большего размера, на том же железе обслуживается больше пользователей, энергия на инференс падает. Вопрос постепенно смещается с «насколько модель умна» на «сколько полезного интеллекта можно выдать в рамках заданного бюджета памяти, вычислений и энергии».
Платформы, лицензия и материалы
- Железо: NVIDIA GPU через CUDA, Apple-устройства (Mac, iPhone, iPad) через MLX — на кастомных низкоразрядных кернелах.
- Лицензия: Apache 2.0, веса открыты.
- Контекст: 262 000 токенов, вход — текст и изображения.
- Веса: коллекция на Hugging Face
- Код и демо: GitHub-репозиторий
- Онлайн-демо (WebGPU): ternary-bonsai-2-webgpu-kernels
- Whitepaper с деталями сжатия и всех замеров: bonsai-2-27b-whitepaper.pdf
Немного о компании: PrismML выросла из команды исследователей Caltech, её поддерживали Khosla Ventures, Cerberus и Google, а сейчас — Samsung. Компания несколько лет занимается одной из самых сложных задач области — сжатием нейросетей без потери способности к рассуждениям — и предлагает адаптацию моделей Bonsai под конкретные железо и домены (post-training, оптимизация инференса).
Что из этого следует разработчику
Если вы экспериментируете с локальными моделями для кодинга, Bonsai 2 27B — первый кандидат такого класса, где жертва качества против полноразрядного оригинала почти неотличима на бенчмарках, а скорость на consumer-GPU достаточна для агентных циклов. Формат 5,9 ГБ означает, что модель влезает на железо, где раньше жили только 7B–8B модели, — при заметно более высоком потолке способностей.
Стоит держать в голове оговорку: цифры принадлежат авторам модели, независимых перепроверок на момент релиза нет, а агентные бенчмарки — исторически самая скользкая метрика. Но сам тренд — «98% качества за 1,76 бита на вес» — выглядит как реальный сдвиг планки для low-bit инференса.
Источник: https://prismml.com/news/bonsai-2-27b