Ternary Bonsai 2 27B: 27B-модель в 5,9 ГБ с сохранением 98,2% качества

· 1 мин чтения
llm quantization open-source local-llm benchmarks
Ternary Bonsai 2 27B: 27B-модель в 5,9 ГБ с сохранением 98,2% качества

Два месяца назад команда PrismML показала, что 27B-классную мультимодальную модель можно сжать настолько, чтобы она комфортно работала на локальном устройстве. Теперь они пошли дальше: Ternary Bonsai 2 27B — самая способная модель в линейке Bonsai, которая сохраняет 98,2% качества полноразрядного оригинала при размере всего 5,9 ГБ. Это примерно в 9 раз меньше исходной модели.

Звучит как очередной маркетинговый заголовок про «сжатие без потерь», но на этот раз цифры вызывают интерес: модель построена на свежем Qwen3.8 27B, поддерживает контекст в 262 тысячи токенов, принимает на вход текст и картинки, распространяется под Apache 2.0 — и при этом выдаёт 143 токена в секунду на RTX 5090.

Разберёмся, как это устроено и что показали бенчмарки.

Что такое тернарная модель

Основа подхода — тернарные веса: каждый параметр модели принимает не произвольное значение из диапазона FP16, а одно из трёх: −1, 0 или +1. Поверх этого идут масштабные коэффициенты FP16, применяемые по группам (group-wise scaling).

Итоговая «эффективная разрядность» — 1,76 бита на вес. Для сравнения: обычная модель в FP16 занимает 16 бит на вес, в INT8 — 8 бит. Разница на порядок объясняет, почему 27-миллиардная модель помещается в 5,9 ГБ — объём, характерный скорее для 7B-моделей прежних лет.

Важно, что низкоразрядное представление применяется по всей языковой модели end-to-end, а не только к отдельным слоям. Именно это, по словам авторов, позволяет сохранить связность рассуждений: сжатие не ломает модель в самых чувствительных местах.

Скорость тоже напрямую следует из разрядности: операции умножения-накопления на тернарных весах сводятся к сложениям и вычитаниям, поэтому на том же железе инференс идёт заметно быстрее, а энергии на токен тратится меньше.

Что изменилось по сравнению с первым Bonsai 27B

Первая модель Bonsai 27B вышла в июле 2026 года и стала знаковой вехой: тогда это был первый 27B-класс, запускавшийся даже на телефоне. Но по качеству она сохраняла около 95% полноразрядного оригинала.

Bonsai 2 27B закрывает этот разрыв. Что нового:

  • более сильная базовая модель — Qwen3.8 27B вместо предыдущего поколения;
  • удержание качества выросло с 95% до 98,2% от полноточной модели;
  • улучшены рассуждения, кодинг, зрение и длинные агентные сценарии (long-horizon).

Авторы называют уровень 98,2% практически «lossless»: разница с оригиналом уже сопоставима с шумом между соседними версиями базовых моделей.

Бенчмарки: где качество сохраняется лучше всего

Сводный балл по набору бенчмарков (рассуждения, математика, код, следование инструкциям, зрение, агентные инструменты) — 83,9 против 85,4 у полноразрядного Qwen3.8 27B. Вот детализация по группам:

Способность Bonsai 2 27B Qwen3.8 27B Qwen3.6 27B
Агенты и вызов инструментов (τ²-bench, BFCLv3) 77,57 79,74 80,05
Кодинг (HumanEval+, LiveCodeBench v6, MBPP+, BigCodeBench) 81,58 82,17 82,57
Следование инструкциям (IFBench, IFEval) 82,66 81,25 74,53
Знания и рассуждения (MMLU-Redux, GPQA Diamond, AA-LCR) 83,95 86,66 84,71
Математика (AIME 2026, AIME 2025, GSM8K, MATH-500) 96,57 97,06 94,64
Зрение (CharXiv, A-OKVQA, OmniDocBench v1.6, RealWorldQA, OCRBench v2) 78,59 81,64 79,82
Итого 83,9 85,4 83,6

Замеры сделаны в режиме мышления (thinking mode). Полные результаты по каждому бенчмарку — в whitepaper проекта.

Любопытные детали за пределами сухого агрегата:

  • Следование инструкциям — единственная группа, где сжатая модель обошла свой полноразрядный оригинал (82,66 против 81,25) и заметно опередила Qwen3.6 27B (74,53).
  • Математика и код — деградация минимальна: −0,5 и −0,6 балла соответственно.
  • Агентные сценарии просели сильнее прочих (−2,2 балла), и именно здесь авторы советуют относиться к цифрам вдумчиво: в многошаговых задачах малые ошибки накапливаются.

Ключевой тезис PrismML: важно не только сколько качества сохранено в среднем, а где именно. Кодинг-агенты, tool-use, мультимодальные воркфлоу и длинные цепочки действий — самые чувствительные к деградации области, потому что в них мелкие ошибки умножаются на каждом шаге. Bonsai 2 27B, по данным компании, удерживает полноточную производительность именно в этих зонах, работая при этом на крошечной доле памяти.

Авторы также вводят понятие intelligence density — полезного интеллекта на гигабайт. По их графику, Bonsai 2 27B — выброс на графике в хорошем смысле: многие низкоразрядные альтернативы становятся «деплойбельными» только ценой ощутимых потерь в кодинге, зрении или агентных инструментах.

Скорость и энергоэффективность

Числа по пропускной способности на consumer-железе:

Железо Скорость
NVIDIA GeForce RTX 5090 до 143 токенов/с
Apple M5 Max 46,8 токенов/с
NVIDIA RTX 4090 (энергия) 0,714 мВт·ч/токен

Самый недооценённый показатель в таблице — последний. На RTX 4090 модель на 40% энергоэффективнее, чем 8B-модель в полном формате: тернарная 27B-модель тратит меньше энергии на токен, чем значительно меньшая, но несжатая. Причина — в арифметике: с весами из {−1, 0, +1} умножения заменяются сложениями.

Практические следствия по версии PrismML:

  • для кодинг-ассистентов — быстрее цикл «правка → отладка»;
  • для мультимодальных агентов — шустрее итерации по скриншотам, документам и вызовам инструментов;
  • для приватных локальных воркфлоу — больше полезного инференса на том же устройстве, дольше батарея и реалистичный сценарий «ассистент всегда в фоне», без постоянных обращений к облаку.

Компания показывает демо: кодинг-агент на Cline и computer-use-сценарии — всё это крутится локально на одной RTX 5090.

Зачем это нужно за пределами ноутбуков

Самое интересное в релизе — не «модель для ноута», а то, что авторы называют deployment unlock: почти то же качество в упаковке, которая запускается в куда большем числе мест.

Отсюда несколько практических сценариев, которые называет PrismML:

  • кодинг-агентные циклы и computer-use воркфлоу на локальном железе;
  • анализ чувствительных документов без отправки данных в облако;
  • мультимодальная отладка (скриншоты, дашборды, PDF) локально;
  • гибридная оркестрация: локальная модель обрабатывает чувствительные или частые задачи и только избирательно эскалирует в облако.

Более широкая мысль: низкоразрядные модели меняют экономику инференса на всех уровнях — от устройства до датацентра. В тот же объём памяти помещается модель большего размера, на том же железе обслуживается больше пользователей, энергия на инференс падает. Вопрос постепенно смещается с «насколько модель умна» на «сколько полезного интеллекта можно выдать в рамках заданного бюджета памяти, вычислений и энергии».

Платформы, лицензия и материалы

Немного о компании: PrismML выросла из команды исследователей Caltech, её поддерживали Khosla Ventures, Cerberus и Google, а сейчас — Samsung. Компания несколько лет занимается одной из самых сложных задач области — сжатием нейросетей без потери способности к рассуждениям — и предлагает адаптацию моделей Bonsai под конкретные железо и домены (post-training, оптимизация инференса).

Что из этого следует разработчику

Если вы экспериментируете с локальными моделями для кодинга, Bonsai 2 27B — первый кандидат такого класса, где жертва качества против полноразрядного оригинала почти неотличима на бенчмарках, а скорость на consumer-GPU достаточна для агентных циклов. Формат 5,9 ГБ означает, что модель влезает на железо, где раньше жили только 7B–8B модели, — при заметно более высоком потолке способностей.

Стоит держать в голове оговорку: цифры принадлежат авторам модели, независимых перепроверок на момент релиза нет, а агентные бенчмарки — исторически самая скользкая метрика. Но сам тренд — «98% качества за 1,76 бита на вес» — выглядит как реальный сдвиг планки для low-bit инференса.

Источник: https://prismml.com/news/bonsai-2-27b