Bonsai 2 27b: сжатие почти без потерь

18.09.2026 · 5 мин

Представьте, что 27-миллиардную языковую модель можно ужать почти в девять раз и при этом не потерять заметную часть качества. Для локального запуска это звучит как редкая удача — и именно такой результат обещает PrismML в релизе Ternary Bonsai 2 27B.

Bonsai 2 27b: что это и почему важно

Bonsai 2 27B — это сжатая версия модели Qwen3.8 27B от Alibaba. В полной точности она занимает около 54 гигабайт, а сжатый вариант — всего 5,9 гигабайта. Это уже не просто экономия места: модель становится доступнее для потребительских GPU и локальных сценариев.

Главное нововведение — тернарное квантование. Вместо привычных чисел с плавающей точкой веса хранятся в трёх состояниях: -1, 0 и +1. Для групп весов дополнительно используется масштабный коэффициент в FP16. В результате получается около 1,76 бита на вес вместо 16 бит в полноточной версии.

Как это работает на практике

Такое сжатие даёт сразу несколько прикладных преимуществ. Модель легче хранить, проще загружать в видеопамять и дешевле запускать в больших объёмах. Это особенно важно, когда нужно обслуживать много запросов или держать модель локально без облака.

Сжатие и качество Bonsai 2 27B
───────────────────────────────
┌──────────────────────┬────────┬──────────┐
│ Модель               │ Размер │ Качество │
├──────────────────────┼────────┼──────────┤
│ Qwen3.8 27B FP16     │ 54.0   │ 100%     │
│ Ternary Bonsai 2     │ 5.9    │ 98.2%    │
└──────────────────────┴────────┴──────────┘
▶ Соотношение: 9,15x меньше при потере около 1,8%
Сравнение размера сжатой модели и сохранённого качества

Что показывают бенчмарки

Авторы сообщают aggregate score 83,9 против 85,4 у полноточной модели. Это означает сохранение 98,2% производительности, что выглядит особенно сильно на фоне почти девятикратного сжатия.

По направлениям картина тоже выглядит ровной: кодинг — 81,58 против 82,17, математика — 96,57 против 97,06, зрение — 78,59 против 81,64, agentic-возможности — 77,57 против 79,74.

Особенно интересно, что на многошаговых задачах потери остаются умеренными. Для сценариев с вызовами инструментов и цепочками действий это важнее, чем просто хороший общий балл.

Сравнение ключевых метрик
──────────────────────────
┌──────────────────────┬───────────┬───────────┐
│ Направление          │ FP16      │ Bonsai 2  │
├──────────────────────┼───────────┼───────────┤
│ Кодинг               │ 82,17     │ 81,58     │
│ Математика           │ 97,06     │ 96,57     │
│ Зрение               │ 81,64     │ 78,59     │
│ Agentic-задачи       │ 79,74     │ 77,57     │
└──────────────────────┴───────────┴───────────┘
▶ Наиболее заметная потеря — в vision, но она остаётся умеренной
Разбивка по основным бенчмаркам и типам задач

Где это полезно

О чём стоит помнить

Near-lossless не означает lossless. Потеря в 1,8% может быть незаметна в тестах, но проявиться в сложных реальных сценариях. Кроме того, тернарное квантование пока менее распространено, чем INT8 или INT4, поэтому экосистема вокруг него может быть ограниченной.

Цифры авторов тоже лучше воспринимать с осторожностью: независимые проверки здесь особенно важны. Но сама идея выглядит перспективно — большие модели становятся доступнее без драматической деградации качества.

Выводы

Bonsai 2 27B — это не революция, но очень сильный шаг вперёд. Модель почти в девять раз компактнее исходной версии и при этом сохраняет большую часть качества. Для локального деплоя это уже практический инструмент, а не лабораторный эксперимент.

Если экосистема под тернарное квантование будет развиваться, такие модели могут заметно расширить круг задач, которые можно решать без облака и без огромного бюджета на инфраструктуру.

Ссылки

Дмитрий Полухин — продуктовый дизайнер. Пишу про разработку, AI и дизайн интерфейсов. Обо мне, контакты и профили.