Bonsai 2 27b: сжатие почти без потерь
Представьте, что 27-миллиардную языковую модель можно ужать почти в девять раз и при этом не потерять заметную часть качества. Для локального запуска это звучит как редкая удача — и именно такой результат обещает PrismML в релизе Ternary Bonsai 2 27B.
Bonsai 2 27b: что это и почему важно
Bonsai 2 27B — это сжатая версия модели Qwen3.8 27B от Alibaba. В полной точности она занимает около 54 гигабайт, а сжатый вариант — всего 5,9 гигабайта. Это уже не просто экономия места: модель становится доступнее для потребительских GPU и локальных сценариев.
Главное нововведение — тернарное квантование. Вместо привычных чисел с плавающей точкой веса хранятся в трёх состояниях: -1, 0 и +1. Для групп весов дополнительно используется масштабный коэффициент в FP16. В результате получается около 1,76 бита на вес вместо 16 бит в полноточной версии.
Как это работает на практике
Такое сжатие даёт сразу несколько прикладных преимуществ. Модель легче хранить, проще загружать в видеопамять и дешевле запускать в больших объёмах. Это особенно важно, когда нужно обслуживать много запросов или держать модель локально без облака.
- Размер модели. Падение с 54 до 5,9 гигабайта меняет класс доступного оборудования.
- Память при инференсе. Меньше веса — меньше нагрузка на GPU и выше скорость генерации.
- Энергоэффективность. Снижаются затраты на чтение, запись и вычисления.
- Контекст. Модель поддерживает до 262 тысяч токенов, что удобно для длинных документов и кода.
- Мультимодальность. Поддерживаются текст и изображения, пусть и не на уровне самых мощных закрытых систем.
Сжатие и качество Bonsai 2 27B ─────────────────────────────── ┌──────────────────────┬────────┬──────────┐ │ Модель │ Размер │ Качество │ ├──────────────────────┼────────┼──────────┤ │ Qwen3.8 27B FP16 │ 54.0 │ 100% │ │ Ternary Bonsai 2 │ 5.9 │ 98.2% │ └──────────────────────┴────────┴──────────┘ ▶ Соотношение: 9,15x меньше при потере около 1,8%
Что показывают бенчмарки
Авторы сообщают aggregate score 83,9 против 85,4 у полноточной модели. Это означает сохранение 98,2% производительности, что выглядит особенно сильно на фоне почти девятикратного сжатия.
По направлениям картина тоже выглядит ровной: кодинг — 81,58 против 82,17, математика — 96,57 против 97,06, зрение — 78,59 против 81,64, agentic-возможности — 77,57 против 79,74.
Особенно интересно, что на многошаговых задачах потери остаются умеренными. Для сценариев с вызовами инструментов и цепочками действий это важнее, чем просто хороший общий балл.
Сравнение ключевых метрик ────────────────────────── ┌──────────────────────┬───────────┬───────────┐ │ Направление │ FP16 │ Bonsai 2 │ ├──────────────────────┼───────────┼───────────┤ │ Кодинг │ 82,17 │ 81,58 │ │ Математика │ 97,06 │ 96,57 │ │ Зрение │ 81,64 │ 78,59 │ │ Agentic-задачи │ 79,74 │ 77,57 │ └──────────────────────┴───────────┴───────────┘ ▶ Наиболее заметная потеря — в vision, но она остаётся умеренной
Где это полезно
- Локальный запуск. Модель можно держать у себя, не передавая данные в облако.
- Корпоративные сценарии. Подходит для проектов с повышенными требованиями к приватности.
- Оффлайн-работа. Достаточно компактная, чтобы использовать её на хорошем ноутбуке.
- Массовое развёртывание. Меньший размер упрощает масштабирование на том же железе.
О чём стоит помнить
Near-lossless не означает lossless. Потеря в 1,8% может быть незаметна в тестах, но проявиться в сложных реальных сценариях. Кроме того, тернарное квантование пока менее распространено, чем INT8 или INT4, поэтому экосистема вокруг него может быть ограниченной.
Цифры авторов тоже лучше воспринимать с осторожностью: независимые проверки здесь особенно важны. Но сама идея выглядит перспективно — большие модели становятся доступнее без драматической деградации качества.
Выводы
Bonsai 2 27B — это не революция, но очень сильный шаг вперёд. Модель почти в девять раз компактнее исходной версии и при этом сохраняет большую часть качества. Для локального деплоя это уже практический инструмент, а не лабораторный эксперимент.
Если экосистема под тернарное квантование будет развиваться, такие модели могут заметно расширить круг задач, которые можно решать без облака и без огромного бюджета на инфраструктуру.
Ссылки
- PrismML — анонс Bonsai 2 27B — официальный материал о релизе модели
- Qwen3 — открытая большая языковая модель от Alibaba — страница семейства моделей Qwen
Дмитрий Полухин — продуктовый дизайнер. Пишу про разработку, AI и дизайн интерфейсов. Обо мне, контакты и профили.