Qwen 3.8 27b слишком уж любит думать
Позвольте поделиться одной штукой, которая меня реально повеселила на этой неделе: мощная локальная модель Qwen 3.8 27B может превращать самый простой запрос в долгую и очень многословную эпопею.
Проблема: модель не может заткнуться
Qwen 3.8 27B — это модель от исследовательской лаборатории Alibaba, которая умеет работать с изображениями, писать код, анализировать фото и генерировать SVG-картинки. При этом весит она всего 17 ГБ на диске, так что её можно запустить на хорошем ноутбуке. В теории — звучит как мечта.
Но есть нюанс: по умолчанию модель работает в режиме xhigh, то есть с максимальной глубиной рассуждений. В результате даже на запрос вроде «нарисуй круг» она может думать несколько минут и выдавать заметно переусложненный ответ.
РЕЖИМ РАССУЖДЕНИЙ: ВРЕМЯ И КАЧЕСТВО ───────────────────────────────────── xhigh (по умолч.) ████████████████ 21 мин Переусложнённый ответ medium ████████ 5-7 мин Баланс low ████ 2-3 мин Достаточно для простого без рассуждений ██ 2 мин Быстро, иногда хватает Вертикальная ось: затраченное время
Когда это реально мешает
Автор статьи приводит показательный пример: он попросил модель нарисовать пеликана на велосипеде. В итоге получил один из лучших SVG с пеликанами, который видел у локальной модели, но ждал ответ 21 минуту, а сама модель потратила около 22 000 токенов только на размышления.
Потом он просто отключил режим углублённых рассуждений — и та же картинка появилась за пару минут. Качество, субъективно, осталось вполне приемлемым. Для простых задач этого оказалось более чем достаточно.
Модель хорошо справляется с разметкой объектов на фотографиях и может управлять инструментами для создания кода. Но когда задача простая — например, «ответь коротко» — она упорно превращает это в многостраничный трактат.
ПЕЛИКАН НА ВЕЛОСИПЕДЕ: РЕЗУЛЬТАТ И ВРЕМЯ ────────────────────────────────────────── ┌─────────────────┬──────────┬──────────────────────────────┐ │ Режим │ Время │ Итог │ ├─────────────────┼──────────┼──────────────────────────────┤ │ xhigh │ 21 мин │ Отличный, но слишком долгий │ │ low │ 2-3 мин │ Достаточно хороший │ │ без рассуждений │ 2 мин │ Быстро и практично │ └─────────────────┴──────────┴──────────────────────────────┘
Что с этим делать
Главный вывод из статьи очень простой: не стоит полагаться на настройки по умолчанию.
Если запускаете Qwen 3.8 27B, сразу ставьте low или вообще отключайте режим рассуждений. И обязательно ограничивайте контекст: по умолчанию в LM Studio стоит 8 000 токенов, и модель способна забить их почти целиком своими внутренними размышлениями даже на пустяковом вопросе.
- Для простых задач: отключайте рассуждения полностью
- Для сложных задач: ставьте
lowилиmediumвместоxhigh - Всегда: увеличивайте лимит контекста, если модель начинает думать слишком долго
Моя оценка
В этой истории цепляет не столько сама модель, сколько знакомый паттерн: создатели делают систему мощнее, улучшают бенчмарки, добавляют параметры — а потом дефолтные настройки превращают сильный инструмент в болтливого зануду.
Qwen 3.8 27B действительно выглядит как крутая штука для локального запуска: 17 гигабайт на диске, работа на хорошем ноутбуке, код, картинки, SVG. Но без быстрой настройки можно провести двадцать минут в ожидании ответа на вопрос «да или нет».
Для рабочих задач я бы сразу просил модель отвечать формально: «Три предложения максимум», «Список из пяти пунктов», «Код без комментариев». Это экономит и время, и нервы.
Выводы
- Qwen 3.8 27B мощная, но по умолчанию слишком разговорчивая.
- Для простых запросов лучше отключать рассуждения или ставить минимальный режим.
- Хорошая настройка важнее, чем максимальная глубина ответа.
Ссылки
- Оригинальная статья Саймона Уиллисона — подробный разбор опыта с Qwen 3.8 27B
- Qwen 3.8 27B на Hugging Face — модель под лицензией Apache 2
Дмитрий Полухин — продуктовый дизайнер. Пишу про разработку, AI и дизайн интерфейсов. Обо мне, контакты и профили.