Qwen 3.8 27b слишком уж любит думать

17.08.2026 · 5 мин

Позвольте поделиться одной штукой, которая меня реально повеселила на этой неделе: мощная локальная модель Qwen 3.8 27B может превращать самый простой запрос в долгую и очень многословную эпопею.

Проблема: модель не может заткнуться

Qwen 3.8 27B — это модель от исследовательской лаборатории Alibaba, которая умеет работать с изображениями, писать код, анализировать фото и генерировать SVG-картинки. При этом весит она всего 17 ГБ на диске, так что её можно запустить на хорошем ноутбуке. В теории — звучит как мечта.

Но есть нюанс: по умолчанию модель работает в режиме xhigh, то есть с максимальной глубиной рассуждений. В результате даже на запрос вроде «нарисуй круг» она может думать несколько минут и выдавать заметно переусложненный ответ.

РЕЖИМ РАССУЖДЕНИЙ: ВРЕМЯ И КАЧЕСТВО
─────────────────────────────────────
xhigh (по умолч.)  ████████████████  21 мин   Переусложнённый ответ
medium             ████████          5-7 мин  Баланс
low                ████              2-3 мин  Достаточно для простого
без рассуждений    ██                 2 мин   Быстро, иногда хватает

Вертикальная ось: затраченное время
Чем глубже режим рассуждений, тем дольше ждать — но не всегда лучше результат

Когда это реально мешает

Автор статьи приводит показательный пример: он попросил модель нарисовать пеликана на велосипеде. В итоге получил один из лучших SVG с пеликанами, который видел у локальной модели, но ждал ответ 21 минуту, а сама модель потратила около 22 000 токенов только на размышления.

Потом он просто отключил режим углублённых рассуждений — и та же картинка появилась за пару минут. Качество, субъективно, осталось вполне приемлемым. Для простых задач этого оказалось более чем достаточно.

Модель хорошо справляется с разметкой объектов на фотографиях и может управлять инструментами для создания кода. Но когда задача простая — например, «ответь коротко» — она упорно превращает это в многостраничный трактат.

ПЕЛИКАН НА ВЕЛОСИПЕДЕ: РЕЗУЛЬТАТ И ВРЕМЯ
──────────────────────────────────────────
┌─────────────────┬──────────┬──────────────────────────────┐
│ Режим           │ Время    │ Итог                         │
├─────────────────┼──────────┼──────────────────────────────┤
│ xhigh           │ 21 мин   │ Отличный, но слишком долгий   │
│ low             │ 2-3 мин  │ Достаточно хороший            │
│ без рассуждений │ 2 мин    │ Быстро и практично            │
└─────────────────┴──────────┴──────────────────────────────┘
Для простых запросов снижение глубины рассуждений резко экономит время

Что с этим делать

Главный вывод из статьи очень простой: не стоит полагаться на настройки по умолчанию.

Если запускаете Qwen 3.8 27B, сразу ставьте low или вообще отключайте режим рассуждений. И обязательно ограничивайте контекст: по умолчанию в LM Studio стоит 8 000 токенов, и модель способна забить их почти целиком своими внутренними размышлениями даже на пустяковом вопросе.

Моя оценка

В этой истории цепляет не столько сама модель, сколько знакомый паттерн: создатели делают систему мощнее, улучшают бенчмарки, добавляют параметры — а потом дефолтные настройки превращают сильный инструмент в болтливого зануду.

Qwen 3.8 27B действительно выглядит как крутая штука для локального запуска: 17 гигабайт на диске, работа на хорошем ноутбуке, код, картинки, SVG. Но без быстрой настройки можно провести двадцать минут в ожидании ответа на вопрос «да или нет».

Для рабочих задач я бы сразу просил модель отвечать формально: «Три предложения максимум», «Список из пяти пунктов», «Код без комментариев». Это экономит и время, и нервы.

Выводы

Ссылки

Дмитрий Полухин — продуктовый дизайнер. Пишу про разработку, AI и дизайн интерфейсов. Обо мне, контакты и профили.