Малые модели стали рабочими лошадками
Знаете, что меня зацепило недавно? Я неделю гонял gpt-5.6-luna — маленькую модель, которая работает со скоростью ~100 tps (токенов в секунду — почти мгновенно). Она шустро бегает по моему коду, письмам, базе знаний. И стоит копейки: обработка тысяч писем обходится в десятки центов.
Для сравнения, ещё пару лет назад я бы даже не смотрел в сторону мелких моделей. Все тянулись к самым мощным: Fable 5, 5.6 Sol. Больше — значит лучше, да?
Малые модели: что это и почему они стали важны
Забудьте стереотип «маленькая = слабая». Малые модели — это новый баланс между скоростью, стоимостью и качеством. Они работают на Pareto frontier (точке оптимального баланса между стоимостью и качеством), где сокращают расходы в десятки раз при минимальной потере результата.
Раньше экономика AI-стартапов ломалась на token costs (плата за каждый запрос к модели, измеряемая в токенах). Хочешь персонализированную ленту новостей? Один запрос — доллар. Тысяча пользователей — тысяча долларов. Называется это inference costs (расходы на генерацию текста моделью при каждом запросе). Для потребительского приложения это смерть.
Но теперь посмотрите:
СТОИМОСТЬ ЗАПРОСА
──────────────────
$1.00 ┤■■■■■■■■■■■■■■■■■■■■■■■■ Sonnet-class (прошлое поколение)
$0.10 ┤■■■■ luna (сегодня)
└──┬───┬───┬───┬───┬───
$0.10 $0.50 $1.00
Практические сценарии
Мой личный тестовый проект (pet eval — так разработчики называют мини-проекты для проверки идей): агрегатор новостей, который персонален для каждого пользователя. Раньше это было разорительно. Теперь — копейки.
Но реально меня зацепило другое. Мой бывший коворкер Питер подкинул мысль на хайке. Он управляет несколькими компаниями: Segment, Charm Industrial (привлёк $100m+), недавно закрыл Series A (первый крупный раунд инвестиций после начального финансирования) для Revoy.
Так вот, он говорит: 95% его работы — это не «IQ 180» (прорывные решения гениальных инженеров). Это «token spewer» (работа, требующая много оперативных ответов — куча мелких задач, быстрые реакции, постоянное движение по куче фронтов). Созвоны, напоминания, согласования.
Звучит знакомо? Большинство из нас именно это и делает каждый день.
ТИП РАБОТЫ В КОМПАНИИ
─────────────────────
"Гений загадочный" ████░░░░░░░░░░░ ~5%
(прорывные решения)
████████████████ ~95%
"Токен-генератор"
(операционка, быстрые ответы)
Где малые модели ещё не дотягивают
Честность требует сказать: не всё так просто. Для прорывных исследований, сложного инженерного дизайна, тренировки самих моделей — frontier-level модели (передовые модели с максимальной мощностью) всё ещё вне конкуренции.
И есть инфраструктурные вопросы: prompt injection safety (защита от атак, когда вредоносный текст заставляет ИИ нарушить правила), roles и permissions (права доступа), новые harnesses (инструменты-фреймворки для управления моделями в продакшене).
Но это решаемые проблемы.
Вывод: когда выбирать малую модель
Представьте команду мечты. Кто вам нужнее — гений, который раз в год выдаст блестящее решение, или надёжный операционник, который закрывает десять задач в день и не косячит?
Большинство рабочих мест — второй случай. И здесь у маленьких моделей колоссальный потенциал.
Если вы строите потребительский продукт с AI — малая модель может сделать экономику рабочей. Если автоматизируете операционку — быстрый ответ дешевле идеального ответа на следующей неделе.
Большие модели останутся для науки и прорывов. Малые — станут рабочими лошадками, которые закрывают 80% задач за 20% бюджета.
Ссылки
- Small Models Have Arrived — статья о том, как малые модели стали практичным выбором
Дмитрий Полухин — продуктовый дизайнер. Пишу про разработку, AI и дизайн интерфейсов. Обо мне, контакты и профили.