Grok 4.6 вышел в лидеры по цене и качеству

13.08.2026 · 5 мин

Знаете, что меня всегда удивляет? Когда кто-то делает тихий релиз, а потом оказывается, что он перевернул всю доску лидеров. Именно это, по ощущениям, произошло с Grok 4.6 от SpaceXAI.

Что за индекс и почему 61 — это много

Модель набрала 61 балл в Artificial Analysis Intelligence Index — и это не просто цифра в вакууме. Это послание конкурентам: Илон Маск и компания вернулись в игру за интеллектуальный фронтир, причём с очень интересным ценовым предложением.

Artificial Analysis Intelligence Index — это сводный индекс от аналитического агентства Artificial Analysis. Они не просто гоняют модели по синтетическим бенчмаркам, а собирают целый набор метрик: от статичных рассуждений до реальной агентной работы. Получить 61 балл — значит оказаться на уровне топовых моделей, где лидируют OpenAI, Anthropic и теперь SpaceXAI.

Для понимания масштаба: ближайший конкурент в этом диапазоне — GPT-5.6 Sol от OpenAI с тем же баллом 61. Но есть нюанс, о котором я скажу чуть позже.

ИНТЕЛЛЕКТУАЛЬНЫЙ ФРОНТИР, ИЮЛЬ 2026
─────────────────────────────────────
Anthropic Claude Opus 5 (макс)      ████████████████  63
Anthropic Claude Fable 5             ███████████████   62
OpenAI GPT-5.6 Sol                   █████████████     61
SpaceXAI Grok 4.6                    █████████████     61  ← новый игрок
Moonshot Kimi K3                     ████████████      ~60
Alibaba Qwen3.8 Max                  ████████████      ~59
─────────────────────────────────────
          ФРОНТИР (61+)
Сравнение моделей по Intelligence Index. Grok 4.6 на равных с GPT-5.6 Sol

Обратите внимание на соседей. Claude Opus 5 с его 63 баллами — лидер, его не догнали. Claude Fable 5 с 62 баллами — уверенное второе место. А дальше идёт уплотнение: Grok 4.6 и GPT-5.6 Sol практически сравнялись. Это уже не нишевая модель, а полноценный конкурент в высшей лиге.

Агентная работа — вот где grok раскрывается

Самое интересное — это не статичные бенчмарки, а то, как модель показывает себя в агентных задачах. Для тех, кто не в теме: агентная работа — это когда модель не просто отвечает на вопрос, а выполняет цепочку действий, использует инструменты, работает с терминалом, общается с клиентами. Реальная работа, а не синтетические тесты.

На GDPval-AA v2 — главном тесте на реальную агентную работу — Grok 4.6 набрал 1753 балла Elo. Только Claude Opus 5 оказался чуть впереди. На тесте 𝜏³-Banking Grok набрал 50,7% — практически наравне с лидером Qwen3.8 Max (51.3%). На Terminal-Bench v2.1 — 88,4%, вровень с лучшими.

СТОИМОСТЬ НА МИЛЛИОН ТОКЕНОВ
─────────────────────────────
                  Ввод    Вывод    Относительно
Grok 4.6          $2      $6       ▓▓░░░ эталон
Claude Opus 5     $5      $25      ▓▓▓▓▓░ ×4 вывод
GPT-5.6 Sol       $5      $30      ▓▓▓▓▓▓ ×5 вывод
─────────────────────────────
Задача стоит $0.84 (как Kimi K3)
но с интеллектом уровня GPT-5.6 Sol
Ценовое преимущество Grok 4.6 на фоне конкурентов с сопоставимым интеллектом

Теперь о том, что меня зацепило больше всего. Grok 4.6 сохранил прайсинг предыдущей версии — $2 за миллион входных токенов и $6 за выходные. При этом прибавил 5 баллов интеллекта. Это нетипично: обычно за прирост в качестве платят увеличением цены.

Сравните: Claude Opus 5 стоит $5/$25, а GPT-5.6 Sol — $5/$30. Разница в стоимости выходных токенов — в 4-5 раз. Для задач, где модель много думает вслух, это колоссальная экономия.

На практике стоимость выполнения типичной задачи составила $0.84 — столько же, сколько у Kimi K3, но с заметно более высоким интеллектом. Grok 4.6 попал на кривую Парето: лучший результат при минимальных затратах.

Какой от этого практический толк

Во-первых, если вы уже присматривались к Grok из-за цены, но сомневались в качестве — время пересмотреть. Модель теперь на фронтире, и ценовое преимущество никуда не делось.

Во-вторых, для агентных пайплайнов — автоматизированные ассистенты, поддержка, работа с терминалом — Grok 4.6 очень сильный кандидат. Он показал себя сильнее, чем в статичных задачах, а стоит при этом значительно дешевле Claude Opus 5.

В-третьих, контекстное окно в 500 000 токенов — это всё ещё отлично. Можно загрузить целую кодовую базу и работать с ней.

Есть, конечно, нюанс. Кэш теперь стоит $0.5 за миллион вместо $0.3 — подорожал. Мелочь, но если вы активно используете повторяющиеся контексты, это стоит учесть.

Моя оценка

Grok 4.6 — это не просто апгрейд ради апгрейда. SpaceXAI сделали ход, который меняет баланс в индустрии. Модель догнала OpenAI по индексу интеллекта, при этом сохранив ценовое преимущество в разы.

Но вот что важно: баллы баллами, а в реальных проектах важна стабильность. Прежде чем переводить критичные процессы, я бы рекомендовал погонять модель на ваших реальных данных и сценариях.

Для новых проектов и экспериментов — однозначно стоит попробовать. Цена-качество здесь сейчас одно из лучших на рынке среди топовых моделей.

Выводы

Ссылки

Дмитрий Полухин — продуктовый дизайнер. Пишу про разработку, AI и дизайн интерфейсов. Обо мне, контакты и профили.