Почему amd mi355x обгоняет b300 на kimi k3

02.08.2026 · 5 мин

Я всегда скептически отношусь к сравнениям GPU от разных вендоров: в реальности всё решает не только чип, но и экосистема, драйверы и поддержка фреймворков.

Почему kimi k3 меняет правила игры

Kimi K3 — это открытая модель от разработчиков Kimi, обещающая уровень интеллекта, сопоставимый с лучшими закрытыми LLM. Проблема в том, что большие модели требуют больше памяти.

Kimi K3 весит 2.8 триллиона параметров. Это более 1.5 терабайта VRAM только под веса — и это без учёта KV-кэша для длинного контекста. Даже узел из восьми B200 не вмещает модель целиком.

Перед инженерами встаёт выбор: B300 с 288 гигабайтами на GPU или два узла B200, объединённых в кластер. Оба варианта — дорогие. Но есть третий путь: AMD MI355X с тем же объёмом памяти на GPU, но существенно ниже ценой.

Стек и методика тестирования

Wafer прогнали Kimi K3 на трёх конфигурациях с помощью SGLang:

Нагрузка: синтетический бенчмарк с 1024 токенами на вход и 400 на выход. Это типичный сценарий для RAG-систем или агентных пайплайнов.

Измеряли три метрики: декодирование tok/s, пиковую совокупную пропускную способность и производительность на доллар.

СРАВНЕНИЕ GPU ДЛЯ KIMI K3
──────────────────────────
                          MI355X      B200×2      B300
                          (8 GPU)    (16 GPU)   (8 GPU)
                          ───────    ───────    ───────
Декодирование / поток      118        90         172
tok/s

Совокупная пиковая        952        498        1568
tok/s

На GPU                   119         31         196
tok/s/GPU

На $                      48          7          33
tok/s/$/hr

Цена/GPU/час (прибл.)     $2.50      $4.25      $6.00
Сравнение производительности и стоимости на разных GPU для Kimi K3.

Где amd выигрывает

MI355X выдаёт 952 tok/s совокупно — это заметно больше, чем два узла B200, хотя те используют вдвое больше GPU. Декодирование на поток у MI355X тоже выше, чем у B200.

B300 ожидаемо лидирует по абсолютным цифрам, но если смотреть на производительность на доллар, картина меняется. MI355X оказывается заметно выгоднее.

B200 проигрывает не потому, что чипы плохие, а потому что Kimi K3 физически не вмещается в один узел. Модели нужны веса плюс KV-кэш, и межузловое соединение становится бутылочным горлышком на критическом пути декодирования.

MI355X решает это иначе: 288 ГБ HBM на чип дают именно ту ёмкость, которая нужна для монструозных моделей нового поколения. Один узел из восьми MI355X вмещает Kimi K3 целиком, без межузловых задержек.

ГДЕ СХЕМА ЛОМАЕТСЯ
──────────────────
┌───────────────┐      ┌───────────────┐
│   B200 × 2    │──────▶│ RoCE v2 link  │
│  16 GPU total │      │ bottleneck     │
└───────────────┘      └───────────────┘
        │
        │ model split
        ▼
┌───────────────────────────────┐
│ Kimi K3 exceeds one node      │
│ weights + KV-cache            │
└───────────────────────────────┘

┌───────────────────────────────┐
│        MI355X × 8             │
│   fits model in one node      │
│   no inter-node latency       │
└───────────────────────────────┘
У B200 узкое место создаёт распределение между узлами, а MI355X укладывает модель в один сервер.

Выводы

Для сверхбольших моделей важна не только скорость GPU, но и то, помещается ли модель в один узел.

AMD MI355X выигрывает там, где ёмкость памяти и отсутствие межузловых задержек дают больший эффект, чем сырая пиковая производительность.

Если смотреть на стоимость владения и токены на доллар, MI355X выглядит очень сильным вариантом для инференса огромных LLM.

Ссылки

Дмитрий Полухин — продуктовый дизайнер. Пишу про разработку, AI и дизайн интерфейсов. Обо мне, контакты и профили.