К содержанию
Выпуск №77 · 24 августа 2026 / Новости

AMD протестировала Kimi Linear 48B-A3B с контекстом до 64Mi токенов на одном узле MI355X

Как сообщает AMD ROCm Blogs, модель Kimi Linear 48B-A3B протестировали на одном узле с 8 GPU AMD Instinct MI355X.

Редакция 24 августа 2026 г., 23:42 MSK

В Telegram

Как сообщает AMD ROCm Blogs, модель Kimi Linear 48B-A3B протестировали на одном узле с 8 GPU AMD Instinct MI355X. Она обслуживала контексты длиной от 1024 до 64Mi (67 108 864) токенов, то есть диапазон охватывал шесть порядков. Тесты проходили в vLLM с KV-кэшем FP8 и тензорным параллелизмом 8 (TP=8). Для каждой длины измеряли время префилла до появления первого токена и пропускную способность декодирования.

При TP=8 параметры модели распределялись между 8 рангами, примерно по 12 GiB на ранг в BF16. При этом в текущей реализации MLA KV-кэш копировался на каждый ранг. Каждый GPU AMD Instinct MI355X оснащен 288 GiB HBM. На длине 64Mi KV-кэш в BF16 уже не помещался, но формат FP8 позволил разместить его на одном узле.

Префилл контекста 64Mi до появления первого токена занимал около 11,2 часа. Это средний результат по 3 измерениям. По оценке авторов, при такой длительности один префикс нужно повторно использовать для множества запросов, чтобы распределить затраты на его обработку.

Ключевые факты

  • Тесты проводились в vLLM с KV-кэшем FP8 и тензорным параллелизмом 8.

  • Каждый GPU AMD Instinct MI355X имеет 288 GiB HBM, а параметры в BF16 занимали около 12 GiB на ранг.

  • Префилл длиной 64Mi занимал около 11,2 часа до первого токена в среднем по 3 измерениям.

  • KV-кэш в BF16 на длине 64Mi не помещался, а хранение в FP8 позволило разместить его на одном узле.

Вопросы и ответы

Какая конфигурация нужна для запуска такого контекста?

Один узел с 8 GPU AMD Instinct MI355X по 288 GiB HBM, vLLM, тензорный параллелизм TP=8 и KV-кэш в FP8. Параметры модели в BF16 занимали около 12 GiB на каждый ранг.

Сколько придется ждать первого ответа при максимальном контексте?

Префилл 64Mi токенов занимал в среднем около 11,2 часа до первого токена по итогам 3 измерений.

Что это меняет на практике для эксплуатации?

KV-кэш в BF16 при длине 64Mi не помещался на одном узле, а FP8 позволил его разместить. Из-за префилла в 11,2 часа один обработанный префикс нужно повторно использовать для множества запросов, чтобы распределить затраты.

Контекст по теме

Как процитировать

«AMD протестировала Kimi Linear 48B-A3B с контекстом до 64Mi токенов на одном узле MI355X». hegai.media, 24 августа 2026 г.. https://hegai.media/novosti/amd-protestirovala-kimi-linear-48b-a3b-s-kontekstom-do-64mi-tokenov-na--2e866157-73a4-41fa-acb4-8e0826600adf

так материал выглядит в мессенджере