Как сообщает AMD ROCm Blogs, модель Kimi Linear 48B-A3B протестировали на одном узле с 8 GPU AMD Instinct MI355X. Она обслуживала контексты длиной от 1024 до 64Mi (67 108 864) токенов, то есть диапазон охватывал шесть порядков. Тесты проходили в vLLM с KV-кэшем FP8 и тензорным параллелизмом 8 (TP=8). Для каждой длины измеряли время префилла до появления первого токена и пропускную способность декодирования.
При TP=8 параметры модели распределялись между 8 рангами, примерно по 12 GiB на ранг в BF16. При этом в текущей реализации MLA KV-кэш копировался на каждый ранг. Каждый GPU AMD Instinct MI355X оснащен 288 GiB HBM. На длине 64Mi KV-кэш в BF16 уже не помещался, но формат FP8 позволил разместить его на одном узле.
Префилл контекста 64Mi до появления первого токена занимал около 11,2 часа. Это средний результат по 3 измерениям. По оценке авторов, при такой длительности один префикс нужно повторно использовать для множества запросов, чтобы распределить затраты на его обработку.
Ключевые факты
Тесты проводились в vLLM с KV-кэшем FP8 и тензорным параллелизмом 8.
Каждый GPU AMD Instinct MI355X имеет 288 GiB HBM, а параметры в BF16 занимали около 12 GiB на ранг.
Префилл длиной 64Mi занимал около 11,2 часа до первого токена в среднем по 3 измерениям.
KV-кэш в BF16 на длине 64Mi не помещался, а хранение в FP8 позволило разместить его на одном узле.
Вопросы и ответы
- Какая конфигурация нужна для запуска такого контекста?
Один узел с 8 GPU AMD Instinct MI355X по 288 GiB HBM, vLLM, тензорный параллелизм TP=8 и KV-кэш в FP8. Параметры модели в BF16 занимали около 12 GiB на каждый ранг.
- Сколько придется ждать первого ответа при максимальном контексте?
Префилл 64Mi токенов занимал в среднем около 11,2 часа до первого токена по итогам 3 измерений.
- Что это меняет на практике для эксплуатации?
KV-кэш в BF16 при длине 64Mi не помещался на одном узле, а FP8 позволил его разместить. Из-за префилла в 11,2 часа один обработанный префикс нужно повторно использовать для множества запросов, чтобы распределить затраты.
Контекст по теме
- Почему расчёт токенов перестал быть универсальной метрикой для AI-моделей17 июля 2026 г.
- Google ограничила использование Gemini для компании Meta* из-за дефицита мощностей28 июня 2026 г.
- Большое контекстное окно LLM не равно памяти: почему модели с 1 млн токенов все равно ошибаются28 июня 2026 г.
- Энтузиаст запустил GLM-5.2 с MTP speculative decode на кластере из 4× DGX Spark (GB10)25 июня 2026 г.