Как сообщает Google Developers Blog, инженеры создали на JAX/Pallas модульный стек оптимизации для обслуживания модели Qwen 3.5 Mixture-of-Experts с 397 млрд параметров на Ironwood. На нагрузках, где преобладает предварительное заполнение, инференс ускорился до 4,7 раза.
Для основателей и операционных руководителей это повод сравнить Ironwood с альтернативами, если профиль их рабочей нагрузки близок к тестовому. Но перед окончательным решением стоит провести проверку на собственных задачах и оценить, как прирост влияет на стоимость инференса, задержку и пропускную способность. Опубликованный результат относится к конкретной модели, ускорителю и сценарию.
Ограничения аппаратного шардирования инженеры обошли с помощью гибридной топологии Data Parallelism и Expert Parallelism (DP+EP). Для маршрутизации токенов между устройствами они реализовали низкоуровневое слияние коммуникационных операций, включая иерархическую reduce-scatter.
Загрузить пропускную способность HBM и блоки TensorCore MXU помогли аппаратно-ориентированные ядра Batched Ragged Page Attention, а также полностью объединённый блок Gated DeltaNet (GDN). В итоге системная пропускная способность приблизилась к теоретическим пределам roofline. Однако такой инфраструктурный выбор оправдан лишь тогда, когда эти оптимизации улучшают измеримые показатели стоимости, задержки и пропускной способности на собственной нагрузке.
Ключевые факты
На нагрузках с преобладанием предварительного заполнения ускорение инференса достигло 4,7 раза.
Для обхода ограничений аппаратного шардирования команда использовала гибридную топологию DP+EP.
Иерархическая reduce-scatter применялась для оптимизации маршрутизации токенов между устройствами.
Вопросы и ответы
- На каких сценариях достигается максимальное ускорение?
До 4,7 раза на нагрузках, где преобладает предварительное заполнение контекста, а не генерация токенов.
- Как стек обходит ограничения шардирования на Ironwood?
Он сочетает Data Parallelism и Expert Parallelism в топологии DP+EP, а для маршрутизации токенов между устройствами использует иерархическую reduce-scatter.
- Какие низкоуровневые оптимизации повышают загрузку ускорителей?
Ядро Batched Ragged Page Attention и полностью объединённый блок Gated DeltaNet насыщают пропускную способность HBM и блоки TensorCore MXU, приближая системную производительность к пределам roofline.
Контекст по теме
- Qwen представила модель Qwen-AgentWorld-35B-A3B для симуляции сред агентных систем24 июня 2026 г.
- Prime Intellect выпустила фреймворк prime-rl 0.6.0 для обучения триллионных MoE‑моделей в задачах агентного RL23 июня 2026 г.
- Запуск Qwen3.6-35B-A3B на одной RTX 3090: сравнение конфигураций и кэшей KV22 июня 2026 г.
- Метод структурного pruning для MoE‑моделей на основе атрибуции и покрытия каналов19 июня 2026 г.