К содержанию
Выпуск №70 · 17 августа 2026 / Новости

Оптимизация Qwen 3.5-397B MoE может изменить выбор Ironwood при нагрузке с преобладанием предварительного заполнения

Как сообщает Google Developers Blog, инженеры создали на JAX/Pallas модульный стек оптимизации для обслуживания модели Qwen 3.5 Mixture-of-Experts с 397 млрд параметров на Ironwood.

Редакция 17 августа 2026 г., 12:11 MSK

В Telegram

Как сообщает Google Developers Blog, инженеры создали на JAX/Pallas модульный стек оптимизации для обслуживания модели Qwen 3.5 Mixture-of-Experts с 397 млрд параметров на Ironwood. На нагрузках, где преобладает предварительное заполнение, инференс ускорился до 4,7 раза.

Для основателей и операционных руководителей это повод сравнить Ironwood с альтернативами, если профиль их рабочей нагрузки близок к тестовому. Но перед окончательным решением стоит провести проверку на собственных задачах и оценить, как прирост влияет на стоимость инференса, задержку и пропускную способность. Опубликованный результат относится к конкретной модели, ускорителю и сценарию.

Ограничения аппаратного шардирования инженеры обошли с помощью гибридной топологии Data Parallelism и Expert Parallelism (DP+EP). Для маршрутизации токенов между устройствами они реализовали низкоуровневое слияние коммуникационных операций, включая иерархическую reduce-scatter.

Загрузить пропускную способность HBM и блоки TensorCore MXU помогли аппаратно-ориентированные ядра Batched Ragged Page Attention, а также полностью объединённый блок Gated DeltaNet (GDN). В итоге системная пропускная способность приблизилась к теоретическим пределам roofline. Однако такой инфраструктурный выбор оправдан лишь тогда, когда эти оптимизации улучшают измеримые показатели стоимости, задержки и пропускной способности на собственной нагрузке.

Ключевые факты

  • На нагрузках с преобладанием предварительного заполнения ускорение инференса достигло 4,7 раза.

  • Для обхода ограничений аппаратного шардирования команда использовала гибридную топологию DP+EP.

  • Иерархическая reduce-scatter применялась для оптимизации маршрутизации токенов между устройствами.

Вопросы и ответы

На каких сценариях достигается максимальное ускорение?

До 4,7 раза на нагрузках, где преобладает предварительное заполнение контекста, а не генерация токенов.

Как стек обходит ограничения шардирования на Ironwood?

Он сочетает Data Parallelism и Expert Parallelism в топологии DP+EP, а для маршрутизации токенов между устройствами использует иерархическую reduce-scatter.

Какие низкоуровневые оптимизации повышают загрузку ускорителей?

Ядро Batched Ragged Page Attention и полностью объединённый блок Gated DeltaNet насыщают пропускную способность HBM и блоки TensorCore MXU, приближая системную производительность к пределам roofline.

Контекст по теме

Как процитировать

«Оптимизация Qwen 3.5-397B MoE может изменить выбор Ironwood при нагрузке с преобладанием предварительного заполнения». hegai.media, 17 августа 2026 г.. https://hegai.media/novosti/optimizatsiya-qwen-3-5-397b-moe-mozhet-izmenit-vybor-ironwood-pri-nagr--42d21949-d9c3-4ef6-b1bc-04bcd01b3e06

так материал выглядит в мессенджере