Набор accelerator-microbenchmarks помогает руководителю AI-инфраструктуры понять, во что упирается нагрузка: в вычисления, память или сеть. На основе этого можно выбрать подходящую программную оптимизацию. Как сообщает Google Developers Blog, набор предназначен для эмпирической оценки производительности TPU на тестовых нагрузках. Он позволяет сравнить реальные показатели с теоретическими характеристиками и определить, что именно ограничивает конкретную нагрузку или архитектуру.
Тесты охватывают пять областей. Network измеряет пропускную способность и задержку операций all-gather, all-reduce, reduce-scatter и all-to-all. Compute оценивает производительность GEMM/Matmul в TFLOPs и MFU, а HBM показывает пропускную способность памяти в GB/s. Host Transfer измеряет скорость передачи данных между CPU и HBM через PCIe в направлениях H2D и D2H. RPAv3, в свою очередь, проверяет производительность Attention и BMM. Эти результаты помогают прогнозировать скорость инференса и находить ограничения, влияющие на задержку TTFT.
Дальнейшие действия зависят от обнаруженного ограничения. Если нагрузка упирается в вычисления, можно повысить эффективность ядер или сократить FLOPs. При нехватке пропускной способности памяти стоит оптимизировать локальность данных либо уменьшить трафик HBM. Сетевые ограничения требуют улучшить стратегии шардирования или совмещение коммуникаций с вычислениями. В итоге узкое место можно отнести к одной из трех категорий: вычисления, память или сеть.
В репозитории находятся каталог src с реализациями микробенчмарков и каталог configs с параметрами тестов. В конфигурациях задаются размеры буферов, число итераций и типы данных bf16, fp8 и fp32. Полученные результаты можно использовать для построения модели Roofline и определения главного ограничения нагрузки, связанного с вычислениями, памятью или сетью.
Ключевые факты
Набор оценивает пять областей: сеть, вычисления, HBM, передачу данных с хоста и Ragged-Paged Attention.
Сетевые тесты измеряют пропускную способность в ГБ/с и задержку в секундах.
Вычислительный тест использует GEMM/Matmul и фиксирует производительность в терафлопсах и MFU.
Конфигурации позволяют задавать размеры буферов, число итераций и типы данных bf16, fp8 и fp32.
Вопросы и ответы
- Какие узкие места можно выявить с помощью набора?
Результаты позволяют определить, чем ограничена нагрузка: вычислениями, памятью или сетью. Для этого можно построить модель Roofline, используя замеры TFLOPs, MFU, пропускной способности в GB/s и задержки.
- Можно ли адаптировать тесты под свою нагрузку?
Да. В конфигурациях можно задавать размеры буферов, число итераций и тип данных: bf16, fp8 или fp32.
- Что набор дает командам, которые оптимизируют инференс?
Тест RPAv3 измеряет производительность Attention и BMM, помогает прогнозировать скорость инференса и выявлять ограничения по задержке TTFT.
Контекст по теме
- Оптимизация Qwen 3.5-397B MoE может изменить выбор Ironwood при нагрузке с преобладанием предварительного заполнения17 августа 2026 г.
- Google представила Tunix для высокопроизводительного обучения LLM-агентов16 августа 2026 г.
- Ray 2.55 получил официальную поддержку Google Cloud TPU16 августа 2026 г.
- Zhonghao Xinying представила TPU-чип Xuyu с производительностью до 896 TFLOPS30 июня 2026 г.
