Как сообщает Heise online, в тестах четырёх локальных LLM технология Multi Token Prediction повысила скорость генерации на 25–250% токенов в секунду по сравнению с работой без MTP. Прирост зависел в том числе от выбранной модели. При этом функция доступна не для всех локальных LLM.
MTP поддерживают Gemma 4, Qwen3.5, Qwen3.6 и Qwen3.8. У Gemma 4, Qwen3.5 и Qwen3.6 есть достаточно компактные варианты, способные быстро работать на хорошо оснащённых игровых ПК с видеокартами на 16 Гбайт.
Gemma 4, Qwen3.5 и Qwen3.6 тестировали на Radeon RX 9060 XT. На Nvidia GeForce RTX 3090 проверяли Gemma 4, Qwen3.6 и Qwen3.8. Для замеров использовали Llama.cpp: результаты сравнивали на двух промптах с MTP и без неё, а также дополнительно настраивали один параметр.
Ключевые факты
В тестах четыре LLM генерировали на 25–250% больше токенов в секунду при использовании MTP.
MTP поддерживают Gemma 4, Qwen3.5, Qwen3.6 и Qwen3.8.
Тестовый ПК с Radeon RX 9060 XT был оснащён 16 Гбайт видеопамяти и 32 Гбайт DDR5-RAM.
Gemma 4, Qwen3.6 и Qwen3.8 также проверяли на Nvidia GeForce RTX 3090.
Вопросы и ответы
- Какие локальные модели уже поддерживают MTP?
Технология работает с Gemma 4, Qwen3.5, Qwen3.6 и Qwen3.8. У первых трёх есть компактные версии для игровых ПК с видеокартами на 16 Гбайт.
- На каком оборудовании проверяли ускорение?
Gemma 4, Qwen3.5 и Qwen3.6 тестировали на Radeon RX 9060 XT с 16 Гбайт видеопамяти и 32 Гбайт DDR5-RAM. Gemma 4, Qwen3.6 и Qwen3.8 также запускали на GeForce RTX 3090.
- Какой прирост производительности можно ожидать?
В четырёх протестированных LLM скорость выросла на 25–250% токенов в секунду в зависимости от модели. Замеры проводили в Llama.cpp на двух промптах, сравнивая режимы с MTP и без неё.
Контекст по теме
- LiteLLM предлагает централизованное управление использованием LLM в компаниях27 июля 2026 г.
- CrankGPT: ИИ‑гаджет, который работает от ручной рукоятки11 июня 2026 г.
- Google ускоряет Gemma 4 с помощью Diffusiongemma и техники генерации изображений11 июня 2026 г.
- Heise показало, как установить и использовать локальные модели ИИ на ПК10 июня 2026 г.