К содержанию
Выпуск №72 · 19 августа 2026 / Новости

Multi Token Prediction ускоряет генерацию локальных LLM

Прирост зависел в том числе от выбранной модели. При этом функция доступна не для всех локальных LLM. MTP поддерживают Gemma 4, Qwen3.5, Qwen3.6 и Qwen3.8.

Редакция 19 августа 2026 г., 15:39 MSK

В Telegram

Как сообщает Heise online, в тестах четырёх локальных LLM технология Multi Token Prediction повысила скорость генерации на 25–250% токенов в секунду по сравнению с работой без MTP. Прирост зависел в том числе от выбранной модели. При этом функция доступна не для всех локальных LLM.

MTP поддерживают Gemma 4, Qwen3.5, Qwen3.6 и Qwen3.8. У Gemma 4, Qwen3.5 и Qwen3.6 есть достаточно компактные варианты, способные быстро работать на хорошо оснащённых игровых ПК с видеокартами на 16 Гбайт.

Gemma 4, Qwen3.5 и Qwen3.6 тестировали на Radeon RX 9060 XT. На Nvidia GeForce RTX 3090 проверяли Gemma 4, Qwen3.6 и Qwen3.8. Для замеров использовали Llama.cpp: результаты сравнивали на двух промптах с MTP и без неё, а также дополнительно настраивали один параметр.

Ключевые факты

  • В тестах четыре LLM генерировали на 25–250% больше токенов в секунду при использовании MTP.

  • MTP поддерживают Gemma 4, Qwen3.5, Qwen3.6 и Qwen3.8.

  • Тестовый ПК с Radeon RX 9060 XT был оснащён 16 Гбайт видеопамяти и 32 Гбайт DDR5-RAM.

  • Gemma 4, Qwen3.6 и Qwen3.8 также проверяли на Nvidia GeForce RTX 3090.

Вопросы и ответы

Какие локальные модели уже поддерживают MTP?

Технология работает с Gemma 4, Qwen3.5, Qwen3.6 и Qwen3.8. У первых трёх есть компактные версии для игровых ПК с видеокартами на 16 Гбайт.

На каком оборудовании проверяли ускорение?

Gemma 4, Qwen3.5 и Qwen3.6 тестировали на Radeon RX 9060 XT с 16 Гбайт видеопамяти и 32 Гбайт DDR5-RAM. Gemma 4, Qwen3.6 и Qwen3.8 также запускали на GeForce RTX 3090.

Какой прирост производительности можно ожидать?

В четырёх протестированных LLM скорость выросла на 25–250% токенов в секунду в зависимости от модели. Замеры проводили в Llama.cpp на двух промптах, сравнивая режимы с MTP и без неё.

Контекст по теме

Как процитировать

«Multi Token Prediction ускоряет генерацию локальных LLM». hegai.media, 19 августа 2026 г.. https://hegai.media/novosti/multi-token-prediction-uskoryaet-generatsiyu-lokalnyh-llm--cf5e3cf2-0bd1-41b6-b855-b8f719851b0d

так материал выглядит в мессенджере