К содержанию
Выпуск №73 · 20 августа 2026 / Новости

Пропускная способность LFM2.5 с DSpark выросла в 3,18 раза на GPU

Для LFM2.5-2.6B технология также в среднем на 57% сократила задержку вызова функций в сценариях с несколькими инструментами.

Редакция 20 августа 2026 г., 20:43 MSK

В Telegram

По данным Hugging Face Blog, DSpark увеличила пропускную способность инференса LFM2.5 до 3,18 раза на GPU и до 2,87 раза при локальном запуске на устройстве. Для LFM2.5-2.6B технология также в среднем на 57% сократила задержку вызова функций в сценариях с несколькими инструментами.

В основе DSpark лежит параллельная архитектура в стиле DFlash. Она использует облегченную головку, которая учитывает зависимость между соседними токенами, и проверку по расписанию уверенности, отбрасывающую окончания с низкой уверенностью. При жадном декодировании предложенный токен принимается только в том случае, если он совпадает с распределением целевой модели. Благодаря этому итоговая последовательность остается идентичной базовому варианту.

Тесты проводили на M4 Max MacBook Pro с llama.cpp, Metal и весами FP16 GGUF, а также на одном H100 80 GB с SGLang и BF16. В обоих случаях использовали блок размером 9, пакет из одного запроса и температуру 0. На MacBook производительность LFM2.5-2.6B достигала около 140 токенов/с в зависимости от набора данных. У LFM2.5-1.2B-Instruct ускорение различалось до 52% в зависимости от распределения текста. Модель LFM2.5-8B-A1B при локальном запуске показала средний прирост 18%.

Интеграция DSpark для LFM2.5 поддерживает llama.cpp и SGLang, код открыт в основных проектах. При этом ускорение зависит от распределения текста, что остается ключевым ограничением для команд, отвечающих за инференс. Поэтому решение о внедрении следует принимать после пилота на рабочих запросах, оценивая задержку, пропускную способность и идентичность результата жадного декодирования.

Ключевые факты

  • Для LFM2.5-2.6B задержка вызова функций сократилась в среднем на 57%.

  • Каждая вспомогательная модель содержит около 300 млн параметров и обучалась 15 эпох.

  • Тесты проводили на M4 Max MacBook Pro и одном H100 с 80 ГБ памяти.

  • LFM2.5-8B-A1B при локальном запуске показала средний прирост производительности 18%.

Вопросы и ответы

На каком оборудовании подтверждены результаты?

Тесты проводили на M4 Max MacBook Pro с llama.cpp, Metal и весами FP16 GGUF, а также на одном H100 с 80 ГБ памяти, SGLang и BF16.

Меняется ли качество или результат генерации после ускорения?

При жадном декодировании итоговая последовательность идентична базовой: токен принимается только при совпадении с распределением целевой модели.

Как внедрить DSpark в текущий стек?

Интеграция для LFM2.5 уже доступна в llama.cpp и SGLang, код открыт в основных проектах.

Контекст по теме

Как процитировать

«Пропускная способность LFM2.5 с DSpark выросла в 3,18 раза на GPU». hegai.media, 20 августа 2026 г.. https://hegai.media/novosti/propusknaya-sposobnost-lfm2-5-s-dspark-vyrosla-v-3-18-raza-na-gpu--bba54c61-ff3e-4b75-85bc-072a3a4472f9

так материал выглядит в мессенджере