Исследователи из UC Berkeley и MIT создали FreeToken, движок инференса с открытым исходным кодом для запуска MoE-моделей на потребительском оборудовании. Как сообщает InfoQ AI/ML/Data, система динамически планирует вычисления и оптимизирует управление весами. Это ускоряет декодирование и повышает эффективность моделей в периферийных ИИ-приложениях.
Однако в опубликованных данных нет конкретных результатов тестов. Не указаны величина ускорения, конфигурации оборудования и параметры нагрузки, поэтому оценить экономически значимый выигрыш FreeToken на разных системах пока невозможно.
Разработка предназначена для самостоятельно размещаемых систем рассуждения. Локальное развертывание может быть оправдано для компании, если тесты на ее конфигурации и рабочей нагрузке подтвердят достаточный прирост скорости декодирования и эффективности выполнения MoE-моделей.
Ключевые факты
FreeToken разработали исследователи из UC Berkeley и MIT.
Движок распространяется с открытым исходным кодом.
Система использует динамическое планирование и оптимизированное управление весами.
Разработка ориентирована на периферийные ИИ-приложения и самостоятельно размещаемые системы рассуждения.
Вопросы и ответы
- Для каких сценариев рассчитан FreeToken?
Движок ориентирован на периферийные ИИ-приложения и самостоятельно размещаемые системы рассуждения, работающие на потребительском оборудовании.
- Можно ли развернуть FreeToken в собственной инфраструктуре?
Да, FreeToken распространяется с открытым исходным кодом и предназначен в том числе для самостоятельно размещаемых систем.
- За счет чего движок ускоряет работу MoE-моделей?
FreeToken использует динамическое планирование и оптимизированное управление весами, повышая скорость декодирования и эффективность выполнения моделей.
Контекст по теме
- NVIDIA заявила о снижении стоимости токенов на Blackwell за счет inference-стека30 июня 2026 г.
- ZTE представила архитектуру OEX SuperPOD для масштабных AI‑кластеров и повышения эффективности генерации токенов27 июня 2026 г.
- TokenSpeed-kernel: открытая подсистема для переносимых и производительных LLM‑ядер на разных типах чипов25 июня 2026 г.
- Исследование arXiv: объём вычислений на этапе инференса влияет на результаты тестов для frontier LLM18 июня 2026 г.