Habr разбирает FreeToken, движок для локального инференса MoE-моделей, под заголовком «753B на одной видеокарте». Практический результат в опубликованном тексте пока скромнее заголовка, но полезнее для бизнеса: 35-миллиардная модель выдаёт 39,3 tok/s на ноутбучной RTX 4060 с 8 ГБ видеопамяти и урезанным вдвое PCIe-линком.
Это сильная заявка на новый режим локальной работы с большими моделями. Не обязательно обслуживать ими пользователей. Уже ценно иметь возможность открыть модель на доступной машине, проверить её поведение и решить, стоит ли вообще переходить к дорогой инфраструктуре.
Что именно показал FreeToken
Как пишет Habr, FreeToken разработала команда, которая до этого сделала vLLM и SGLang. Движок предназначен для локального инференса MoE-моделей. В приведённом тесте скорость генерации на RTX 4060 составила 39,3 токена в секунду. Автор сравнивает этот результат с медианной скоростью декода Codex в продакшене и утверждает, что FreeToken работает быстрее.
На этом твёрдая часть измерений заканчивается. Из текста нельзя узнать, какая именно 35-миллиардная модель использовалась, сколько оперативной памяти и места на накопителе потребовалось, как долго загружалась модель и каким был time-to-first-token. Нет и замеров качества относительно исходного варианта модели. Поэтому цифра 39,3 tok/s выглядит убедительно только в своей узкой роли: она показывает скорость декода в одной описанной конфигурации, но не даёт посчитать пользовательскую задержку или цену запроса.
С 753B разрыв ещё заметнее. Размер вынесен в заголовок разбора, однако в доступном описании нет конфигурации такого запуска и результатов теста. Не указаны GPU, объём RAM или SSD, скорость генерации, задержка первого токена и влияние метода на качество. Формула «753B на одной видеокарте» поэтому пока описывает возможность запуска, а не пригодность системы для эксплуатации.
Одна видеокарта не равна одной машине
Для инфраструктурного бюджета важно не то, поместились ли вычисления в видеопамять одной GPU. Важно, какое остальное железо понадобилось, сколько длится полный ответ и не приходится ли расплачиваться за экономию VRAM задержкой или потерей качества.
FreeToken интересен именно тем, что ставит под сомнение привычную связь между размером модели и необходимым объёмом видеопамяти. Если подход действительно позволяет исследовать гигантские MoE-модели на доступной GPU, билдер получает локальный полигон вместо немедленной аренды кластера. Можно валидировать гипотезы, искать подходящую модель и отбрасывать неудачные варианты до разговора о продакшене. Для небольшой команды это может быть ценнее очередного рекорда скорости: меньше денег уходит на право просто посмотреть, что модель умеет.
Но переносить этот вывод на обслуживание реальной нагрузки нельзя. Скорость декода не отвечает на вопрос, сколько пользователь ждёт первый токен. Запуск не равен стабильной работе под запросами. А стоимость одной GPU ничего не говорит о цене всей системы, если неизвестны требования к RAM и накопителю.
Здесь особенно легко попасть в ловушку красивой единицы измерения. Параметры модели хорошо смотрятся в заголовке, tokens/s хорошо смотрятся в таблице, а бизнес платит за полный ответ нужного качества и за всё железо, которое этот ответ производит.
Что смотреть дальше
Проверка FreeToken будет убедительной, когда для запуска 753B появится воспроизводимая конфигурация: точная GPU, объём RAM и SSD, tokens/s, time-to-first-token, время загрузки и сравнение качества. Следующий обязательный показатель для бизнеса: стоимость всей машины и одного запроса, а не только цена видеокарты.
Если эти цифры окажутся приемлемыми, FreeToken действительно отделит размер весов от порога входа в локальное исследование моделей. Если публикации продолжат показывать только факт запуска и скорость декода на меньших моделях, 753B останется эффектной демонстрацией. Полезной для лаборатории, но бесполезной для пересчёта продакшен-бюджета.