К содержанию
Выпуск №71 · 18 августа 2026 / Новости

Inkling возвращает США в open-weight shortlist, но до экономии на API ещё далеко

Модель Thinking Machines Lab можно скачать и дообучать, однако компактной её назвать нельзя: даже квантованным весам нужно около 600 Гбайт памяти. Для бизнеса это кандидат на eval, а не готовое основание отключать внешний API.

Редакция 18 августа 2026 г., 23:20 MSK

В Telegram

Inkling возвращает американские открытые веса в список моделей, которые имеет смысл тестировать против закрытых API и китайских альтернатив. Но пока это скорее новая переговорная позиция для технической команды, чем очевидный способ сократить счёт за инференс: Heise не приводит ни измерений скорости на конкретном железе, ни результатов прикладных тестов, ни условий лицензии.

Что именно выпустили

Thinking Machines Lab, стартап бывшего технического директора OpenAI Миры Мурати, опубликовал веса своей первой большой языковой модели Inkling. По данным Heise, это MoE-модель на 975 млрд параметров, из которых при каждом вычислении активны 41 млрд. Издание называет её крупнейшей моделью с открытыми весами не из Китая на момент публикации.

У Inkling 66 слоёв и 256 экспертов. Для каждого предсказания включаются шесть экспертов и ещё два общих. Контекстное окно составляет 1 млн токенов, а модель работает с текстом, изображениями и аудио. Для дообучения на собственных данных Thinking Machines предлагает платформу Tinker.

Веса доступны в bfloat16 и более компактной квантизации NVFP4. Вот здесь презентация заканчивается и начинается инфраструктурная смета. Для NVFP4 требуется около 600 Гбайт памяти только под 975 млрд параметров, для bfloat16 около 2 Тбайт. Heise прямо пишет, что такой запрос выводит локальный запуск за пределы возможностей многих пользователей.

Разработчики встроили меньшую модель для Multi-Token Prediction. Если её прогноз верен, большая модель может за один шаг проверить несколько токенов и сгенерировать следующий. По оценке Heise, это заметно повышает скорость вывода и снижает среднее число параметров, задействованных в предсказании. Но «заметно» пока нельзя положить в финансовую модель: чисел по токенам в секунду и конфигурациям оборудования источник не приводит.

Open weights ещё не означают дешёвый production

Heise описывал стратегию Thinking Machines как ставку на адаптируемость, а не на абсолютное лидерство по качеству. Это разумная позиция для нового игрока. Закрытые API продают удобство и готовое качество, а открытые веса должны оправдывать сложности контроля, развёртывания и дообучения.

Inkling выглядит интереснее всего для команд, которым действительно нужны длинный контекст, мультимодальность или настройка на собственных данных. Если задача сводится к обычному текстовому ассистенту, огромная общая ёмкость модели сама по себе не доказывает экономию. Архитектура активирует только часть параметров, но хранить всё равно приходится весь массив весов.

Поэтому сравнивать Inkling с API по цене токена недостаточно. В полную стоимость владения придётся включить память, вычисления, загрузку оборудования, поддержку инференса, дообучение и цену ошибок на своей задаче. Последний пункт особенно важен: модель может оказаться дешевле на сервере, но дороже в процессе, если сотрудникам или клиентам приходится чаще исправлять ответы.

Есть и ещё один стоп-сигнал. Heise сообщает, что веса опубликованы, но не приводит условия лицензии. Пока команда не проверила, что разрешено для коммерческого использования, модификации и распространения производных версий, Inkling нельзя считать готовым production-выбором. Open-weight в названии категории не заменяет чтение юридического текста.

Зачем тестировать сейчас

Американское происхождение Inkling важно не как знак качества, а как дополнительный вариант в архитектуре зависимости. Heise пишет, что власти США обсуждают запрет китайских моделей с открытыми весами. Для российского бизнеса это не прямое указание, что выбирать, но полезное напоминание: происхождение модели уже становится предметом политики, а значит, shortlist из одного региона слишком хрупок.

Практический вывод простой. Скачивать Inkling для eval стоит командам, у которых уже есть доступ к сотням гигабайт памяти и понятный сценарий, где внешний API мешает контролю или экономике. Остальным разумнее дождаться воспроизводимых тестов, а не покупать инфраструктуру под обещание большого числа параметров.

Главный маркер на ближайшее время: появятся ли независимые сравнения Inkling с закрытыми API и китайскими open-weight моделями на одинаковых прикладных задачах, с указанным железом, скоростью и полной стоимостью запроса. Если к ним добавятся ясная коммерческая лицензия и приемлемая деградация качества, Inkling станет реальной альтернативой. Пока это сильный кандидат на стенд, но слабый кандидат в бюджет.

Как процитировать

«Inkling возвращает США в open-weight shortlist, но до экономии на API ещё далеко». hegai.media, 18 августа 2026 г.. https://hegai.media/novosti/inkling-vozvraschaet-ssha-v-open-weight-shortlist-no-do-ekonomii-na-ap--eba3a1a4-e579-41fc-9641-809164a80401

так материал выглядит в мессенджере