Thinking Machines Lab представила свою первую большую языковую модель Inkling. Стартап основала Мира Мурати, ранее занимавшая пост технического директора OpenAI. Как сообщает Heise online, Inkling построена на архитектуре MoE и насчитывает 975 млрд параметров, из которых активны 41 млрд. Сейчас это крупнейшая модель с открытыми весами, созданная за пределами Китая.
Веса доступны в форматах bfloat16 и NVFP4. Даже в более компактном NVFP4 модели требуется около 600 Гбайт оперативной памяти только для параметров, а в bfloat16 объем достигает 2 Тбайт. Inkling состоит из 66 слоев и включает 256 экспертов. При каждом предсказании задействуются шесть из них, а также два общих эксперта. Длина контекста составляет 1 млн токенов. Модель работает с текстом, изображениями и аудио.
Кроме того, в Inkling встроена меньшая модель, которая предсказывает несколько токенов. Если прогноз оказывается верным, основная модель может за один шаг проверить эти токены и сгенерировать еще один. Это повышает скорость вывода и сокращает среднее число параметров, задействованных при предсказании. Дообучать Inkling на собственных данных можно через платформу Tinker.
Ключевые факты
Из 975 млрд параметров Inkling при вычислениях активны 41 млрд.
Даже в формате NVFP4 модель требует около 600 Гбайт оперативной памяти, а в bfloat16, 2 Тбайт.
Модель состоит из 66 слоев и включает 256 экспертов, из которых при каждом предсказании активны шесть и еще два общих эксперта.
Длина контекста Inkling составляет 1 млн токенов.
Вопросы и ответы
- Какая инфраструктура нужна для запуска Inkling?
Только для хранения параметров потребуется около 600 Гбайт оперативной памяти в формате NVFP4 или 2 Тбайт в bfloat16.
- С какими данными и объемом контекста работает модель?
Inkling обрабатывает текст, изображения и аудио, а длина контекста достигает 1 млн токенов.
- Как устроены инференс и дообучение на корпоративных данных?
При каждом предсказании активируются шесть из 256 экспертов и два общих эксперта, а встроенная меньшая модель ускоряет генерацию за счет предсказания нескольких токенов. Дообучение на собственных данных доступно через платформу Tinker.
Контекст по теме
- Alibaba опубликовала веса Qwen3.8-27B для локального запуска16 августа 2026 г.
- OpenAI снизила цены на модели Luna и Terra из линейки GPT-5.63 августа 2026 г.
- Thinking Machines Lab представила ИИ-модель Inkling с открытыми весами16 июля 2026 г.
- Китайский ИИ-стек больше не догоняет, а задаёт темп9 июня 2026 г.