К содержанию
Выпуск №71 · 18 августа 2026 / Новости

Thinking Machines Lab представила языковую модель Inkling с открытыми весами

Стартап основала Мира Мурати, ранее занимавшая пост технического директора OpenAI.

Редакция 18 августа 2026 г., 15:12 MSK

В Telegram

Thinking Machines Lab представила свою первую большую языковую модель Inkling. Стартап основала Мира Мурати, ранее занимавшая пост технического директора OpenAI. Как сообщает Heise online, Inkling построена на архитектуре MoE и насчитывает 975 млрд параметров, из которых активны 41 млрд. Сейчас это крупнейшая модель с открытыми весами, созданная за пределами Китая.

Веса доступны в форматах bfloat16 и NVFP4. Даже в более компактном NVFP4 модели требуется около 600 Гбайт оперативной памяти только для параметров, а в bfloat16 объем достигает 2 Тбайт. Inkling состоит из 66 слоев и включает 256 экспертов. При каждом предсказании задействуются шесть из них, а также два общих эксперта. Длина контекста составляет 1 млн токенов. Модель работает с текстом, изображениями и аудио.

Кроме того, в Inkling встроена меньшая модель, которая предсказывает несколько токенов. Если прогноз оказывается верным, основная модель может за один шаг проверить эти токены и сгенерировать еще один. Это повышает скорость вывода и сокращает среднее число параметров, задействованных при предсказании. Дообучать Inkling на собственных данных можно через платформу Tinker.

Ключевые факты

  • Из 975 млрд параметров Inkling при вычислениях активны 41 млрд.

  • Даже в формате NVFP4 модель требует около 600 Гбайт оперативной памяти, а в bfloat16, 2 Тбайт.

  • Модель состоит из 66 слоев и включает 256 экспертов, из которых при каждом предсказании активны шесть и еще два общих эксперта.

  • Длина контекста Inkling составляет 1 млн токенов.

Вопросы и ответы

Какая инфраструктура нужна для запуска Inkling?

Только для хранения параметров потребуется около 600 Гбайт оперативной памяти в формате NVFP4 или 2 Тбайт в bfloat16.

С какими данными и объемом контекста работает модель?

Inkling обрабатывает текст, изображения и аудио, а длина контекста достигает 1 млн токенов.

Как устроены инференс и дообучение на корпоративных данных?

При каждом предсказании активируются шесть из 256 экспертов и два общих эксперта, а встроенная меньшая модель ускоряет генерацию за счет предсказания нескольких токенов. Дообучение на собственных данных доступно через платформу Tinker.

Контекст по теме

Как процитировать

«Thinking Machines Lab представила языковую модель Inkling с открытыми весами». hegai.media, 18 августа 2026 г.. https://hegai.media/novosti/thinking-machines-lab-predstavila-yazykovuyu-model-inkling-s-otkrytymi--dfd84908-8121-4eba-a204-ff4ca7224f02

так материал выглядит в мессенджере