К содержанию
Выпуск №70 · 17 августа 2026 / Новости

Kog нацелилась на ускорение инференса крупных моделей на датацентровых GPU

Французский стартап Kog разрабатывает Kog Inference Engine KIE, систему для ускорения декодирования на стандартных датацентровых GPU.

Редакция 17 августа 2026 г., 14:29 MSK

В Telegram

Французский стартап Kog разрабатывает Kog Inference Engine (KIE), систему для ускорения декодирования на стандартных датацентровых GPU. Как сообщает TechCrunch, во время майской технической демонстрации KIE достигла скорости 3 000 токенов в секунду на один запрос с использованием AMD MI300X и Nvidia H200. Для теста взяли специально созданную модель Laneformer 2B примерно с 2 млрд параметров. Ее исходный код открыт.

После демонстрации Kog получила 200 предметных обращений от бизнеса. Гендиректор компании Гаэль Делалло рассказал, что ранние отзывы указывают на разработку ПО как на первый сценарий применения. Пользователям Claude Code иногда приходится ждать результатов часами, при этом Anthropic предлагает Fast Mode по более высокой цене.

Однако потенциальные клиенты Kog оказались не готовы дообучать небольшие модели. Поэтому стартап переключился на ускорение более крупных моделей и намерен добиться заявленного 30-кратного ускорения инференса LLM. Для каждого GPU нужна отдельная глубокая оптимизация, которая, по словам Делалло, занимает несколько недель или даже месяцев.

Ключевые факты

  • В демонстрации KIE достигла 3 000 токенов в секунду на один запрос на AMD MI300X и Nvidia H200.

  • Laneformer 2B содержит около 2 млрд параметров, ее исходный код открыт.

  • После технической демонстрации Kog получила 200 предметных обращений от бизнеса.

  • Оптимизация под каждый новый GPU занимает несколько недель или даже месяцев.

Вопросы и ответы

Для каких задач Kog видит первый практический спрос?

Первым сценарием стала разработка ПО: пользователи Claude Code иногда ждут результатов часами, а ускоренный Fast Mode у Anthropic стоит дороже. После демонстрации Kog получила 200 предметных обращений от бизнеса.

Можно ли уже рассчитывать на 30-кратное ускорение крупных LLM?

Пока 3 000 токенов в секунду показаны на открытой Laneformer 2B с примерно 2 млрд параметров на AMD MI300X и Nvidia H200. Ускорение крупных LLM в 30 раз остается заявленной целью Kog.

Насколько быстро KIE можно адаптировать под новое оборудование?

Для каждого нового GPU требуется отдельная глубокая оптимизация. По оценке гендиректора Гаэля Делалло, она занимает от нескольких недель до нескольких месяцев.

Контекст по теме

Как процитировать

«Kog нацелилась на ускорение инференса крупных моделей на датацентровых GPU». hegai.media, 17 августа 2026 г.. https://hegai.media/novosti/kog-natselilas-na-uskorenie-inferensa-krupnyh-modeley-na-datatsentrovy--7375c340-ef42-4a80-976d-ce718fe7d505

так материал выглядит в мессенджере