Французский стартап Kog разрабатывает Kog Inference Engine (KIE), систему для ускорения декодирования на стандартных датацентровых GPU. Как сообщает TechCrunch, во время майской технической демонстрации KIE достигла скорости 3 000 токенов в секунду на один запрос с использованием AMD MI300X и Nvidia H200. Для теста взяли специально созданную модель Laneformer 2B примерно с 2 млрд параметров. Ее исходный код открыт.
После демонстрации Kog получила 200 предметных обращений от бизнеса. Гендиректор компании Гаэль Делалло рассказал, что ранние отзывы указывают на разработку ПО как на первый сценарий применения. Пользователям Claude Code иногда приходится ждать результатов часами, при этом Anthropic предлагает Fast Mode по более высокой цене.
Однако потенциальные клиенты Kog оказались не готовы дообучать небольшие модели. Поэтому стартап переключился на ускорение более крупных моделей и намерен добиться заявленного 30-кратного ускорения инференса LLM. Для каждого GPU нужна отдельная глубокая оптимизация, которая, по словам Делалло, занимает несколько недель или даже месяцев.
Ключевые факты
В демонстрации KIE достигла 3 000 токенов в секунду на один запрос на AMD MI300X и Nvidia H200.
Laneformer 2B содержит около 2 млрд параметров, ее исходный код открыт.
После технической демонстрации Kog получила 200 предметных обращений от бизнеса.
Оптимизация под каждый новый GPU занимает несколько недель или даже месяцев.
Вопросы и ответы
- Для каких задач Kog видит первый практический спрос?
Первым сценарием стала разработка ПО: пользователи Claude Code иногда ждут результатов часами, а ускоренный Fast Mode у Anthropic стоит дороже. После демонстрации Kog получила 200 предметных обращений от бизнеса.
- Можно ли уже рассчитывать на 30-кратное ускорение крупных LLM?
Пока 3 000 токенов в секунду показаны на открытой Laneformer 2B с примерно 2 млрд параметров на AMD MI300X и Nvidia H200. Ускорение крупных LLM в 30 раз остается заявленной целью Kog.
- Насколько быстро KIE можно адаптировать под новое оборудование?
Для каждого нового GPU требуется отдельная глубокая оптимизация. По оценке гендиректора Гаэля Делалло, она занимает от нескольких недель до нескольких месяцев.
Контекст по теме
- EGG: фреймворк агентной генерации GPU‑ядер с экспертными подсказками26 июня 2026 г.
- Автор блога усомнился в предположении о трёхлетнем сроке службы AI‑GPU19 июня 2026 г.
- GPU‑резидентный Top‑K для agentic RAG: как CUDA‑ядро убирает задержки передачи через PCIe19 июня 2026 г.
- Kari Briski: как Nvidia готовится к росту агентных систем ИИ19 июня 2026 г.