К содержанию
Выпуск №78 · 25 августа 2026 / Новости

OpenAI раскрыла результаты тестов чипа Jalapeño для инференса

Как сообщает The New Stack, его с нуля разрабатывали для инференса больших языковых моделей.

Редакция 25 августа 2026 г., 21:47 MSK

В Telegram

OpenAI опубликовала первые результаты испытаний Jalapeño, своего первого специализированного чипа для инференса, созданного совместно с Broadcom. Как сообщает The New Stack, его с нуля разрабатывали для инференса больших языковых моделей. В июне компания заявляла, что чип значительно превосходит существующие ускорители по производительности на ватт, но подробных результатов тогда не раскрыла.

Jalapeño протестировали в публичном бенчмарке InferenceX от SemiAnalysis на моделях GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T. По данным OpenAI, чип выполнял в 1,5–1,9 раза больше работы на ватт, а сквозная задержка оказалась в 1,7–3,6 раза ниже. В интерактивных нагрузках система работала в 2,1–4,1 раза быстрее решений, с которыми ее сравнивали.

OpenAI объясняет, что архитектура Jalapeño рассчитана на агентные сценарии. В таких задачах задержки от последовательных обращений к модели накапливаются. Состояние модели, в том числе KV cache, можно хранить локально, а сетевое соединение помогает оставлять больше нагрузки внутри одной связанной системы.

Номинальная мощность чипа составляет 700 Вт. При этом, по утверждению компании, во время тестов его энергопотребление не превышало 550 Вт.

Ключевые факты

  • Jalapeño протестировали в InferenceX на GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T.

  • Чип выполнял в 1,5–1,9 раза больше работы на ватт, а сквозная задержка была в 1,7–3,6 раза меньше.

  • На интерактивных нагрузках Jalapeño работал в 2,1–4,1 раза быстрее систем, с которыми его сравнивали.

  • При номинальной мощности 700 Вт энергопотребление во время тестов не превышало 550 Вт.

Вопросы и ответы

Для каких моделей и нагрузок предназначен Jalapeño?

Чип создавали для инференса больших языковых моделей и протестировали в InferenceX на GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T. Архитектура также рассчитана на агентные сценарии с последовательными обращениями к модели.

Что ускорение даст на практике в интерактивных и агентных сценариях?

На интерактивных нагрузках Jalapeño работал в 2,1–4,1 раза быстрее сравниваемых систем, а сквозная задержка была в 1,7–3,6 раза меньше. KV cache можно хранить локально, чтобы сократить накопление задержек при последовательных запросах.

Каковы фактические показатели энергоэффективности и потребления?

Jalapeño выполнял в 1,5–1,9 раза больше работы на ватт. При номинальной мощности 700 Вт потребление во время тестов не превышало 550 Вт.

Контекст по теме

Как процитировать

«OpenAI раскрыла результаты тестов чипа Jalapeño для инференса». hegai.media, 25 августа 2026 г.. https://hegai.media/novosti/openai-raskryla-rezultaty-testov-chipa-jalape-o-dlya-inferensa--74f98d75-bfa4-489a-9e87-1fd3c8079436

так материал выглядит в мессенджере