Nvidia объявила о серийном производстве стоек Groq 3 LPX после декабрьской сделки с Groq на $20 млрд. На бумаге это уже не экспериментальный ускоритель, а кандидат в промышленную инфраструктуру инференса. Но главный вопрос для бизнеса, сколько будет стоить обслуженный токен с нужной моделью и гарантированной задержкой.
Что вышло в серию
Как пишет IT Home, в одной стойке LPX установлены 256 чипов Groq 3. Nvidia утверждает, что система показывает до 3400 токенов в секунду в тесте Artificial Analysis. Стойки планируют развернуть на платформе Nebius вместе с CPU Vera и GPU Rubin, запуск мощностей заявлен позднее в этом году.
Архитектура Groq устроена вокруг низкой задержки. В кристалл встроено 500 МБ быстрой SRAM, чтобы уменьшить узкие места при обращении к памяти. Сами чипы производит Samsung, тогда как GPU Nvidia выпускает TSMC.
Это не замена GPU целиком. Groq предназначен прежде всего для decode, отдельного этапа обслуживания модели. GPU остаются более универсальными: они подходят и для обучения, и для инференса, а также легче адаптируются к новым моделям и технологиям. Старший директор Nvidia Дион Харрис прямо описывает подход как подбор процессора с подходящей ценой и производительностью для каждой части нагрузки.
Именно поэтому цифру 3400 токенов в секунду нельзя автоматически превращать в вывод «в 4,5 раза выгоднее». Для сравнения, режим OpenAI Ultrafast на инфраструктуре Cerebras обещает до 750 токенов в секунду. Но скорость одного теста ничего не говорит о стоимости стойки, потреблении энергии, загрузке при реальном трафике, доступных моделях и цене эксплуатации. Быстрый токен легко оказывается дорогим токеном, особенно если половину времени оборудование ждёт запросов.
Nvidia продаёт не чип, а новый тариф инференса
Компания не скрывает коммерческую логику. По словам Харриса, облачные провайдеры смогут брать больше за токены в сервисах с жёсткими требованиями к задержке. Это хорошо объясняет, почему Groq понадобился Nvidia именно сейчас: агентные и особенно программистские сценарии плохо переносят паузы, а премиальный SLA можно превратить в отдельный тариф.
Получается двухуровневый рынок. Обычный инференс остаётся на универсальных GPU, а чувствительные к задержке запросы уходят на специализированные стойки. Для облака это возможность продавать скорость как услугу. Для клиента это риск платить премию за красивый показатель, который не влияет на его собственную экономику продукта.
Конкуренты движутся в ту же сторону. IT Home ранее сообщал, что AMD собирается объединить стоечные системы с чипами Cerebras. Значит, спор идёт уже не о том, нужен ли отдельный слой низколатентного инференса, а о том, кто упакует его в стойку, облачный контракт и понятный SLA.
У Nvidia здесь есть дополнительное преимущество: она одновременно собирает аппаратную платформу и помогает создавать спрос на неё. Компания запустила для AI-облаков схему с разделением выручки и кредитной поддержкой, а также участвует в формировании инфраструктурных финансовых платформ. Groq 3 LPX вписывается в эту конструкцию лучше, чем отдельный ускоритель: финансировать, размещать и тарифицировать проще стандартизированную стойку.
Но покупателю не стоит принимать интерес Nvidia за доказательство собственной выгоды. В марте Дженсен Хуанг говорил, что отвёл бы Groq четверть пространства дата-центра для программистских приложений, оставив остальное Vera Rubin. Это ориентир архитектуры самой Nvidia, а не готовая пропорция для чужого бизнеса.
Что делать покупателю инференса
Командам с высокой и предсказуемой нагрузкой стоит уже сейчас добавить Groq 3 LPX в план тестирования. Сравнивать нужно не пиковые токены в секунду, а полную стоимость обслуженного запроса: оборудование или облачный тариф, энергия, загрузка, поддерживаемые модели, качество ответов, время до первого токена, скорость decode и штрафы за нарушение SLA.
До появления этих данных фиксировать архитектуру на несколько лет или брать жёсткие облачные обязательства неразумно. Серийное производство делает Groq реальным вариантом, но ещё не доказывает его экономику.
Маркер на ближайшие месяцы конкретный: Nebius должен открыть доступ к Groq 3 LPX и опубликовать цену, перечень моделей и условия SLA. Если при сопоставимом качестве стоимость запроса с гарантированной низкой задержкой окажется ниже GPU-варианта на реальной загрузке, рынок инференса действительно придётся пересчитать. Если появится только впечатляющая скорость без прозрачного тарифа, Groq останется премиальной полосой для тех, кому важнее задержка, чем счёт.