Cerebras предложила не очередной ускоритель, который нужно встроить в привычный кластер, а альтернативу самой логике GPU-стойки. CS-4 переносит память и обмен данными внутрь гигантского кристалла, а три таких процессора объединяет в готовый контур для декодирования LLM. Для инфраструктурной команды это уже кандидат в capacity-план, но еще не замена утвержденной закупке: цифры производительности есть, а цены, энергопотребления и результатов на сторонних нагрузках в опубликованных характеристиках нет.
Что именно собрала Cerebras
Как пишет Академия Selectel, в основе CS-4 лежит WSE-3 Turbo, процессор на цельной 300-миллиметровой кремниевой пластине. Он произведен по 5-нм техпроцессу TSMC, содержит 4 трлн транзисторов и 900 000 ядер, оптимизированных под тензорные операции и разреженные матрицы. Площадь кристалла составляет 46 225 мм².
Проблему производственного брака Cerebras решает резервированием: дефектные участки изолируются, а связи перенаправляются на запасные ядра. Это важная инженерная деталь. У wafer-scale архитектуры впечатляет не только размер, но и сам факт, что пластина после производства должна остаться рабочей системой, а не дорогим музейным экспонатом.
Главная ставка сделана на память. WSE-3 Turbo несет 44 ГБ SRAM непосредственно на пластине, а ее агрегированная пропускная способность достигает 43,2 ПБ/с. По объяснению Selectel, классические ускорители теряют время на переносе весов и промежуточных тензоров между HBM и вычислительными блоками через межчиповые соединения. Cerebras старается убрать этот налог на движение данных внутри процессора.
CS-4 выполнена в формате стойки на платформе Nexus и включает три WSE-3 Turbo. Между ними работает Direct Wafer Links с задержкой 2 мкс. Для объединения нескольких стоек предусмотрена сеть на 7,2 Тбит/с с Ethernet и RoCE v2, а управляет кластером фирменный стек Cerebras Software Platform.
То есть сравнивать CS-4 с одной GPU некорректно. Единица сравнения здесь другая: стойка, сеть, охлаждение, питание и программный слой для конкретной фазы инференса.
Где заканчивается архитектура и начинается маркетинг
CS-4 спроектирована прежде всего для декодирования, где модель последовательно генерирует токены и задержка быстро превращается в ограничение продукта. Cerebras заявляет скорость до 4400 токенов в секунду на пользователя на GPT-OSS-120B. Компания также утверждает, что под высокой нагрузкой система выполняет за секунду объем вычислений, на который эквивалентной GPU-стойке требуется около 30 секунд.
Это достаточно сильные показатели, чтобы не отмахиваться от CS-4 как от экзотики. Но недостаточно, чтобы подставить число 30 в финансовую модель. В материале Selectel не указаны конфигурация сравниваемой GPU-стойки, методика теста, цена CS-4, ее энергопотребление и условия доступности. Без этих параметров преимущество в токенах не превращается автоматически в преимущество по стоимости токена.
Именно здесь меняется задача инфраструктурной команды. Раньше Cerebras можно было держать в папке с необычными архитектурами. Теперь перед нами стойка с внутренним соединением трех процессоров, внешним масштабированием и собственным программным контуром. Ее уже стоит включать в запросы поставщикам и параллельные расчеты capacity.
Но считать нужно весь контур. Cerebras поставляет проприетарное решение от кремния до инженерной обвязки, включая кастомные системы жидкостного охлаждения и питания. Это может сократить расходы на сборку и настройку разрозненного кластера, а может перенести их в цену оборудования, интеграцию и зависимость от фирменного стека. Источник пока не дает данных, чтобы выбрать один из этих сценариев.
Что проверять до изменения закупочного плана
Практический следующий шаг не в том, чтобы заменить строку GPU на CS-4 в бюджете. Нужно прогнать через обе архитектуры один и тот же workload: ту же модель, длину контекста, профиль параллельных сессий и требования к задержке. Затем сравнить стоимость токена с учетом стойки, сети, питания, охлаждения и поддержки, а отдельно проверить, какие изменения потребует Cerebras Software Platform.
Главный маркер на ближайшее время конкретен: появятся ли независимые тесты CS-4 с раскрытой GPU-конфигурацией и данными по ваттам, цене и задержке под нагрузкой. Если заявленное преимущество сохранится после такого пересчета, CS-4 станет реальной альтернативой GPU-кластеру для массового декодирования. Пока это сильный кандидат на пилот, а не основание рвать действующий контракт на GPU.