C
ИИ-чатCerebrasCS-4WSE-3TИИ-акселераторOpenAI

Cerebras CS-4: в два раза быстрее и в 30 раз мощнее GPU от Nvidia

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения

Когда чип не меняется, но всё равно удваивается

Есть особое удовольствие наблюдать, как компания выжимает вдвое больше производительности из того же куска кремния — без смены техпроцесса, без увеличения площади кристалла, без революции в архитектуре. Именно это Cerebras Systems проделала со своим новым CS-4, представленным на мероприятии Supernova в Сан-Франциско. Генеральный директор Эндрю Фелдман назвал его «самым быстрым ИИ-акселератором в индустрии» — и, что примечательно, у него есть чем это подкрепить.

WSE-3T: тот же чип, но на турбо

В основе CS-4 лежит обновлённый чип WSE-3T — буква «T» означает «Turbo». По своей физической сути это всё тот же WSE-3: 46 225 мм² кремния на 5-нанометровом техпроцессе TSMC, около 4 триллионов транзисторов, 900 000 вычислительных ядер и 44 ГБ SRAM. Ни площадь, ни объём памяти не изменились.

Фокус — в питании и частоте. Cerebras удвоила мощность, подаваемую на чип: с 15 кВт до 33 кВт на вафлю, а системная мощность выросла с 23 до 46 кВт. Это позволило поднять тактовую частоту приблизительно до 2,8 ГГц против ~1,4 ГГц у предшественника. Результат: 250 петафлопс в режиме sparse FP16 против 125 у WSE-3, пропускная способность памяти удвоилась до 43,2 петабайт/с, I/O-полоса выросла до 2,4 Тбит/с.

Для сравнения: новейшие GPU от Nvidia и AMD показывают 4–5 петафлопс в dense FP16. Cerebras оперирует sparse-цифрами, что требует оговорки: реальный прирост в LLM-инференсе зависит от конкретной модели, точности вычислений и размера батча. Но даже при этой оговорке масштаб впечатляет.

Три вафли в одной стойке — и 4400 токенов в секунду

CS-4 — это rack-scale продукт: полный серверный шкаф, который заезжает в дата-центр как единица. Ключевое изменение по сравнению с CS-3 — количество вафель в стойке выросло с двух до трёх. Плюс новый модульный дизайн «Backpack» ускоряет сборку и обслуживание.

Итоговая производительность системы: до 4 400 токенов в секунду на пользователя — по заявлению Cerebras, это в 30 раз быстрее типичных GPU-конфигураций. Throughput на уровне системы вырос в шесть раз по сравнению с CS-3, а энергоэффективность — в десять раз больше токенов на ватт в ряде приложений.

Первые CS-4 должны появиться у заказчиков в третьем квартале 2026 года.

OpenAI и GPT-5.6 Sol Ultrafast: реальный боевой кейс

Самое интересное — не технические характеристики, а то, кто уже использует эти машины. OpenAI задействует инфраструктуру Cerebras для режима GPT-5.6 Sol Ultrafast, который, по словам Фелдмана, работает в 14 раз быстрее стандартного предложения компании.

Практическая иллюстрация: полный тест Humanity's Last Exam из 2500 вопросов система на базе Cerebras прошла за 11 часов 11 минут, тогда как сопоставимая GPU-конфигурация потратила более трёх суток. Сотрудник технического персонала OpenAI Тибо Соттьо подтвердил, что компания рассматривает Ultrafast как потенциальный дефолтный режим в будущем — хотя пока деплой находится на ранней стадии.

Cerebras также называет 15 миллионов еженедельных пользователей Codex и агентов ChatGPT как аргумент в пользу востребованности низколатентного инференса. Общая аудитория ChatGPT, по словам Соттьо, перевалила за миллиард.

Гибридная архитектура: AMD и AWS берут на себя prefill

Cerebras умно решила главное узкое место своей архитектуры. Большой SRAM — колоссальное преимущество на стадии декодирования (генерация токенов), но prefill-фаза (обработка промпта) требует иного: она вычислительно-интенсивна и не так чувствительна к латентности памяти.

Решение — disaggregated inference: GPU от AMD (Instinct) и чипы AWS Trainium берут на себя prefill, а Cerebras обрабатывает decode. Каждый процессор делает то, в чём реально силён. Аналитики SemiAnalysis отметили, что сетевые улучшения в этой связке пока довольно скромные, — это честная оговорка, и детали ожидаются на конференции Hot Chips.

Инфраструктурная экспансия

Cerebras строит собственную сеть дата-центров: 600 МВт мощностей в работе или контракте к концу следующего года. Площадки расположены в Санта-Кларе, Торонто, Далласе, Миннеаполисе, Монреале, Оклахома-Сити, Алабаме, Лионе, Норвегии и Миккели (Финляндия). Это уже не просто производитель чипов — это провайдер инфраструктуры.

Среди партнёров — OpenAI, AMD и Arista Networks. Компания торгуется на NASDAQ под тикером CBRS (хотя после последнего отчёта акции скорректировались на 6,5%).

Что это означает для рынка

Cerebras последовательно делает ставку на скорость инференса как на продуктовую характеристику, а не просто технический бенчмарк. Фелдман сформулировал это так: «В ИИ скорость — это производительность». Звучит как маркетинг, но за этим стоит реальная логика: агентные рабочие процессы, где модель вызывает другие инструменты в цикле, радикально выигрывают от низкой латентности.

Для российских разработчиков и бизнеса прямой доступ к CS-4 пока ограничен — Cerebras работает через собственные дата-центры и партнёров преимущественно в Северной Америке и Европе. API-доступ к сервисам на базе Cerebras (например, через OpenAI) технически доступен с VPN, хотя платёжные ограничения стандартные для американских сервисов.

CS-4 — это не революция архитектуры, но блестящая инженерная работа по извлечению максимума из уже существующего кремния. Cerebras доказывает, что в гонке ИИ-ускорителей выигрывает не только тот, кто первым меняет техпроцесс.

*Информация подтверждена несколькими независимыми публикациями.*

Все эти инструменты — уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости