Cerebras CS-4: в два раза быстрее и в 30 раз мощнее GPU от Nvidia
Когда чип не меняется, но всё равно удваивается
Есть особое удовольствие наблюдать, как компания выжимает вдвое больше производительности из того же куска кремния — без смены техпроцесса, без увеличения площади кристалла, без революции в архитектуре. Именно это Cerebras Systems проделала со своим новым CS-4, представленным на мероприятии Supernova в Сан-Франциско. Генеральный директор Эндрю Фелдман назвал его «самым быстрым ИИ-акселератором в индустрии» — и, что примечательно, у него есть чем это подкрепить.
WSE-3T: тот же чип, но на турбо
В основе CS-4 лежит обновлённый чип WSE-3T — буква «T» означает «Turbo». По своей физической сути это всё тот же WSE-3: 46 225 мм² кремния на 5-нанометровом техпроцессе TSMC, около 4 триллионов транзисторов, 900 000 вычислительных ядер и 44 ГБ SRAM. Ни площадь, ни объём памяти не изменились.
Фокус — в питании и частоте. Cerebras удвоила мощность, подаваемую на чип: с 15 кВт до 33 кВт на вафлю, а системная мощность выросла с 23 до 46 кВт. Это позволило поднять тактовую частоту приблизительно до 2,8 ГГц против ~1,4 ГГц у предшественника. Результат: 250 петафлопс в режиме sparse FP16 против 125 у WSE-3, пропускная способность памяти удвоилась до 43,2 петабайт/с, I/O-полоса выросла до 2,4 Тбит/с.
Для сравнения: новейшие GPU от Nvidia и AMD показывают 4–5 петафлопс в dense FP16. Cerebras оперирует sparse-цифрами, что требует оговорки: реальный прирост в LLM-инференсе зависит от конкретной модели, точности вычислений и размера батча. Но даже при этой оговорке масштаб впечатляет.
Три вафли в одной стойке — и 4400 токенов в секунду
CS-4 — это rack-scale продукт: полный серверный шкаф, который заезжает в дата-центр как единица. Ключевое изменение по сравнению с CS-3 — количество вафель в стойке выросло с двух до трёх. Плюс новый модульный дизайн «Backpack» ускоряет сборку и обслуживание.
Итоговая производительность системы: до 4 400 токенов в секунду на пользователя — по заявлению Cerebras, это в 30 раз быстрее типичных GPU-конфигураций. Throughput на уровне системы вырос в шесть раз по сравнению с CS-3, а энергоэффективность — в десять раз больше токенов на ватт в ряде приложений.
Первые CS-4 должны появиться у заказчиков в третьем квартале 2026 года.
OpenAI и GPT-5.6 Sol Ultrafast: реальный боевой кейс
Самое интересное — не технические характеристики, а то, кто уже использует эти машины. OpenAI задействует инфраструктуру Cerebras для режима GPT-5.6 Sol Ultrafast, который, по словам Фелдмана, работает в 14 раз быстрее стандартного предложения компании.
Практическая иллюстрация: полный тест Humanity's Last Exam из 2500 вопросов система на базе Cerebras прошла за 11 часов 11 минут, тогда как сопоставимая GPU-конфигурация потратила более трёх суток. Сотрудник технического персонала OpenAI Тибо Соттьо подтвердил, что компания рассматривает Ultrafast как потенциальный дефолтный режим в будущем — хотя пока деплой находится на ранней стадии.
Cerebras также называет 15 миллионов еженедельных пользователей Codex и агентов ChatGPT как аргумент в пользу востребованности низколатентного инференса. Общая аудитория ChatGPT, по словам Соттьо, перевалила за миллиард.
Гибридная архитектура: AMD и AWS берут на себя prefill
Cerebras умно решила главное узкое место своей архитектуры. Большой SRAM — колоссальное преимущество на стадии декодирования (генерация токенов), но prefill-фаза (обработка промпта) требует иного: она вычислительно-интенсивна и не так чувствительна к латентности памяти.
Решение — disaggregated inference: GPU от AMD (Instinct) и чипы AWS Trainium берут на себя prefill, а Cerebras обрабатывает decode. Каждый процессор делает то, в чём реально силён. Аналитики SemiAnalysis отметили, что сетевые улучшения в этой связке пока довольно скромные, — это честная оговорка, и детали ожидаются на конференции Hot Chips.
Инфраструктурная экспансия
Cerebras строит собственную сеть дата-центров: 600 МВт мощностей в работе или контракте к концу следующего года. Площадки расположены в Санта-Кларе, Торонто, Далласе, Миннеаполисе, Монреале, Оклахома-Сити, Алабаме, Лионе, Норвегии и Миккели (Финляндия). Это уже не просто производитель чипов — это провайдер инфраструктуры.
Среди партнёров — OpenAI, AMD и Arista Networks. Компания торгуется на NASDAQ под тикером CBRS (хотя после последнего отчёта акции скорректировались на 6,5%).
Что это означает для рынка
Cerebras последовательно делает ставку на скорость инференса как на продуктовую характеристику, а не просто технический бенчмарк. Фелдман сформулировал это так: «В ИИ скорость — это производительность». Звучит как маркетинг, но за этим стоит реальная логика: агентные рабочие процессы, где модель вызывает другие инструменты в цикле, радикально выигрывают от низкой латентности.
Для российских разработчиков и бизнеса прямой доступ к CS-4 пока ограничен — Cerebras работает через собственные дата-центры и партнёров преимущественно в Северной Америке и Европе. API-доступ к сервисам на базе Cerebras (например, через OpenAI) технически доступен с VPN, хотя платёжные ограничения стандартные для американских сервисов.
CS-4 — это не революция архитектуры, но блестящая инженерная работа по извлечению максимума из уже существующего кремния. Cerebras доказывает, что в гонке ИИ-ускорителей выигрывает не только тот, кто первым меняет техпроцесс.
*Информация подтверждена несколькими независимыми публикациями.*
Похожие новости
Серый рынок Китая: токены Claude по цене 10% от официальной
Китайские разработчики массово обходят блокировки Anthropic через сеть API-прокси, покупая токены Claude за десятую часть официальной цены — и это лишь верхушка айсберга.
RAMageddon: серверы Nvidia подорожают на 15% из-за дефицита памяти
Дефицит DRAM от Samsung, SK Hynix и Micron вынуждает Nvidia поднять цены на серверы с чипами Vera Rubin и Grace Blackwell более чем на 15% — удар придётся по Microsoft, Google и Meta.
ИИ стал главным потребителем ИИ: агенты обогнали людей в 5 раз
С февраля 2026 года агентные системы потребляют в 5 раз больше токенов, чем люди. Рост — 14x за полгода. Эра чат-ботов заканчивается.