Cerebras CS-4: в два раза быстрее и в 30 раз мощнее GPU от Nvidia
Когда чип не меняется, но все равно удваивается
Есть особое удовольствие наблюдать, как компания выжимает вдвое больше производительности из того же куска кремния - без смены техпроцесса, без увеличения площади кристалла, без революции в архитектуре. Именно это Cerebras Systems проделала со своим новым CS-4, представленным на мероприятии Supernova в Сан-Франциско. Генеральный директор Эндрю Фелдман назвал его "самым быстрым ИИ-акселератором в индустрии" - и, что примечательно, у него есть чем это подкрепить.
WSE-3T: тот же чип, но на турбо
В основе CS-4 лежит обновленный чип WSE-3T - буква "T" означает "Turbo". По своей физической сути это все тот же WSE-3: 46 225 мм² кремния на 5-нанометровом техпроцессе TSMC, около 4 триллионов транзисторов, 900 000 вычислительных ядер и 44 ГБ SRAM. Ни площадь, ни объем памяти не изменились.
Фокус - в питании и частоте. Cerebras удвоила мощность, подаваемую на чип: с 15 кВт до 33 кВт на вафлю, а системная мощность выросла с 23 до 46 кВт. Это позволило поднять тактовую частоту приблизительно до 2,8 ГГц против ~1,4 ГГц у предшественника. Результат: 250 петафлопс в режиме sparse FP16 против 125 у WSE-3, пропускная способность памяти удвоилась до 43,2 петабайт/с, I/O-полоса выросла до 2,4 Тбит/с.
Для сравнения: новейшие GPU от Nvidia и AMD показывают 4-5 петафлопс в dense FP16. Cerebras оперирует sparse-цифрами, что требует оговорки: реальный прирост в LLM-инференсе зависит от конкретной модели, точности вычислений и размера батча. Но даже при этой оговорке масштаб впечатляет.
Три вафли в одной стойке - и 4400 токенов в секунду
CS-4 - это rack-scale продукт: полный серверный шкаф, который заезжает в дата-центр как единица. Ключевое изменение по сравнению с CS-3 - количество вафель в стойке выросло с двух до трех. Плюс новый модульный дизайн "Backpack" ускоряет сборку и обслуживание.
Итоговая производительность системы: до 4 400 токенов в секунду на пользователя - по заявлению Cerebras, это в 30 раз быстрее типичных GPU-конфигураций. Throughput на уровне системы вырос в шесть раз по сравнению с CS-3, а энергоэффективность - в десять раз больше токенов на ватт в ряде приложений.
Первые CS-4 должны появиться у заказчиков в третьем квартале 2026 года.
OpenAI и GPT-5.6 Sol Ultrafast: реальный боевой кейс
Самое интересное - не технические характеристики, а то, кто уже использует эти машины. OpenAI задействует инфраструктуру Cerebras для режима GPT-5.6 Sol Ultrafast, который, по словам Фелдмана, работает в 14 раз быстрее стандартного предложения компании.
Практическая иллюстрация: полный тест Humanity's Last Exam из 2500 вопросов система на базе Cerebras прошла за 11 часов 11 минут, тогда как сопоставимая GPU-конфигурация потратила более трех суток. Сотрудник технического персонала OpenAI Тибо Соттьо подтвердил, что компания рассматривает Ultrafast как потенциальный дефолтный режим в будущем - хотя пока деплой находится на ранней стадии.
Cerebras также называет 15 миллионов еженедельных пользователей Codex и агентов ChatGPT как аргумент в пользу востребованности низколатентного инференса. Общая аудитория ChatGPT, по словам Соттьо, перевалила за миллиард.
Гибридная архитектура: AMD и AWS берут на себя prefill
Cerebras умно решила главное узкое место своей архитектуры. Большой SRAM - колоссальное преимущество на стадии декодирования (генерация токенов), но prefill-фаза (обработка промпта) требует иного: она вычислительно-интенсивна и не так чувствительна к латентности памяти.
Решение - disaggregated inference: GPU от AMD (Instinct) и чипы AWS Trainium берут на себя prefill, а Cerebras обрабатывает decode. Каждый процессор делает то, в чем реально силен. Аналитики SemiAnalysis отметили, что сетевые улучшения в этой связке пока довольно скромные, - это честная оговорка, и детали ожидаются на конференции Hot Chips.
Инфраструктурная экспансия
Cerebras строит собственную сеть дата-центров: 600 МВт мощностей в работе или контракте к концу следующего года. Площадки расположены в Санта-Кларе, Торонто, Далласе, Миннеаполисе, Монреале, Оклахома-Сити, Алабаме, Лионе, Норвегии и Миккели (Финляндия). Это уже не просто производитель чипов - это провайдер инфраструктуры.
Среди партнеров - OpenAI, AMD и Arista Networks. Компания торгуется на NASDAQ под тикером CBRS (хотя после последнего отчета акции скорректировались на 6,5%).
Что это означает для рынка
Cerebras последовательно делает ставку на скорость инференса как на продуктовую характеристику, а не просто технический бенчмарк. Фелдман сформулировал это так: "В ИИ скорость - это производительность". Звучит как маркетинг, но за этим стоит реальная логика: агентные рабочие процессы, где модель вызывает другие инструменты в цикле, радикально выигрывают от низкой латентности.
Для российских разработчиков и бизнеса прямой доступ к CS-4 пока ограничен - Cerebras работает через собственные дата-центры и партнеров преимущественно в Северной Америке и Европе. API-доступ к сервисам на базе Cerebras (например, через OpenAI) технически доступен с VPN, хотя платежные ограничения стандартные для американских сервисов.
CS-4 - это не революция архитектуры, но блестящая инженерная работа по извлечению максимума из уже существующего кремния. Cerebras доказывает, что в гонке ИИ-ускорителей выигрывает не только тот, кто первым меняет техпроцесс.
*Информация подтверждена несколькими независимыми публикациями.*
Похожие новости
Nous Research подтвердила оценку $1,5 млрд и запустила агентов для бизнеса
Разработчик открытого Hermes Agent поднял $90 млн в раунде Series B - Hermes клонировали 24 млн раз и он генерирует 2,5% мирового трафика токенов.
Google выпустила EmbeddingGemma 2: мультимодальный поиск прямо на телефоне
Google DeepMind открыла EmbeddingGemma 2 - 740-миллионную модель, которая объединяет текст, код, изображения, видео и аудио в одном векторном пространстве и работает полностью на устройстве.
Google урезает бесплатный Gemini: с 9 октября только Flash Lite
С 9 октября бесплатные пользователи Gemini получат доступ только к Flash Lite. Платный AI Plus тоже теряет Pro - теперь он только в подписках за $20 и $100 в месяц.