OpenAI
ИИ-чатOpenAIJalapeñoNvidiaAI-чипыинференс

Jalapeño от OpenAI: первый чип побил Nvidia Blackwell и Rubin по эффективности

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения
Jalapeño от OpenAI: первый чип побил Nvidia Blackwell и Rubin по эффективности

Острее, чем ожидали все

Когда крупнейший потребитель Nvidia-железа вдруг выходит на сцену со своим чипом и заявляет, что он быстрее, эффективнее и дешевле в эксплуатации - это не просто новость. Это смена правил игры. Именно это произошло 25 августа 2026 года на конференции Hot Chips в Стэнфорде, где OpenAI показала первые реальные бенчмарки своего инференс-ускорителя Jalapeño.

ЦЕО аналитической компании SemiAnalysis Дилан Патель сформулировал лаконично: "Обычно первое поколение чипов неконкурентоспособно. OpenAI побила Nvidia Blackwell и даже Rubin". Для индустрии, привыкшей к тому, что кастомный кремний первой итерации едва догоняет топовые GPU, - это звучит как пощечина зеленому гиганту.

Что внутри и как тестировали

Jalapeño - это инференс-ASIC, разработанный совместно с Broadcom. Чип не занимается обучением моделей - только запуском готовых. Зато именно в этой нише он показывает цифры, от которых перехватывает дыхание.

Тестирование проводилось на публичном бенчмарке InferenceX от SemiAnalysis на трех моделях: GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T. SemiAnalysis верифицировал часть прогонов непосредственно в лаборатории OpenAI. Результаты:

- 1.5x - 1.9x больше работы на ватт при пиковой пропускной способности по сравнению с лучшими коммерческими системами - 1.7x - 3.6x ниже сквозная задержка (end-to-end latency) - 2.1x - 4.1x выше производительность для интерактивных нагрузок с минимальной задержкой - На GPT-OSS 120B - около 1 400 токенов в секунду на одного пользователя - На DeepSeek R1 - более 700 токенов в секунду при одном параллельном запросе

Система из 128 чипов Jalapeño обеспечивает 1.7 экзаФЛОПС 4-битных вычислений, 27.5 ТБ памяти HBM4 и почти 2 петабайта в секунду пропускной способности памяти. Сам чип потребляет 700 Вт по TDP, но в реальных тестах укладывался в 550 Вт. Для сравнения: GB300 от Nvidia имеет TDP 1 400 Вт. Разница в энергопотреблении - вдвое.

Честный контекст: где подводные камни

Я бы покривил душой, если бы не обозначил оговорки - они существенные.

Во-первых, Jalapeño тестировался без спекулятивного декодирования и мульти-токенного предсказания - оптимизаций, которые Nvidia использует в продакшне и которые заметно улучшают ее показатели. С учетом MTP преимущество Jalapeño по пиковой эффективности сжимается примерно до 1.5x.

Во-вторых, Nvidia и AMD уже опубликовали результаты на более крупных моделях - DeepSeek V4 Pro и Kimi K3 - которые на Jalapeño еще не тестировались.

В-третьих, и это самое важное: пока Jalapeño находится на стадии инженерных образцов. Глава аппаратного направления OpenAI Ричард Хо оценил начало развертывания в конце 2026 года в очень малых объемах, а полноценный выход на рынок - в 2027 году. Vera Rubin от Nvidia уже поставляется заказчикам. Временной разрыв реален.

Девять месяцев от идеи до кремния

Одна из самых поразительных деталей - скорость разработки. Полный цикл от старта проектирования (середина 2024 года) до отправки в производство (ноябрь 2025 года) занял 16 месяцев. Но от первого RTL-дизайна до готового чертежа на завод прошло всего 9 месяцев. Это феноменально быстро для кастомного кремния.

OpenAI не скрывает: в разработке активно использовались собственные языковые модели. Более ранние поколения помогали с дизайном чипа, новейшие - ускоряли программирование и оптимизацию. SemiAnalysis прямо заявляет: это потенциальный конец знаменитого "рва CUDA" - преимущества Nvidia в программном стеке. Если OpenAI может так быстро разворачивать новые модели на собственном кремнии, привязка к CUDA перестает быть непреодолимой.

Архитектурный выбор: ставка на память

Jalapeño спроектирован с упором на пропускную способность памяти, а не просто на вычислительную мощность. Каждый пакет чипа несет 6 стеков HBM4 - итого 216 ГБ при скорости 15.4 ТБ/с. Архитектура специально минимизирует перемещение данных и коммуникационные задержки между фазами инференса - в частности, KV-кэш остается локальным, что убирает один из главных узких мест при обслуживании запросов.

Системный уровень тоже впечатляет: 128 ускорителей в стойке, почти 2 ПБ/с суммарной пропускной способности памяти - против 85% этого показателя у конкурирующих GPU-стоек Nvidia и AMD, которые при этом превосходят Jalapeño по вычислительной мощности на 1.46x - 2x.

Что это означает для рынка

OpenAI CFO Сара Фрайер обозначила стратегию предельно четко: Jalapeño - не замена партнерам (Nvidia, AMD, AWS, Cerebras, CoreWeave и другим), а рычаг влияния. Компания хочет иметь первичный кремний, чтобы управлять экономикой инференса и не зависеть целиком от одного поставщика.

Для российских разработчиков и бизнеса ситуация пока гипотетическая: Jalapeño развертывается исключительно во внутренней инфраструктуре OpenAI, доступ к нему идет через API ChatGPT и OpenAI Platform - те же инструменты, что и прежде. Прямого доступа к чипу нет и не предвидится. Сервисы OpenAI в России по-прежнему требуют VPN и зарубежной карты для оплаты.

Но косвенный эффект будет: если Jalapeño снижает стоимость инференса для OpenAI, это потенциально означает более дешевые токены для всех пользователей API - и это уже очень конкретная выгода.

Второе поколение чипа, по данным Bloomberg, приближается к стадии тейпаута. Концептуальная работа над третьим поколением уже ведется. OpenAI явно настроена серьезно - и Nvidia это, судя по всему, прекрасно понимает.

*Информация подтверждена несколькими независимыми публикациями, включая официальный блог OpenAI и верификацию бенчмарков аналитиками SemiAnalysis.*

Все эти инструменты - уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости