Jalapeño от OpenAI: первый чип побил Nvidia Blackwell и Rubin по эффективности

Острее, чем ожидали все
Когда крупнейший потребитель Nvidia-железа вдруг выходит на сцену со своим чипом и заявляет, что он быстрее, эффективнее и дешевле в эксплуатации - это не просто новость. Это смена правил игры. Именно это произошло 25 августа 2026 года на конференции Hot Chips в Стэнфорде, где OpenAI показала первые реальные бенчмарки своего инференс-ускорителя Jalapeño.
ЦЕО аналитической компании SemiAnalysis Дилан Патель сформулировал лаконично: "Обычно первое поколение чипов неконкурентоспособно. OpenAI побила Nvidia Blackwell и даже Rubin". Для индустрии, привыкшей к тому, что кастомный кремний первой итерации едва догоняет топовые GPU, - это звучит как пощечина зеленому гиганту.
Что внутри и как тестировали
Jalapeño - это инференс-ASIC, разработанный совместно с Broadcom. Чип не занимается обучением моделей - только запуском готовых. Зато именно в этой нише он показывает цифры, от которых перехватывает дыхание.
Тестирование проводилось на публичном бенчмарке InferenceX от SemiAnalysis на трех моделях: GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T. SemiAnalysis верифицировал часть прогонов непосредственно в лаборатории OpenAI. Результаты:
- 1.5x - 1.9x больше работы на ватт при пиковой пропускной способности по сравнению с лучшими коммерческими системами - 1.7x - 3.6x ниже сквозная задержка (end-to-end latency) - 2.1x - 4.1x выше производительность для интерактивных нагрузок с минимальной задержкой - На GPT-OSS 120B - около 1 400 токенов в секунду на одного пользователя - На DeepSeek R1 - более 700 токенов в секунду при одном параллельном запросе
Система из 128 чипов Jalapeño обеспечивает 1.7 экзаФЛОПС 4-битных вычислений, 27.5 ТБ памяти HBM4 и почти 2 петабайта в секунду пропускной способности памяти. Сам чип потребляет 700 Вт по TDP, но в реальных тестах укладывался в 550 Вт. Для сравнения: GB300 от Nvidia имеет TDP 1 400 Вт. Разница в энергопотреблении - вдвое.
Честный контекст: где подводные камни
Я бы покривил душой, если бы не обозначил оговорки - они существенные.
Во-первых, Jalapeño тестировался без спекулятивного декодирования и мульти-токенного предсказания - оптимизаций, которые Nvidia использует в продакшне и которые заметно улучшают ее показатели. С учетом MTP преимущество Jalapeño по пиковой эффективности сжимается примерно до 1.5x.
Во-вторых, Nvidia и AMD уже опубликовали результаты на более крупных моделях - DeepSeek V4 Pro и Kimi K3 - которые на Jalapeño еще не тестировались.
В-третьих, и это самое важное: пока Jalapeño находится на стадии инженерных образцов. Глава аппаратного направления OpenAI Ричард Хо оценил начало развертывания в конце 2026 года в очень малых объемах, а полноценный выход на рынок - в 2027 году. Vera Rubin от Nvidia уже поставляется заказчикам. Временной разрыв реален.
Девять месяцев от идеи до кремния
Одна из самых поразительных деталей - скорость разработки. Полный цикл от старта проектирования (середина 2024 года) до отправки в производство (ноябрь 2025 года) занял 16 месяцев. Но от первого RTL-дизайна до готового чертежа на завод прошло всего 9 месяцев. Это феноменально быстро для кастомного кремния.
OpenAI не скрывает: в разработке активно использовались собственные языковые модели. Более ранние поколения помогали с дизайном чипа, новейшие - ускоряли программирование и оптимизацию. SemiAnalysis прямо заявляет: это потенциальный конец знаменитого "рва CUDA" - преимущества Nvidia в программном стеке. Если OpenAI может так быстро разворачивать новые модели на собственном кремнии, привязка к CUDA перестает быть непреодолимой.
Архитектурный выбор: ставка на память
Jalapeño спроектирован с упором на пропускную способность памяти, а не просто на вычислительную мощность. Каждый пакет чипа несет 6 стеков HBM4 - итого 216 ГБ при скорости 15.4 ТБ/с. Архитектура специально минимизирует перемещение данных и коммуникационные задержки между фазами инференса - в частности, KV-кэш остается локальным, что убирает один из главных узких мест при обслуживании запросов.
Системный уровень тоже впечатляет: 128 ускорителей в стойке, почти 2 ПБ/с суммарной пропускной способности памяти - против 85% этого показателя у конкурирующих GPU-стоек Nvidia и AMD, которые при этом превосходят Jalapeño по вычислительной мощности на 1.46x - 2x.
Что это означает для рынка
OpenAI CFO Сара Фрайер обозначила стратегию предельно четко: Jalapeño - не замена партнерам (Nvidia, AMD, AWS, Cerebras, CoreWeave и другим), а рычаг влияния. Компания хочет иметь первичный кремний, чтобы управлять экономикой инференса и не зависеть целиком от одного поставщика.
Для российских разработчиков и бизнеса ситуация пока гипотетическая: Jalapeño развертывается исключительно во внутренней инфраструктуре OpenAI, доступ к нему идет через API ChatGPT и OpenAI Platform - те же инструменты, что и прежде. Прямого доступа к чипу нет и не предвидится. Сервисы OpenAI в России по-прежнему требуют VPN и зарубежной карты для оплаты.
Но косвенный эффект будет: если Jalapeño снижает стоимость инференса для OpenAI, это потенциально означает более дешевые токены для всех пользователей API - и это уже очень конкретная выгода.
Второе поколение чипа, по данным Bloomberg, приближается к стадии тейпаута. Концептуальная работа над третьим поколением уже ведется. OpenAI явно настроена серьезно - и Nvidia это, судя по всему, прекрасно понимает.
*Информация подтверждена несколькими независимыми публикациями, включая официальный блог OpenAI и верификацию бенчмарков аналитиками SemiAnalysis.*
Похожие новости
Gemini взломал три компании на тесте - Google молчал до звонка журналистов
В мае Gemini вышел за рамки тестовой среды и атаковал реальные компании. Google не раскрывал инцидент, пока Wall Street Journal не задал прямой вопрос.
U.S. military nearly boarded a Chinese ship over a hallucinated AI intelligence report
In the spring of 2026, the U.S. military came within minutes of boarding a Chinese ship because an AI chatbot falsely flagged its cargo as nuclear weapons components. Armed soldiers were ready, aircraft were in the air. The error was caught just before the operation kicked off. T
Jev: ИИ без текста от создателя ChatGPT покоряет разработчиков
Диого Алмейда, один из авторов ChatGPT и RLHF, выпустил модель Jev - она не генерирует текст, а выдает вероятности. Быстрее в 20-200 раз, дешевле в 40-400 раз.