Google «замораживает» Gemini в кремнии: чип Frozen v2 в 10 раз эффективнее TPU

Когда инженеры Google говорят «заморозить» модель, они обычно имеют в виду остановку обучения. Но в проекте Frozen v2 смысл этого слова приобрёл буквальное, почти философское измерение: часть архитектуры Gemini будет физически вытравлена в кремний. Навсегда. Это один из самых радикальных экспериментов в истории прикладного ИИ-железа.
Что такое Frozen v2 и почему это не просто очередной чип
Google годами выпускает TPU — тензорные процессоры, которые умеют работать с любой моделью. Это их главное достоинство и одновременно ахиллесова пята: универсальность требует постоянных вычислений логических условий в реальном времени, что съедает энергию и время. Frozen v2 выбирает другой путь — он жертвует гибкостью ради скорости.
Вместо того чтобы каждый раз «спрашивать» чип, как обрабатывать запрос, часть вычислительной логики Gemini будет зашита прямо в аппаратную схему. По данным источников, знакомых с проектом, это позволит сократить количество вычислительных шагов и минимизировать движение данных между памятью и логическими блоками — два главных узких места современного AI-инференса.
Ожидаемый результат: от 6 до 10 токенов на ватт мощности против нынешних показателей TPU. Это не эволюция — это смена парадигмы.
История идеи: от весов к архитектуре
Оригинальная концепция принадлежит Джеффу Дину, главному учёному Google DeepMind. Его первоначальная версия Frozen была ещё радикальнее: вшить прямо в кремний не архитектуру, а веса модели — конкретные числовые параметры, определяющие поведение Gemini. Технически это дало бы максимальную эффективность.
Однако команда быстро осознала фундаментальный изъян: такой чип работал бы только с одной конкретной версией Gemini и устаревал бы вместе с каждым обновлением модели. В условиях, когда Gemini обновляется несколько раз в год, это коммерческое самоубийство.
Frozen v2 нашёл компромисс: в кремний вшивается архитектурный чертёж — структура трансформера, схема слоёв, паттерны вычислений — но не конкретные веса. Новые веса можно загружать на чип по мере обновления модели. Насколько глубоко архитектура будет захардкожена — инженеры ещё окончательно не решили.
Технические детали: три источника эффективности
По имеющимся данным, прирост производительности достигается сразу тремя путями.
Первый — сокращение числа вычислений. Когда логика модели встроена в железо, чип не тратит циклы на интерпретацию инструкций — он просто выполняет их напрямую.
Второй — минимизация движения данных. Это хроническая болезнь современных GPU и TPU: когда модель не помещается во внутреннюю память чипа, данные постоянно гоняются между чипом и внешней DRAM. Каждая такая пересылка — это потерянное время и энергия. Frozen v2, судя по всему, будет оснащён достаточным объёмом памяти, чтобы держать Gemini целиком на кристалле.
Третий — operator fusion, слияние операций. Несколько последовательных вычислений объединяются в одно, которое выполняется быстрее. Для Gemini, чья архитектура известна инженерам досконально, такую оптимизацию можно реализовать на уровне схемотехники.
Стратегический контекст: дефицит вычислений и гонка маржинальности
Frozen v2 — это не академический эксперимент. Google прямо сейчас испытывает острую нехватку AI-вычислений. По имеющимся данным, дефицит настолько серьёзен, что Google Cloud вынужден отказывать внешним клиентам в заказах. Это удар по репутации и прямые потери выручки.
При этом Frozen v2 не станет продуктом для внешних клиентов — в отличие от TPU, которые Google сдаёт в аренду через облако, предлагает Meta и продвигает по программе TPU@Premises как альтернативу Nvidia. Frozen v2 — исключительно для внутреннего потребления.
Но именно это делает его стратегически важным. В AI-бизнесе 2026 года маржа определяется стоимостью инференса. OpenAI, Anthropic, Google — все они борются за одно: отдавать пользователю максимум интеллекта за минимум электричества. Если Frozen v2 действительно даёт 10-кратный прирост эффективности, Google сможет запускать более мощные версии Gemini по ценам, с которыми конкуренты просто не смогут тягаться.
Для сравнения: лучшие текущие TPU восьмого поколения уже опережают Nvidia H100 по метрикам инференса в облачных тестах. Frozen v2 — это следующий уровень, недоступный никому извне.
Риски: ставка на стабильность архитектуры
Я бы был нечестным, не упомянув главный риск этой стратегии. Frozen v2 работает ровно до тех пор, пока Google не меняет архитектуру Gemini кардинально. Если завтра появится Gemini на принципиально иной архитектуре — допустим, State Space Models вместо трансформеров — партия чипов превратится в дорогостоящий металлолом.
Это та же ставка, что делает Apple с Neural Engine в чипах серии M: глубокая интеграция даёт фантастическую эффективность, но привязывает железо к конкретному программному стеку. Apple может себе это позволить, потому что контролирует и OS, и приложения. Google контролирует Gemini — вопрос в том, насколько стабильной останется его архитектура в горизонте 2028–2032 годов.
Что это значит для рынка
Новость уже отыграна рынком: акции Alphabet в день публикации поднимались выше $359 за штуку, прибавив более 3%. Инвесторы правильно читают сигнал: это не просто новый чип, это заявка на структурное снижение себестоимости AI-сервисов.
Для разработчиков и бизнеса, использующих Gemini API, это потенциально означает более низкие цены на инференс после 2028 года. Для российских пользователей ситуация не меняется в краткосрочной перспективе — доступ к Gemini через российские карты по-прежнему требует обходных решений, а сам чип до публичной инфраструктуры не доберётся ещё минимум два года.
Frozen v2 — это тест гипотезы о том, что будущее AI-инфраструктуры принадлежит не универсальным ускорителям, а специализированному железу под конкретные модели. Если эксперимент удастся, мы увидим целую волну аналогичных проектов от Meta, Amazon и Microsoft. Если провалится — это станет дорогостоящим уроком о пределах hardware-software co-design.
Информация о проекте Frozen v2 подтверждена несколькими независимыми публикациями на основе источников внутри компании.
Похожие новости
OpenAI распустила команду по катастрофическим рискам ИИ
OpenAI тихо ликвидировала отдел Preparedness, который оценивал угрозы от собственных моделей. Сотрудники говорят о нарастающем «чувстве тревоги и ответственности».
Optima: бенчмарки ИИ наконец-то на ваших реальных данных
Artificial Analysis запустила платформу Optima, которая позволяет строить персональные бенчмарки для LLM на основе собственных данных и сравнивать модели не только по качеству, но и по стоимости задачи.
ИИ-книги затопили Amazon и режут доходы живых авторов
Исследование 14 000 книг показало: ИИ-контент занял 20% каталога, но забирает лишь 12% выручки — зато тянет вниз доходы всех авторов без исключения.