Google "замораживает" Gemini в кремнии: чип Frozen v2 в 10 раз эффективнее TPU

Когда инженеры Google говорят "заморозить" модель, они обычно имеют в виду остановку обучения. Но в проекте Frozen v2 смысл этого слова приобрел буквальное, почти философское измерение: часть архитектуры Gemini будет физически вытравлена в кремний. Навсегда. Это один из самых радикальных экспериментов в истории прикладного ИИ-железа.
Что такое Frozen v2 и почему это не просто очередной чип
Google годами выпускает TPU - тензорные процессоры, которые умеют работать с любой моделью. Это их главное достоинство и одновременно ахиллесова пята: универсальность требует постоянных вычислений логических условий в реальном времени, что съедает энергию и время. Frozen v2 выбирает другой путь - он жертвует гибкостью ради скорости.
Вместо того чтобы каждый раз "спрашивать" чип, как обрабатывать запрос, часть вычислительной логики Gemini будет зашита прямо в аппаратную схему. По данным источников, знакомых с проектом, это позволит сократить количество вычислительных шагов и минимизировать движение данных между памятью и логическими блоками - два главных узких места современного AI-инференса.
Ожидаемый результат: от 6 до 10 токенов на ватт мощности против нынешних показателей TPU. Это не эволюция - это смена парадигмы.
История идеи: от весов к архитектуре
Оригинальная концепция принадлежит Джеффу Дину, главному ученому Google DeepMind. Его первоначальная версия Frozen была еще радикальнее: вшить прямо в кремний не архитектуру, а веса модели - конкретные числовые параметры, определяющие поведение Gemini. Технически это дало бы максимальную эффективность.
Однако команда быстро осознала фундаментальный изъян: такой чип работал бы только с одной конкретной версией Gemini и устаревал бы вместе с каждым обновлением модели. В условиях, когда Gemini обновляется несколько раз в год, это коммерческое самоубийство.
Frozen v2 нашел компромисс: в кремний вшивается архитектурный чертеж - структура трансформера, схема слоев, паттерны вычислений - но не конкретные веса. Новые веса можно загружать на чип по мере обновления модели. Насколько глубоко архитектура будет захардкожена - инженеры еще окончательно не решили.
Технические детали: три источника эффективности
По имеющимся данным, прирост производительности достигается сразу тремя путями.
Первый - сокращение числа вычислений. Когда логика модели встроена в железо, чип не тратит циклы на интерпретацию инструкций - он просто выполняет их напрямую.
Второй - минимизация движения данных. Это хроническая болезнь современных GPU и TPU: когда модель не помещается во внутреннюю память чипа, данные постоянно гоняются между чипом и внешней DRAM. Каждая такая пересылка - это потерянное время и энергия. Frozen v2, судя по всему, будет оснащен достаточным объемом памяти, чтобы держать Gemini целиком на кристалле.
Третий - operator fusion, слияние операций. Несколько последовательных вычислений объединяются в одно, которое выполняется быстрее. Для Gemini, чья архитектура известна инженерам досконально, такую оптимизацию можно реализовать на уровне схемотехники.
Стратегический контекст: дефицит вычислений и гонка маржинальности
Frozen v2 - это не академический эксперимент. Google прямо сейчас испытывает острую нехватку AI-вычислений. По имеющимся данным, дефицит настолько серьезен, что Google Cloud вынужден отказывать внешним клиентам в заказах. Это удар по репутации и прямые потери выручки.
При этом Frozen v2 не станет продуктом для внешних клиентов - в отличие от TPU, которые Google сдает в аренду через облако, предлагает Meta и продвигает по программе TPU@Premises как альтернативу Nvidia. Frozen v2 - исключительно для внутреннего потребления.
Но именно это делает его стратегически важным. В AI-бизнесе 2026 года маржа определяется стоимостью инференса. OpenAI, Anthropic, Google - все они борются за одно: отдавать пользователю максимум интеллекта за минимум электричества. Если Frozen v2 действительно дает 10-кратный прирост эффективности, Google сможет запускать более мощные версии Gemini по ценам, с которыми конкуренты просто не смогут тягаться.
Для сравнения: лучшие текущие TPU восьмого поколения уже опережают Nvidia H100 по метрикам инференса в облачных тестах. Frozen v2 - это следующий уровень, недоступный никому извне.
Риски: ставка на стабильность архитектуры
Я бы был нечестным, не упомянув главный риск этой стратегии. Frozen v2 работает ровно до тех пор, пока Google не меняет архитектуру Gemini кардинально. Если завтра появится Gemini на принципиально иной архитектуре - допустим, State Space Models вместо трансформеров - партия чипов превратится в дорогостоящий металлолом.
Это та же ставка, что делает Apple с Neural Engine в чипах серии M: глубокая интеграция дает фантастическую эффективность, но привязывает железо к конкретному программному стеку. Apple может себе это позволить, потому что контролирует и OS, и приложения. Google контролирует Gemini - вопрос в том, насколько стабильной останется его архитектура в горизонте 2028-2032 годов.
Что это значит для рынка
Новость уже отыграна рынком: акции Alphabet в день публикации поднимались выше $359 за штуку, прибавив более 3%. Инвесторы правильно читают сигнал: это не просто новый чип, это заявка на структурное снижение себестоимости AI-сервисов.
Для разработчиков и бизнеса, использующих Gemini API, это потенциально означает более низкие цены на инференс после 2028 года. Для российских пользователей ситуация не меняется в краткосрочной перспективе - доступ к Gemini через российские карты по-прежнему требует обходных решений, а сам чип до публичной инфраструктуры не доберется еще минимум два года.
Frozen v2 - это тест гипотезы о том, что будущее AI-инфраструктуры принадлежит не универсальным ускорителям, а специализированному железу под конкретные модели. Если эксперимент удастся, мы увидим целую волну аналогичных проектов от Meta, Amazon и Microsoft. Если провалится - это станет дорогостоящим уроком о пределах hardware-software co-design.
Информация о проекте Frozen v2 подтверждена несколькими независимыми публикациями на основе источников внутри компании.
Похожие новости
Apple ужесточает доступ к диску Mac из-за угроз со стороны ИИ-агентов
Apple объявила о новых ограничениях для функции "полного доступа к диску" в macOS - компания прямо указала, что ИИ-агенты существенно увеличат риски для конфиденциальности пользователей по мере своего развития.
OpenAI Dots: рабочий ИИ-агент, который заодно закажет ужин
OpenAI представила Dots - всегда активных агентов на базе GPT-6 Astra. Они работают как корпоративный софт, но при этом могут заказать бурито.
Ai2 открыла AstaBrief 8B: научные отчеты за 51 секунду
Allen Institute for AI выложил в открытый доступ модель AstaBrief 8B - она генерирует научные отчеты с цитатами в 3,5 раза быстрее Claude и стоит дешевле в обслуживании.