DiffusionGemma: Google научила старую модель генерировать текст в 4 раза быстрее

Зачем строить с нуля, если можно переделать?
Когда исследователи говорят о диффузионных языковых моделях, обычно подразумевается дорогостоящее обучение с нуля. Google DeepMind решила иначе: взяла уже готовую Gemma 4 с её 26 миллиардами параметров в архитектуре Mixture of Experts и конвертировала её в диффузионную модель, потратив менее 10% от исходного тренировочного бюджета. Технический отчёт, опубликованный в начале августа, объясняет, как именно это работает — и где придётся идти на компромиссы.
Результат получил имя DiffusionGemma. Модель вышла ещё в середине июня под лицензией Apache 2.0, но только сейчас стали известны детали архитектуры и методологии обучения.
Как диффузия попала в текст
Классические языковые модели — это, по сути, печатная машинка: один токен за другим, слева направо, без права на исправление уже написанного. DiffusionGemma работает иначе: она раскладывает холст из 256 токенов одновременно, начиная с набора случайных заглушек, и итеративно «проявляет» их через несколько шагов денойзинга — точно так же, как Stable Diffusion извлекает изображение из шума.
На практике это даёт около 1500 токенов в секунду на одном Nvidia H100. На потребительском RTX 5090 — свыше 700 токенов в секунду. Для сравнения: это примерно в 4 раза быстрее, чем автрегрессивная Gemma 4 26B-A4B на той же железке, и примерно в 2,25 раза быстрее, чем Gemma 4 12B со спекулятивным декодингом.
Почему такой прирост? Обычные LLM упираются в пропускную способность памяти: при каждом токене модель вынуждена заново загружать веса из VRAM, и GPU в основном простаивает в ожидании следующего «нажатия клавиши». Диффузионный подход переносит узкое место с памяти на вычисления — тензорные ядра наконец получают полноценную нагрузку. Для локального запуска на одном пользователе это принципиальное преимущество.
Два этапа обучения и хитрый трюк SD·RL
Конвертация Gemma 4 в DiffusionGemma прошла через два тренировочных этапа. На первом модель училась восстанавливать зашумлённые блоки текста на обучающих данных — стандартная диффузионная преамбула. На втором Google применила собственную методику SD·RL (Sampler Distillation + Reinforcement Learning): одновременная дистилляция сэмплера и обучение с подкреплением в одном процессе.
Эффект впечатляет: качество на reasoning-бенчмарках выросло в среднем на 10 пунктов, а количество токенов на шаг вычислений почти учетверилось. Побочный эффект — ответы стали примерно на 50% короче, что дополнительно ускоряет вывод. Правда, здесь возникает вопрос: это оптимизация или потеря информации? Судя по бенчмаркам, чаще первое.
Двунаправленное внимание — настоящий козырь
Самое интересное в DiffusionGemma — не скорость, а двунаправленное внимание. Автрегрессивная модель обязана принять решение о первом токене до того, как «увидела» остаток предложения. В техническом отчёте приводится показательный пример: Gemma 4 начинает ответ на математическую задачу с «-1», по ходу рассуждений понимает, что правильный ответ «-25», и дописывает исправление постфактум. DiffusionGemma развивает ответ и рассуждение параллельно и может исправить ошибку до финализации вывода.
Это открывает нетривиальные применения. После минимальной дообучки модель решает около 85% судоку — задачу, где каждая ячейка зависит от ещё не заполненных соседей. Базовая Gemma 4 с этим справляется плохо: последовательная генерация слева направо и строгие взаимозависимые ограничения — плохая пара. Для генерации структурированных данных — JSON, заполнения кода, молекулярных последовательностей — двунаправленный контекст тоже даёт ощутимый выигрыш: такие задачи решаются за 2-3 шага денойзинга вместо полного цикла.
Честно о слабых местах
Google не пытается замаскировать ограничения. По качеству DiffusionGemma уступает автрегрессивной Gemma 4 — и это логично: модель не обучалась с нуля как диффузионная, архитектура и данные унаследованы от Gemma 4, а второй этап обучения сознательно жертвовал пиковым качеством ради скорости.
Есть и специфические артефакты: модель периодически застревает в петлях повторения — отдельные слова воспроизводятся несколько раз подряд. Это прямое следствие агрессивного сокращения шагов вычислений. На мультимодальных задачах и длинных рассуждениях разрыв с базовой моделью становится заметнее.
Для производственных задач Google прямо рекомендует оставаться на стандартной Gemma 4. DiffusionGemma позиционируется для исследователей и разработчиков, которым нужна скорость в интерактивных локальных сценариях: inline-редактирование, быстрая итерация, генерация нелинейных структур.
Что это значит для рынка
DiffusionGemma — не первый эксперимент с диффузией для текста. Модели DREAM и Mercury 2 демонстрировали похожие ускорения, но неизменно проигрывали конкурентам сопоставимого размера по качеству. DiffusionGemma не ломает этот паттерн, но делает другое: доказывает, что конвертация готовой модели работает и обходится в разы дешевле обучения с нуля.
Модель доступна на Hugging Face, уже интегрирована в vLLM, MLX и HF Transformers, поддержка llama.cpp анонсирована. Для российских пользователей: модель скачивается с Hugging Face — доступность зависит от текущего статуса сервиса, в ряде случаев потребуется VPN. Запуск локально требует 18 ГБ VRAM в квантизированном варианте — это уровень RTX 4090 или 5090.
Если Google продолжит этот путь и применит аналогичный подход к следующим поколениям Gemma или даже Gemini, диффузионные языковые модели из академического курьёза превратятся в реальную альтернативу для edge-инференса. Пока это эксперимент — но очень убедительный.
Информация подтверждена несколькими независимыми публикациями, включая технический блог Google и специализированные издания по ИИ.
Похожие новости
OpenAI распустила команду по катастрофическим рискам ИИ
OpenAI тихо ликвидировала отдел Preparedness, который оценивал угрозы от собственных моделей. Сотрудники говорят о нарастающем «чувстве тревоги и ответственности».
Optima: бенчмарки ИИ наконец-то на ваших реальных данных
Artificial Analysis запустила платформу Optima, которая позволяет строить персональные бенчмарки для LLM на основе собственных данных и сравнивать модели не только по качеству, но и по стоимости задачи.
ИИ-книги затопили Amazon и режут доходы живых авторов
Исследование 14 000 книг показало: ИИ-контент занял 20% каталога, но забирает лишь 12% выручки — зато тянет вниз доходы всех авторов без исключения.