DiffusionGemma: Google научила старую модель генерировать текст в 4 раза быстрее

Зачем строить с нуля, если можно переделать?
Когда исследователи говорят о диффузионных языковых моделях, обычно подразумевается дорогостоящее обучение с нуля. Google DeepMind решила иначе: взяла уже готовую Gemma 4 с ее 26 миллиардами параметров в архитектуре Mixture of Experts и конвертировала ее в диффузионную модель, потратив менее 10% от исходного тренировочного бюджета. Технический отчет, опубликованный в начале августа, объясняет, как именно это работает - и где придется идти на компромиссы.
Результат получил имя DiffusionGemma. Модель вышла еще в середине июня под лицензией Apache 2.0, но только сейчас стали известны детали архитектуры и методологии обучения.
Как диффузия попала в текст
Классические языковые модели - это, по сути, печатная машинка: один токен за другим, слева направо, без права на исправление уже написанного. DiffusionGemma работает иначе: она раскладывает холст из 256 токенов одновременно, начиная с набора случайных заглушек, и итеративно "проявляет" их через несколько шагов денойзинга - точно так же, как Stable Diffusion извлекает изображение из шума.
На практике это дает около 1500 токенов в секунду на одном Nvidia H100. На потребительском RTX 5090 - свыше 700 токенов в секунду. Для сравнения: это примерно в 4 раза быстрее, чем автрегрессивная Gemma 4 26B-A4B на той же железке, и примерно в 2,25 раза быстрее, чем Gemma 4 12B со спекулятивным декодингом.
Почему такой прирост? Обычные LLM упираются в пропускную способность памяти: при каждом токене модель вынуждена заново загружать веса из VRAM, и GPU в основном простаивает в ожидании следующего "нажатия клавиши". Диффузионный подход переносит узкое место с памяти на вычисления - тензорные ядра наконец получают полноценную нагрузку. Для локального запуска на одном пользователе это принципиальное преимущество.
Два этапа обучения и хитрый трюк SD·RL
Конвертация Gemma 4 в DiffusionGemma прошла через два тренировочных этапа. На первом модель училась восстанавливать зашумленные блоки текста на обучающих данных - стандартная диффузионная преамбула. На втором Google применила собственную методику SD·RL (Sampler Distillation + Reinforcement Learning): одновременная дистилляция сэмплера и обучение с подкреплением в одном процессе.
Эффект впечатляет: качество на reasoning-бенчмарках выросло в среднем на 10 пунктов, а количество токенов на шаг вычислений почти учетверилось. Побочный эффект - ответы стали примерно на 50% короче, что дополнительно ускоряет вывод. Правда, здесь возникает вопрос: это оптимизация или потеря информации? Судя по бенчмаркам, чаще первое.
Двунаправленное внимание - настоящий козырь
Самое интересное в DiffusionGemma - не скорость, а двунаправленное внимание. Автрегрессивная модель обязана принять решение о первом токене до того, как "увидела" остаток предложения. В техническом отчете приводится показательный пример: Gemma 4 начинает ответ на математическую задачу с "-1", по ходу рассуждений понимает, что правильный ответ "-25", и дописывает исправление постфактум. DiffusionGemma развивает ответ и рассуждение параллельно и может исправить ошибку до финализации вывода.
Это открывает нетривиальные применения. После минимальной дообучки модель решает около 85% судоку - задачу, где каждая ячейка зависит от еще не заполненных соседей. Базовая Gemma 4 с этим справляется плохо: последовательная генерация слева направо и строгие взаимозависимые ограничения - плохая пара. Для генерации структурированных данных - JSON, заполнения кода, молекулярных последовательностей - двунаправленный контекст тоже дает ощутимый выигрыш: такие задачи решаются за 2-3 шага денойзинга вместо полного цикла.
Честно о слабых местах
Google не пытается замаскировать ограничения. По качеству DiffusionGemma уступает автрегрессивной Gemma 4 - и это логично: модель не обучалась с нуля как диффузионная, архитектура и данные унаследованы от Gemma 4, а второй этап обучения сознательно жертвовал пиковым качеством ради скорости.
Есть и специфические артефакты: модель периодически застревает в петлях повторения - отдельные слова воспроизводятся несколько раз подряд. Это прямое следствие агрессивного сокращения шагов вычислений. На мультимодальных задачах и длинных рассуждениях разрыв с базовой моделью становится заметнее.
Для производственных задач Google прямо рекомендует оставаться на стандартной Gemma 4. DiffusionGemma позиционируется для исследователей и разработчиков, которым нужна скорость в интерактивных локальных сценариях: inline-редактирование, быстрая итерация, генерация нелинейных структур.
Что это значит для рынка
DiffusionGemma - не первый эксперимент с диффузией для текста. Модели DREAM и Mercury 2 демонстрировали похожие ускорения, но неизменно проигрывали конкурентам сопоставимого размера по качеству. DiffusionGemma не ломает этот паттерн, но делает другое: доказывает, что конвертация готовой модели работает и обходится в разы дешевле обучения с нуля.
Модель доступна на Hugging Face, уже интегрирована в vLLM, MLX и HF Transformers, поддержка llama.cpp анонсирована. Для российских пользователей: модель скачивается с Hugging Face - доступность зависит от текущего статуса сервиса, в ряде случаев потребуется VPN. Запуск локально требует 18 ГБ VRAM в квантизированном варианте - это уровень RTX 4090 или 5090.
Если Google продолжит этот путь и применит аналогичный подход к следующим поколениям Gemma или даже Gemini, диффузионные языковые модели из академического курьеза превратятся в реальную альтернативу для edge-инференса. Пока это эксперимент - но очень убедительный.
Информация подтверждена несколькими независимыми публикациями, включая технический блог Google и специализированные издания по ИИ.
Похожие новости
Apple ужесточает доступ к диску Mac из-за угроз со стороны ИИ-агентов
Apple объявила о новых ограничениях для функции "полного доступа к диску" в macOS - компания прямо указала, что ИИ-агенты существенно увеличат риски для конфиденциальности пользователей по мере своего развития.
OpenAI Dots: рабочий ИИ-агент, который заодно закажет ужин
OpenAI представила Dots - всегда активных агентов на базе GPT-6 Astra. Они работают как корпоративный софт, но при этом могут заказать бурито.
Ai2 открыла AstaBrief 8B: научные отчеты за 51 секунду
Allen Institute for AI выложил в открытый доступ модель AstaBrief 8B - она генерирует научные отчеты с цитатами в 3,5 раза быстрее Claude и стоит дешевле в обслуживании.