G
ИИ-чатDiffusionGemmaGoogle DeepMindGemma 4диффузионные моделилокальный инференс

DiffusionGemma: Google научила старую модель генерировать текст в 4 раза быстрее

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения
DiffusionGemma: Google научила старую модель генерировать текст в 4 раза быстрее

Зачем строить с нуля, если можно переделать?

Когда исследователи говорят о диффузионных языковых моделях, обычно подразумевается дорогостоящее обучение с нуля. Google DeepMind решила иначе: взяла уже готовую Gemma 4 с её 26 миллиардами параметров в архитектуре Mixture of Experts и конвертировала её в диффузионную модель, потратив менее 10% от исходного тренировочного бюджета. Технический отчёт, опубликованный в начале августа, объясняет, как именно это работает — и где придётся идти на компромиссы.

Результат получил имя DiffusionGemma. Модель вышла ещё в середине июня под лицензией Apache 2.0, но только сейчас стали известны детали архитектуры и методологии обучения.

Как диффузия попала в текст

Классические языковые модели — это, по сути, печатная машинка: один токен за другим, слева направо, без права на исправление уже написанного. DiffusionGemma работает иначе: она раскладывает холст из 256 токенов одновременно, начиная с набора случайных заглушек, и итеративно «проявляет» их через несколько шагов денойзинга — точно так же, как Stable Diffusion извлекает изображение из шума.

На практике это даёт около 1500 токенов в секунду на одном Nvidia H100. На потребительском RTX 5090 — свыше 700 токенов в секунду. Для сравнения: это примерно в 4 раза быстрее, чем автрегрессивная Gemma 4 26B-A4B на той же железке, и примерно в 2,25 раза быстрее, чем Gemma 4 12B со спекулятивным декодингом.

Почему такой прирост? Обычные LLM упираются в пропускную способность памяти: при каждом токене модель вынуждена заново загружать веса из VRAM, и GPU в основном простаивает в ожидании следующего «нажатия клавиши». Диффузионный подход переносит узкое место с памяти на вычисления — тензорные ядра наконец получают полноценную нагрузку. Для локального запуска на одном пользователе это принципиальное преимущество.

Два этапа обучения и хитрый трюк SD·RL

Конвертация Gemma 4 в DiffusionGemma прошла через два тренировочных этапа. На первом модель училась восстанавливать зашумлённые блоки текста на обучающих данных — стандартная диффузионная преамбула. На втором Google применила собственную методику SD·RL (Sampler Distillation + Reinforcement Learning): одновременная дистилляция сэмплера и обучение с подкреплением в одном процессе.

Эффект впечатляет: качество на reasoning-бенчмарках выросло в среднем на 10 пунктов, а количество токенов на шаг вычислений почти учетверилось. Побочный эффект — ответы стали примерно на 50% короче, что дополнительно ускоряет вывод. Правда, здесь возникает вопрос: это оптимизация или потеря информации? Судя по бенчмаркам, чаще первое.

Двунаправленное внимание — настоящий козырь

Самое интересное в DiffusionGemma — не скорость, а двунаправленное внимание. Автрегрессивная модель обязана принять решение о первом токене до того, как «увидела» остаток предложения. В техническом отчёте приводится показательный пример: Gemma 4 начинает ответ на математическую задачу с «-1», по ходу рассуждений понимает, что правильный ответ «-25», и дописывает исправление постфактум. DiffusionGemma развивает ответ и рассуждение параллельно и может исправить ошибку до финализации вывода.

Это открывает нетривиальные применения. После минимальной дообучки модель решает около 85% судоку — задачу, где каждая ячейка зависит от ещё не заполненных соседей. Базовая Gemma 4 с этим справляется плохо: последовательная генерация слева направо и строгие взаимозависимые ограничения — плохая пара. Для генерации структурированных данных — JSON, заполнения кода, молекулярных последовательностей — двунаправленный контекст тоже даёт ощутимый выигрыш: такие задачи решаются за 2-3 шага денойзинга вместо полного цикла.

Честно о слабых местах

Google не пытается замаскировать ограничения. По качеству DiffusionGemma уступает автрегрессивной Gemma 4 — и это логично: модель не обучалась с нуля как диффузионная, архитектура и данные унаследованы от Gemma 4, а второй этап обучения сознательно жертвовал пиковым качеством ради скорости.

Есть и специфические артефакты: модель периодически застревает в петлях повторения — отдельные слова воспроизводятся несколько раз подряд. Это прямое следствие агрессивного сокращения шагов вычислений. На мультимодальных задачах и длинных рассуждениях разрыв с базовой моделью становится заметнее.

Для производственных задач Google прямо рекомендует оставаться на стандартной Gemma 4. DiffusionGemma позиционируется для исследователей и разработчиков, которым нужна скорость в интерактивных локальных сценариях: inline-редактирование, быстрая итерация, генерация нелинейных структур.

Что это значит для рынка

DiffusionGemma — не первый эксперимент с диффузией для текста. Модели DREAM и Mercury 2 демонстрировали похожие ускорения, но неизменно проигрывали конкурентам сопоставимого размера по качеству. DiffusionGemma не ломает этот паттерн, но делает другое: доказывает, что конвертация готовой модели работает и обходится в разы дешевле обучения с нуля.

Модель доступна на Hugging Face, уже интегрирована в vLLM, MLX и HF Transformers, поддержка llama.cpp анонсирована. Для российских пользователей: модель скачивается с Hugging Face — доступность зависит от текущего статуса сервиса, в ряде случаев потребуется VPN. Запуск локально требует 18 ГБ VRAM в квантизированном варианте — это уровень RTX 4090 или 5090.

Если Google продолжит этот путь и применит аналогичный подход к следующим поколениям Gemma или даже Gemini, диффузионные языковые модели из академического курьёза превратятся в реальную альтернативу для edge-инференса. Пока это эксперимент — но очень убедительный.

Информация подтверждена несколькими независимыми публикациями, включая технический блог Google и специализированные издания по ИИ.

Все эти инструменты — уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости