G
ИИ-чатDiffusionGemmaGoogle DeepMindGemma 4диффузионные моделилокальный инференс

DiffusionGemma: Google научила старую модель генерировать текст в 4 раза быстрее

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения
DiffusionGemma: Google научила старую модель генерировать текст в 4 раза быстрее

Зачем строить с нуля, если можно переделать?

Когда исследователи говорят о диффузионных языковых моделях, обычно подразумевается дорогостоящее обучение с нуля. Google DeepMind решила иначе: взяла уже готовую Gemma 4 с ее 26 миллиардами параметров в архитектуре Mixture of Experts и конвертировала ее в диффузионную модель, потратив менее 10% от исходного тренировочного бюджета. Технический отчет, опубликованный в начале августа, объясняет, как именно это работает - и где придется идти на компромиссы.

Результат получил имя DiffusionGemma. Модель вышла еще в середине июня под лицензией Apache 2.0, но только сейчас стали известны детали архитектуры и методологии обучения.

Как диффузия попала в текст

Классические языковые модели - это, по сути, печатная машинка: один токен за другим, слева направо, без права на исправление уже написанного. DiffusionGemma работает иначе: она раскладывает холст из 256 токенов одновременно, начиная с набора случайных заглушек, и итеративно "проявляет" их через несколько шагов денойзинга - точно так же, как Stable Diffusion извлекает изображение из шума.

На практике это дает около 1500 токенов в секунду на одном Nvidia H100. На потребительском RTX 5090 - свыше 700 токенов в секунду. Для сравнения: это примерно в 4 раза быстрее, чем автрегрессивная Gemma 4 26B-A4B на той же железке, и примерно в 2,25 раза быстрее, чем Gemma 4 12B со спекулятивным декодингом.

Почему такой прирост? Обычные LLM упираются в пропускную способность памяти: при каждом токене модель вынуждена заново загружать веса из VRAM, и GPU в основном простаивает в ожидании следующего "нажатия клавиши". Диффузионный подход переносит узкое место с памяти на вычисления - тензорные ядра наконец получают полноценную нагрузку. Для локального запуска на одном пользователе это принципиальное преимущество.

Два этапа обучения и хитрый трюк SD·RL

Конвертация Gemma 4 в DiffusionGemma прошла через два тренировочных этапа. На первом модель училась восстанавливать зашумленные блоки текста на обучающих данных - стандартная диффузионная преамбула. На втором Google применила собственную методику SD·RL (Sampler Distillation + Reinforcement Learning): одновременная дистилляция сэмплера и обучение с подкреплением в одном процессе.

Эффект впечатляет: качество на reasoning-бенчмарках выросло в среднем на 10 пунктов, а количество токенов на шаг вычислений почти учетверилось. Побочный эффект - ответы стали примерно на 50% короче, что дополнительно ускоряет вывод. Правда, здесь возникает вопрос: это оптимизация или потеря информации? Судя по бенчмаркам, чаще первое.

Двунаправленное внимание - настоящий козырь

Самое интересное в DiffusionGemma - не скорость, а двунаправленное внимание. Автрегрессивная модель обязана принять решение о первом токене до того, как "увидела" остаток предложения. В техническом отчете приводится показательный пример: Gemma 4 начинает ответ на математическую задачу с "-1", по ходу рассуждений понимает, что правильный ответ "-25", и дописывает исправление постфактум. DiffusionGemma развивает ответ и рассуждение параллельно и может исправить ошибку до финализации вывода.

Это открывает нетривиальные применения. После минимальной дообучки модель решает около 85% судоку - задачу, где каждая ячейка зависит от еще не заполненных соседей. Базовая Gemma 4 с этим справляется плохо: последовательная генерация слева направо и строгие взаимозависимые ограничения - плохая пара. Для генерации структурированных данных - JSON, заполнения кода, молекулярных последовательностей - двунаправленный контекст тоже дает ощутимый выигрыш: такие задачи решаются за 2-3 шага денойзинга вместо полного цикла.

Честно о слабых местах

Google не пытается замаскировать ограничения. По качеству DiffusionGemma уступает автрегрессивной Gemma 4 - и это логично: модель не обучалась с нуля как диффузионная, архитектура и данные унаследованы от Gemma 4, а второй этап обучения сознательно жертвовал пиковым качеством ради скорости.

Есть и специфические артефакты: модель периодически застревает в петлях повторения - отдельные слова воспроизводятся несколько раз подряд. Это прямое следствие агрессивного сокращения шагов вычислений. На мультимодальных задачах и длинных рассуждениях разрыв с базовой моделью становится заметнее.

Для производственных задач Google прямо рекомендует оставаться на стандартной Gemma 4. DiffusionGemma позиционируется для исследователей и разработчиков, которым нужна скорость в интерактивных локальных сценариях: inline-редактирование, быстрая итерация, генерация нелинейных структур.

Что это значит для рынка

DiffusionGemma - не первый эксперимент с диффузией для текста. Модели DREAM и Mercury 2 демонстрировали похожие ускорения, но неизменно проигрывали конкурентам сопоставимого размера по качеству. DiffusionGemma не ломает этот паттерн, но делает другое: доказывает, что конвертация готовой модели работает и обходится в разы дешевле обучения с нуля.

Модель доступна на Hugging Face, уже интегрирована в vLLM, MLX и HF Transformers, поддержка llama.cpp анонсирована. Для российских пользователей: модель скачивается с Hugging Face - доступность зависит от текущего статуса сервиса, в ряде случаев потребуется VPN. Запуск локально требует 18 ГБ VRAM в квантизированном варианте - это уровень RTX 4090 или 5090.

Если Google продолжит этот путь и применит аналогичный подход к следующим поколениям Gemma или даже Gemini, диффузионные языковые модели из академического курьеза превратятся в реальную альтернативу для edge-инференса. Пока это эксперимент - но очень убедительный.

Информация подтверждена несколькими независимыми публикациями, включая технический блог Google и специализированные издания по ИИ.

Все эти инструменты - уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости