GLM-Image

GLM-Image

Открытая модель Z.ai и Huawei (январь 2026) под лицензией MIT: 9 млрд параметров планируют композицию, 7 млрд дорисовывают детали. Лучше всех открытых моделей рисует текст на картинке — 91.16% точности слов против 86% у ближайших. Но сама картинка при этом заметно слабее: кожа и мех выглядят искусственно. Инструмент для афиш и инфографики, не для фотореализма.

Бесплатно при локальном запуске; API — около $0.015 за изображениеРаботает в РФ
7.2/10📅 2026-01🏢 Zhipu AI✓ Open Source

Рейтинг и бенчмарки

Общий рейтинг
7.2/10
Benchmark Score
7/10
Скорость
8/10
CVTG-2K (точность слов)
91.16% — первое место среди открытых моделей; у Z-Image 86.71%, у Qwen-Image-2512 86.04%
LongText-Bench
95.24% на английском и 97.9% на китайском
Отставание от закрытых
95.24% против 98.9% у Seedream 4.5 на английском тексте
Архитектура
гибрид: 9 млрд параметров планируют композицию, 7 млрд дорисовывают детали
Разрешение
от 1024×1024 до 2048×2048
Слабое место
фотореализм — кожа и мех выглядят искусственно, следование промпту среднее
Обучение
полностью на чипах Huawei Ascend Atlas 800T A2 и фреймворке CANN MindSpore

Входные и выходные данные

Входные данные
текстизображение
Выходные данные
изображение

API и стоимость

Входные токены (Input)
Бесплатно при локальном запуске; API — около $0.015 за изображение
цена за промпт
Выходные токены (Output)
около $0.015 за изображение через API; локально — бесплатно
цена за ответ
API доступен

Способы доступа

локальный запуск (открытые веса)API Z.aiсторонние площадки

Сценарии использования

афиши и баннеры с текстомобложки для соцсетейинфографикакарточки товароввывески и макеты с типографикойредактирование изображений

Тарифы и подписки — Zhipu AI

Актуальные планы подписки провайдера. Цены могут меняться — уточняйте на странице цен

Популярный
Локальный запуск
Бесплатно
  • Лицензия MIT — коммерческое использование разрешено
  • Открытые веса
  • 9 млрд + 7 млрд параметров
  • Работает без интернета и без VPN
  • Данные не покидают компьютер
API Z.ai
около $0.015 за изображение
  • Своё железо не нужно
  • Разрешение до 2048×2048
  • Текст и изображение на вход
  • Нужна зарубежная карта
Российские карты не принимаются.Genova-ai — работает в РФ без VPN

Плюсы и минусы

✓ Плюсы
Лучше всех открытых моделей рисует текст на картинке: 91.16% точности слов на CVTG-2K против 86.71% у Z-Image и 86.04% у Qwen-Image-2512
Надписи получаются читаемыми и правильно свёрстанными — иерархия заголовков и подписей выстраивается логично, а не превращается в набор символов
Свободная лицензия MIT: веса скачиваются бесплатно, коммерческое использование разрешено без оговорок
Умный подход к архитектуре: сначала 9 млрд параметров планируют композицию и логику кадра, затем 7 млрд дорисовывают детали и текстуры — отсюда и аккуратная вёрстка
Разрешение от 1024×1024 до 2048×2048, на вход принимает не только текст, но и изображение
Умеет не только генерировать, но и редактировать: перенос стиля, сохранение внешности персонажа и согласованность нескольких объектов в кадре
Через API стоит копейки — около $0.015 за изображение
Работает в России без VPN, а открытые веса можно запустить у себя
✗ Минусы
Качество самой картинки — главное слабое место: результат выглядит откровенно сгенерированным, кожа и мех получаются искусственными, фотореализма нет
Следование промпту среднее: сложные описания модель отрабатывает неточно
На задачах с большим объёмом информации выдаёт путаницу — сложные схемы и таймлайны получаются хаотичными
Стилистически консервативна: художественной выразительности и контроля стиля заметно меньше, чем у конкурентов
Закрытым моделям по тексту всё же уступает: 95.24% против 98.9% у Seedream 4.5 на английском
Компания не раскрыла состав обучающих данных
Российские карты для оплаты API не принимаются, русского интерфейса нет

Подробный обзор

Что такое GLM-Image

GLM-Image — открытая модель генерации изображений, которую Z.ai и Huawei выложили в открытый доступ в январе 2026 года под свободной лицензией MIT. Устроена она необычно — это гибрид двух разных архитектур:

  • 9 миллиардов параметров (на базе языковой модели GLM-4-9B) планируют композицию: что где расположено, какая иерархия у элементов, где какой текст
  • 7 миллиардов параметров (диффузионный декодер на базе CogView4) дорисовывают детали и текстуры

Разделение планирования и отрисовки — как раз то, что даёт модели её главное преимущество.

Она лучше всех открытых моделей пишет текст на картинке

Надписи на изображениях — давняя болевая точка генеративных моделей: буквы плывут, слова превращаются в набор символов, вёрстка разваливается. GLM-Image эту задачу решает лучше всех открытых конкурентов:

  • CVTG-2K — 91.16% точности слов против 86.71% у Z-Image и 86.04% у Qwen-Image-2512
  • LongText-Bench — 95.24% на английском и 97.9% на китайском

Причём дело не только в точности букв: модель выстраивает логичную иерархию заголовков и подписей, так что афиша или карточка товара выглядит свёрстанной, а не случайно собранной.

Но сама картинка — слабое место

Здесь нужна прямота, иначе ожидания разойдутся с реальностью. Выигрывая по тексту, GLM-Image заметно проигрывает по качеству самого изображения:

  • Результат выглядит откровенно сгенерированным: кожа и мех получаются искусственными, фотореализма нет
  • Следование промпту среднее — сложные описания отрабатываются неточно
  • На задачах с большим объёмом информации — схемах, таймлайнах — выдаёт путаницу
  • Стилистически консервативна: художественной выразительности и контроля стиля меньше, чем у конкурентов

Отсюда понятно, для чего она

GLM-Image — инструмент под конкретный класс задач, где текст важнее художественности:

  • Афиши, баннеры и рекламные макеты с надписями
  • Обложки для соцсетей
  • Карточки товаров для маркетплейсов
  • Простая инфографика и вывески

А вот за портретами, фотореалистичными сценами и художественной выразительностью идти нужно к другим моделям — например к FLUX.2 [dev], который тоже с открытыми весами.

Отдельный сюжет: обучена на китайских чипах

GLM-Image стала первой мультимодальной моделью такого уровня, обученной полностью на китайском железе — чипах Huawei Ascend Atlas 800T A2 и фреймворке CANN MindSpore, без единой видеокарты Nvidia. С учётом экспортных ограничений это заметная веха.

Правда, оценить эффективность нельзя: компания не раскрыла ни количество использованных чипов, ни объём вычислений. Состав обучающих данных тоже не публиковался.

Цена и доступ из России

Веса лежат в открытом доступе под лицензией MIT — скачать и запустить у себя можно бесплатно, включая коммерческое использование. Если своего железа нет, через API изображение стоит около $0.015, что очень дёшево.

Из России сервис открывается без VPN, а локальный запуск и вовсе не требует ничего. Барьер только в оплате API: российские карты не принимаются. Русского интерфейса нет.

Часто задаваемые вопросы

Что такое GLM-Image?
Открытая модель генерации изображений от Z.ai и Huawei, выложенная в январе 2026 года под свободной лицензией MIT. Устроена как гибрид: 9 миллиардов параметров планируют композицию кадра, а 7 миллиардов дорисовывают детали. Благодаря такому разделению она лучше всех открытых моделей справляется с текстом на картинке.
Насколько хорошо GLM-Image рисует текст?
Лучше всех открытых конкурентов: 91.16% точности слов на CVTG-2K против 86.71% у Z-Image и 86.04% у Qwen-Image-2512. На LongText-Bench — 95.24% на английском и 97.9% на китайском. Причём модель ещё и выстраивает логичную иерархию заголовков и подписей, так что макет выглядит свёрстанным.
В чём главный недостаток GLM-Image?
Качество самой картинки. Результат выглядит откровенно сгенерированным: кожа и мех получаются искусственными, фотореализма нет. Следование промпту среднее, на сложных информационных задачах модель выдаёт путаницу, а стилистически она консервативна. Выигрывая по тексту, она заметно проигрывает по изображению.
Для каких задач подходит GLM-Image?
Для всего, где текст важнее художественности: афиши и рекламные баннеры с надписями, обложки для соцсетей, карточки товаров для маркетплейсов, простая инфографика, вывески. За портретами и фотореалистичными сценами лучше идти к другим моделям — например к FLUX.2 [dev], который тоже с открытыми весами.
Сколько стоит GLM-Image?
При локальном запуске бесплатно — веса открыты под лицензией MIT, коммерческое использование разрешено. Через API изображение обходится примерно в $0.015, что очень дёшево. Для оплаты API понадобится зарубежная карта, российские не принимаются.
Работает ли GLM-Image в России?
Да. Локальный запуск не требует ни VPN, ни карты — веса скачиваются и работают у вас. Сам сервис Z.ai тоже открывается из России без VPN, но оплатить API российской картой не получится. Русского интерфейса нет.
Правда ли модель обучена без чипов Nvidia?
Да, GLM-Image стала первой мультимодальной моделью такого уровня, обученной полностью на китайском железе — чипах Huawei Ascend Atlas 800T A2 и фреймворке CANN MindSpore. С учётом экспортных ограничений это заметная веха. Правда, оценить эффективность нельзя: количество чипов и объём вычислений компания не раскрыла.
Уступает ли GLM-Image закрытым моделям по тексту?
Да, хотя разрыв невелик: на LongText-Bench она набирает 95.24% на английском против 98.9% у Seedream 4.5. Среди моделей с открытыми весами GLM-Image первая, но абсолютным лидером по тексту на изображении не является.

Все эти инструменты — уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно