GLM-Image
Открытая модель Z.ai и Huawei (январь 2026) под лицензией MIT: 9 млрд параметров планируют композицию, 7 млрд дорисовывают детали. Лучше всех открытых моделей рисует текст на картинке — 91.16% точности слов против 86% у ближайших. Но сама картинка при этом заметно слабее: кожа и мех выглядят искусственно. Инструмент для афиш и инфографики, не для фотореализма.
Рейтинг и бенчмарки
Входные и выходные данные
API и стоимость
Способы доступа
Сценарии использования
Тарифы и подписки — Zhipu AI
Актуальные планы подписки провайдера. Цены могут меняться — уточняйте на странице цен
- Лицензия MIT — коммерческое использование разрешено
- Открытые веса
- 9 млрд + 7 млрд параметров
- Работает без интернета и без VPN
- Данные не покидают компьютер
- Своё железо не нужно
- Разрешение до 2048×2048
- Текст и изображение на вход
- Нужна зарубежная карта
Плюсы и минусы
Подробный обзор
Что такое GLM-Image
GLM-Image — открытая модель генерации изображений, которую Z.ai и Huawei выложили в открытый доступ в январе 2026 года под свободной лицензией MIT. Устроена она необычно — это гибрид двух разных архитектур:
- 9 миллиардов параметров (на базе языковой модели GLM-4-9B) планируют композицию: что где расположено, какая иерархия у элементов, где какой текст
- 7 миллиардов параметров (диффузионный декодер на базе CogView4) дорисовывают детали и текстуры
Разделение планирования и отрисовки — как раз то, что даёт модели её главное преимущество.
Она лучше всех открытых моделей пишет текст на картинке
Надписи на изображениях — давняя болевая точка генеративных моделей: буквы плывут, слова превращаются в набор символов, вёрстка разваливается. GLM-Image эту задачу решает лучше всех открытых конкурентов:
- CVTG-2K — 91.16% точности слов против 86.71% у Z-Image и 86.04% у Qwen-Image-2512
- LongText-Bench — 95.24% на английском и 97.9% на китайском
Причём дело не только в точности букв: модель выстраивает логичную иерархию заголовков и подписей, так что афиша или карточка товара выглядит свёрстанной, а не случайно собранной.
Но сама картинка — слабое место
Здесь нужна прямота, иначе ожидания разойдутся с реальностью. Выигрывая по тексту, GLM-Image заметно проигрывает по качеству самого изображения:
- Результат выглядит откровенно сгенерированным: кожа и мех получаются искусственными, фотореализма нет
- Следование промпту среднее — сложные описания отрабатываются неточно
- На задачах с большим объёмом информации — схемах, таймлайнах — выдаёт путаницу
- Стилистически консервативна: художественной выразительности и контроля стиля меньше, чем у конкурентов
Отсюда понятно, для чего она
GLM-Image — инструмент под конкретный класс задач, где текст важнее художественности:
- Афиши, баннеры и рекламные макеты с надписями
- Обложки для соцсетей
- Карточки товаров для маркетплейсов
- Простая инфографика и вывески
А вот за портретами, фотореалистичными сценами и художественной выразительностью идти нужно к другим моделям — например к FLUX.2 [dev], который тоже с открытыми весами.
Отдельный сюжет: обучена на китайских чипах
GLM-Image стала первой мультимодальной моделью такого уровня, обученной полностью на китайском железе — чипах Huawei Ascend Atlas 800T A2 и фреймворке CANN MindSpore, без единой видеокарты Nvidia. С учётом экспортных ограничений это заметная веха.
Правда, оценить эффективность нельзя: компания не раскрыла ни количество использованных чипов, ни объём вычислений. Состав обучающих данных тоже не публиковался.
Цена и доступ из России
Веса лежат в открытом доступе под лицензией MIT — скачать и запустить у себя можно бесплатно, включая коммерческое использование. Если своего железа нет, через API изображение стоит около $0.015, что очень дёшево.
Из России сервис открывается без VPN, а локальный запуск и вовсе не требует ничего. Барьер только в оплате API: российские карты не принимаются. Русского интерфейса нет.