A
КартинкиQwen-Image-2.1Alibabaгенерация изображенийоткрытые моделиDiT

Qwen-Image-2.1: открытая модель Alibaba на 7B бьет закрытые аналоги

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения
Qwen-Image-2.1: открытая модель Alibaba на 7B бьет закрытые аналоги

Семь миллиардов против всего рынка

Когда Alibaba заявляет, что их открытая модель с 7 миллиардами параметров обходит закрытые коммерческие системы в генерации изображений, первая реакция - скептицизм. Но технические детали Qwen-Image-2.1 заставляют отнестись к этому утверждению серьезно, даже если независимые бенчмарки пока не подтверждены.

Команда Qwen выпустила модель 20 сентября 2026 года, разместив веса на Hugging Face, GitHub и ModelScope. Архитектурно это однопоточный DiT с 32 слоями, спаренный с текстовым энкодером Qwen3-VL на 8B параметров и 64-канальным VAE с поддержкой RGBA. Нативное разрешение - 2048x2048 пикселей при 40 шагах диффузии. Дополнительно в релизе идут два чекпоинта на 9B для переписывания промптов (PE-T2I и PE-I2I).

Что реально умеет модель

Главная техническая фишка - нативная работа с прозрачностью. Большинство генеративных моделей выдают RGB и не понимают, что такое альфа-канал. Qwen-Image-2.1 генерирует RGBA напрямую, что означает возможность создавать изображения с прозрачным фоном, редактировать объекты на прозрачных слоях и менять текст без переклейки фона. Для дизайнеров и разработчиков продуктов это не мелочь - это часы сохраненного времени на постобработку.

Вторая возможность - работа с до десяти референсных изображений одновременно. Команда приводит примеры: групповые портреты из отдельных фотографий разных людей, виртуальная примерка одежды, расстановка мебели в интерьере. Локальные правки указываются кругами, масками или нарисованными от руки пометками - подход, который стал стандартом после того, как его популяризировал Inpaint в Stable Diffusion, но здесь реализован нативно.

Для ускорения инференса разработчики применили смешанную гранулярность внимания и переиспользование KV-кеша. Это особенно заметно при работе с множеством референсов - без оптимизации каждый дополнительный входной образ линейно увеличивал бы время генерации.

На каком железе это запустить

Модель официально работает на RTX 3090 - то есть на потребительском GPU с 24 ГБ видеопамяти. Это не топовое серверное железо, но и не то, что стоит у большинства людей дома. Для сравнения: FLUX.1 dev в полном float16 тоже требует около 20-24 ГБ VRAM, так что Qwen-Image-2.1 находится в той же весовой категории по требованиям к железу.

Локальный запуск через Hugging Face Diffusers - стандартная история. Для тех, кто не хочет возиться с установкой, есть демо прямо на Hugging Face.

Лицензия - главный подвох

Тут начинается неприятная часть. Предыдущие модели линейки Qwen-Image выходили под Apache 2.0 - то есть их можно было использовать коммерчески без дополнительных соглашений. Qwen-Image-2.1 переходит на Qwen Research License Agreement, что автоматически означает запрет коммерческого использования по умолчанию.

Хочешь строить продукт - иди договариваться с Alibaba отдельно. Это стандартная практика для китайских лабораторий, которые хотят сохранить контроль над монетизацией, но для разработчиков, которые успели полюбить открытость Apache, это откат назад. Qwen3 и ряд других моделей Alibaba по-прежнему идут под Apache, так что это осознанное решение именно для визуального направления.

Сравнение с конкурентами

Команда Qwen утверждает, что 7B модель превосходит закрытые аналоги на их собственном бенчмарке. Без независимой проверки это звучит как маркетинг, но посмотрим на контекст. FLUX.1 pro от Black Forest Labs - закрытая API-модель, которую нельзя запустить локально вообще. Midjourney v7 - тоже только облако. Stable Diffusion 3.5 Large имеет 8B параметров и работает локально, но с поддержкой прозрачности там сложнее.

Если Qwen-Image-2.1 действительно конкурентоспособна по качеству при локальном запуске на 3090, это серьезный аргумент для тех, кто не хочет платить за API или отправлять данные в облако. Улучшения в рендеринге текста, освещении портретов и точности воспроизведения людей и продуктов - конкретные направления, где предыдущие открытые модели традиционно уступали.

Для российских пользователей

Hugging Face периодически работает нестабильно без VPN из России, но сами веса модели можно скачать через зеркало ModelScope - китайская платформа, которая доступна без ограничений. GitHub тоже доступен. Для коммерческого лицензирования придется связываться с командой Qwen напрямую - как именно это устроено для российских компаний, пока неясно.

Что дальше

Архитектурные решения в Qwen-Image-2.1 - смешанное внимание, переиспользование кеша, нативный RGBA VAE - говорят о том, что команда думала об эффективности серьезно, а не просто масштабировала стандартный DiT. Если независимые тесты подтвердят заявленное качество, это станет одной из лучших открытых моделей для генерации изображений на сегодня.

Но лицензионный сдвиг с Apache на Research License - тревожный сигнал. Alibaba явно хочет контролировать коммерческое применение своих визуальных моделей, оставляя исследовательское сообщество с правом экспериментировать, но не строить на этом бизнес без отдельного разговора.

Информация о релизе подтверждена несколькими независимыми публикациями.

Все эти инструменты - уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости