B
ВидеоFLUX 3Black Forest Labsмультимодальные моделиAI-видеороботика

FLUX 3 от Black Forest Labs: мультимодальная модель для изображений, видео и аудио

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения
FLUX 3 от Black Forest Labs: мультимодальная модель для изображений, видео и аудио

Два года ожидания - и это того стоило

Когда в 2024 году Black Forest Labs запустила FLUX 1, на их сайте красовался лес с намеком: видео следующее. Тогда многие скептически усмехнулись - ну да, "следующее", как у всех. Прошло два года, и команда не просто выкатила видеомодель, а сделала нечто принципиально иное. FLUX 3 - это единая архитектура, которая работает с изображениями, видео и аудио одновременно. Я давно слежу за BFL, и честно скажу: этого масштаба от них не ожидал.

Что такое Self Flow и почему это важно

В основе FLUX 3 лежит архитектура под названием Self Flow - совместное обучение всех модальностей в единой модели. Это принципиальное отличие от подхода, который использует, например, Google с Veo или тот же Kling от Kuaishou.

Что умеет FLUX 3 из коробки: генерация видео из текста, анимация статичных изображений, перенос персонажей из одного видео в новый контекст, продолжение видео с сохранением аудиодорожки, переходы между ключевыми кадрами и - что меня особенно зацепило - нативная генерация аудио для каждого выхода. То есть тишины по умолчанию больше нет, модель сразу думает о звуке как о части контента, а не как о постпродакшн-задаче.

Отдельно стоит выделить поддержку многоязычного диалога и генерацию типографики прямо в видео - задача, с которой большинство моделей до сих пор справляется отвратительно. Если BFL действительно решила ее на уровне SOTA, это само по себе новость.

Бенчмарки: что говорят цифры

По заявлениям компании, в пользовательских сравнениях FLUX 3 Video получил предпочтение над Seedance 2.0 и Gemini Omni с результатом около 52%, а над Grok Imagine - 69%. Это серьезные противники, особенно Grok Imagine, который xAI активно продвигал как флагман видеогенерации буквально несколько месяцев назад. Независимых бенчмарков пока нет - модель вышла в режиме раннего доступа, - но сообщество уже активно тестирует, и первые примеры выглядят убедительно.

Для контекста: Seedance 2.0 от ByteDance считался лучшим в классе по кинематографичности и когерентности движений. Если FLUX 3 реально его обходит даже с небольшим отрывом, рынок генеративного видео только что перевернулся.

Роботы - это не маркетинг

Самая неожиданная часть анонса - FLUX-mimic, совместный проект с компанией Mimic Robotics. Mimic стала одним из первых партнеров, получивших ранний доступ к FLUX 3, и вместе с BFL разработала отдельную производную модель - video-action модель на базе бэкбона FLUX 3, адаптированную для управления роботами с тонкой моторикой.

Это не случайный пиар-ход. За этим стоит серьезная идея: если модель научилась понимать физику мира достаточно хорошо, чтобы генерировать реалистичное видео с правильной динамикой объектов, она потенциально понимает причинно-следственные связи на уровне, достаточном для роботики. BFL, судя по всему, ставит на то, что world model - это не отдельная задача, а естественное следствие хорошей мультимодальной генерации.

Это перекликается с направлением, которое развивают DeepMind с Genie 2 и отчасти Physical Intelligence. FLUX-mimic пока доступен только избранным партнерам, а не широкой публике.

Открытые веса на подходе

BFL анонсировала Dev-версию с открытыми весами, запланированную на более поздний срок, - и это меняет расклад для разработчиков кардинально. Если FLUX 1 стал де-факто стандартом для кастомных пайплайнов изображений благодаря открытости, то FLUX 3 с открытыми весами может сделать то же самое для видео. ComfyUI, Diffusers, локальные инсталляции - все это станет доступно сообществу, которое умеет выжимать из открытых моделей максимум.

Для сравнения: Sora от OpenAI до сих пор закрыта и доступна только через API с серьезными ограничениями. Runway и Kling - тоже закрытые сервисы. Открытый FLUX 3 в этом контексте - это не просто щедрость, а стратегическая ставка на экосистему.

Что это значит для российских пользователей

Ранний доступ к FLUX 3 Video на момент релиза предоставлялся через API и избранным партнерам - публичного браузерного интерфейса источники не подтверждают. Оплата картами российских банков, скорее всего, недоступна - стандартная история для западных AI-стартапов. Когда выйдут открытые веса Dev-версии, часть этих ограничений отпадет сама собой - модель можно будет запустить локально. Требования к железу BFL пока не публиковала.

Мой вывод

BFL сделала то, о чем давно говорили теоретики, но никто не решался воплотить в одном продукте: единая модель для всех медиамодальностей плюс мост в физический мир через отдельную роботическую производную. Посмотрим, подтвердят ли независимые тесты заявленное превосходство над конкурентами. Но даже если скидка на маркетинг составит 20%, FLUX 3 все равно выглядит как один из главных релизов 2026 года.

Источники

Все эти инструменты - уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости