FLUX 3 от Black Forest Labs: мультимодальная модель для изображений, видео и аудио

Два года ожидания - и это того стоило
Когда в 2024 году Black Forest Labs запустила FLUX 1, на их сайте красовался лес с намеком: видео следующее. Тогда многие скептически усмехнулись - ну да, "следующее", как у всех. Прошло два года, и команда не просто выкатила видеомодель, а сделала нечто принципиально иное. FLUX 3 - это единая архитектура, которая работает с изображениями, видео и аудио одновременно. Я давно слежу за BFL, и честно скажу: этого масштаба от них не ожидал.
Что такое Self Flow и почему это важно
В основе FLUX 3 лежит архитектура под названием Self Flow - совместное обучение всех модальностей в единой модели. Это принципиальное отличие от подхода, который использует, например, Google с Veo или тот же Kling от Kuaishou.
Что умеет FLUX 3 из коробки: генерация видео из текста, анимация статичных изображений, перенос персонажей из одного видео в новый контекст, продолжение видео с сохранением аудиодорожки, переходы между ключевыми кадрами и - что меня особенно зацепило - нативная генерация аудио для каждого выхода. То есть тишины по умолчанию больше нет, модель сразу думает о звуке как о части контента, а не как о постпродакшн-задаче.
Отдельно стоит выделить поддержку многоязычного диалога и генерацию типографики прямо в видео - задача, с которой большинство моделей до сих пор справляется отвратительно. Если BFL действительно решила ее на уровне SOTA, это само по себе новость.
Бенчмарки: что говорят цифры
По заявлениям компании, в пользовательских сравнениях FLUX 3 Video получил предпочтение над Seedance 2.0 и Gemini Omni с результатом около 52%, а над Grok Imagine - 69%. Это серьезные противники, особенно Grok Imagine, который xAI активно продвигал как флагман видеогенерации буквально несколько месяцев назад. Независимых бенчмарков пока нет - модель вышла в режиме раннего доступа, - но сообщество уже активно тестирует, и первые примеры выглядят убедительно.
Для контекста: Seedance 2.0 от ByteDance считался лучшим в классе по кинематографичности и когерентности движений. Если FLUX 3 реально его обходит даже с небольшим отрывом, рынок генеративного видео только что перевернулся.
Роботы - это не маркетинг
Самая неожиданная часть анонса - FLUX-mimic, совместный проект с компанией Mimic Robotics. Mimic стала одним из первых партнеров, получивших ранний доступ к FLUX 3, и вместе с BFL разработала отдельную производную модель - video-action модель на базе бэкбона FLUX 3, адаптированную для управления роботами с тонкой моторикой.
Это не случайный пиар-ход. За этим стоит серьезная идея: если модель научилась понимать физику мира достаточно хорошо, чтобы генерировать реалистичное видео с правильной динамикой объектов, она потенциально понимает причинно-следственные связи на уровне, достаточном для роботики. BFL, судя по всему, ставит на то, что world model - это не отдельная задача, а естественное следствие хорошей мультимодальной генерации.
Это перекликается с направлением, которое развивают DeepMind с Genie 2 и отчасти Physical Intelligence. FLUX-mimic пока доступен только избранным партнерам, а не широкой публике.
Открытые веса на подходе
BFL анонсировала Dev-версию с открытыми весами, запланированную на более поздний срок, - и это меняет расклад для разработчиков кардинально. Если FLUX 1 стал де-факто стандартом для кастомных пайплайнов изображений благодаря открытости, то FLUX 3 с открытыми весами может сделать то же самое для видео. ComfyUI, Diffusers, локальные инсталляции - все это станет доступно сообществу, которое умеет выжимать из открытых моделей максимум.
Для сравнения: Sora от OpenAI до сих пор закрыта и доступна только через API с серьезными ограничениями. Runway и Kling - тоже закрытые сервисы. Открытый FLUX 3 в этом контексте - это не просто щедрость, а стратегическая ставка на экосистему.
Что это значит для российских пользователей
Ранний доступ к FLUX 3 Video на момент релиза предоставлялся через API и избранным партнерам - публичного браузерного интерфейса источники не подтверждают. Оплата картами российских банков, скорее всего, недоступна - стандартная история для западных AI-стартапов. Когда выйдут открытые веса Dev-версии, часть этих ограничений отпадет сама собой - модель можно будет запустить локально. Требования к железу BFL пока не публиковала.
Мой вывод
BFL сделала то, о чем давно говорили теоретики, но никто не решался воплотить в одном продукте: единая модель для всех медиамодальностей плюс мост в физический мир через отдельную роботическую производную. Посмотрим, подтвердят ли независимые тесты заявленное превосходство над конкурентами. Но даже если скидка на маркетинг составит 20%, FLUX 3 все равно выглядит как один из главных релизов 2026 года.
Источники
Похожие новости
YouTube добавил в Creator Studio ИИ-инструменты: анализ черновиков, умные превью, Gemini в Shorts
На ежегодном Made on YouTube платформа представила волну ИИ-инструментов для авторов: от анализа черновиков до живого перевода стримов с английского на испанский.
ByteDance запустил Dramagic: ИИ-конвейер от сценария до видео
ByteDance выпустил платформу Dramagic, которая закрывает весь цикл производства короткого видео. В Китае за первый квартал 2026 года вышло 128 000 мини-сериалов, 95% из них сгенерированы ИИ.
Runway исследует генерацию видео в реальном времени - потоком, кадр за кадром
Runway поделилась материалами о своих исследованиях в области мгновенной генерации видео: вместо ожидания готового клипа - потоковая трансляция кадр за кадром прямо во время ввода промпта.