FLUX 3 от Black Forest Labs: один мультимодальный монстр для всего

Два года ожидания — и это того стоило
Когда в 2024 году Black Forest Labs запустила FLUX 1, на их сайте красовался лес с намёком: видео следующее. Тогда многие скептически усмехнулись — ну да, «следующее», как у всех. Прошло два года, и команда не просто выкатила видеомодель, а сделала нечто принципиально иное. FLUX 3 — это не очередной апдейт с новыми разрешениями, а единая архитектура, которая одновременно работает с изображениями, видео, аудио и даже управляет роботами. Я давно слежу за BFL, и честно скажу: этого масштаба от них не ожидал.
Что такое Self Flow и почему это важно
В основе FLUX 3 лежит архитектура под названием Self Flow — совместное обучение всех модальностей в единой модели. Не «разные головы на одном туловище», как это часто бывает у мультимодальных систем, а действительно единое представление мира. Это принципиальное отличие от подхода, который использует, например, Google с Veo или тот же Kling от Kuaishou.
Что умеет FLUX 3 из коробки: генерация видео из текста, анимация статичных изображений, перенос персонажей из одного видео в новый контекст, продолжение видео с сохранением аудиодорожки, переходы между ключевыми кадрами и — что меня особенно зацепило — нативная генерация аудио для каждого выхода. То есть тишины по умолчанию больше нет, модель сразу думает о звуке как о части контента, а не как о постпродакшн-задаче.
Отдельно стоит выделить поддержку многоязычного диалога и генерацию типографики прямо в видео — задача, с которой большинство моделей до сих пор справляется отвратительно. Если BFL действительно решила её на уровне SOTA, это само по себе новость.
Бенчмарки: обошли всех громких
По заявлениям компании, FLUX 3 Video превосходит Seedance 2.0, Gemini Omni и Grok Imagine по ключевым метрикам качества генерации. Это серьёзные противники — особенно Grok Imagine, который xAI активно продвигал как флагман видеогенерации буквально несколько месяцев назад. Независимых бенчмарков пока нет — модель вышла в режиме раннего доступа, — но сообщество уже активно тестирует, и первые примеры выглядят убедительно.
Для контекста: Seedance 2.0 от ByteDance считался лучшим в классе по кинематографичности и когерентности движений. Если FLUX 3 реально его обходит, рынок генеративного видео только что перевернулся.
Роботы — это не маркетинг
Самая неожиданная часть анонса — FLUX-mimic, совместный проект с компанией Mimic Robotics. Команда взяла бэкбон FLUX 3 и адаптировала его для управления роботами с тонкой моторикой. Да, та самая модель, которая рисует картинки и генерирует видео, теперь предсказывает действия для физических манипуляторов.
Это не случайный пиар-ход. За этим стоит серьёзная идея: если модель научилась понимать физику мира достаточно хорошо, чтобы генерировать реалистичное видео с правильной динамикой объектов, она потенциально понимает причинно-следственные связи на уровне, достаточном для роботики. BFL, судя по всему, ставит на то, что world model — это не отдельная задача, а естественное следствие хорошей мультимодальной генерации.
Это перекликается с направлением, которое развивают DeepMind с Genie 2 и отчасти Physical Intelligence. Но FLUX-mimic — первый случай, когда публичная генеративная модель для медиа напрямую переносится в роботику без полной переработки архитектуры.
Открытые веса на подходе
BFL анонсировала Dev-версию с открытыми весами — и это меняет расклад для разработчиков кардинально. Если FLUX 1 стал де-факто стандартом для кастомных пайплайнов изображений благодаря открытости, то FLUX 3 с открытыми весами может сделать то же самое для видео. ComfyUI, Diffusers, локальные инсталляции — всё это станет доступно сообществу, которое умеет выжимать из открытых моделей максимум.
Для сравнения: Sora от OpenAI до сих пор закрыта и доступна только через API с серьёзными ограничениями. Runway и Kling — тоже закрытые сервисы. Открытый FLUX 3 в этом контексте — это не просто щедрость, а стратегическая ставка на экосистему.
Что это значит для российских пользователей
Ранний доступ к FLUX 3 Video сейчас доступен через официальный сайт BFL, но с оговорками. Сервис работает через браузер, однако оплата картами российских банков, скорее всего, недоступна — стандартная история для западных AI-стартапов. VPN понадобится для стабильного доступа к интерфейсу. Хорошая новость: когда выйдут открытые веса Dev-версии, всё это перестанет быть проблемой — модель можно будет запустить локально на достаточно мощном железе.
По предварительным оценкам, FLUX 3 потребует серьёзных ресурсов — видеокарты уровня RTX 4090 или выше для комфортной работы. Но сообщество уже работает над квантизацией, так что через пару месяцев после релиза открытых весов появятся облегчённые версии.
Мой вывод
BFL сделала то, о чём давно говорили теоретики, но никто не решался воплотить в одном продукте: единая модель для всех медиамодальностей плюс мост в физический мир через роботику. Это не просто «ещё одна видеомодель» — это заявка на совершенно другой класс систем. Посмотрим, подтвердят ли независимые тесты заявленное превосходство над конкурентами. Но даже если скидка на маркетинг составит 20%, FLUX 3 всё равно выглядит как один из главных релизов 2026 года.
Источники
Похожие новости
MiniMax H3: первая открытая модель на вершине видеорейтинга
Китайская MiniMax выложила веса модели H3 в открытый доступ — и та сразу возглавила мировой рейтинг по видеоредактированию, обогнав всех закрытых конкурентов.
ByteDance Seedance 2.5: 30 секунд видео с аудио за один проход
ByteDance выпустила Seedance 2.5 — ИИ-модель, которая генерирует 30-секундное видео вместе со звуком за один проход, втрое превышая возможности Google Gemini.
Google DeepMind: видеогенераторы уже содержат модели мира для компьютерного зрения
GenCeption от DeepMind превращает видеогенератор в универсальную систему компьютерного зрения — и обходит специализированных конкурентов, обучившись на в 500 раз меньшем объёме данных.