Google DeepMind: видеогенераторы уже содержат модели мира для компьютерного зрения

Когда побочный эффект оказывается главным открытием
Есть красивая история про языковые модели: они научились понимать мир просто потому, что предсказывали следующий токен. Никто специально не закладывал в них знание грамматики, логики или физики — всё это появилось как побочный эффект обучения на огромных текстовых корпусах. Теперь исследователи из Google DeepMind задают провокационный вопрос: а не происходит ли то же самое с видеогенераторами?
Ответ, который они предлагают в своей работе, принятой на Европейскую конференцию по компьютерному зрению, — скорее всего, да. И подтверждают это вполне конкретной системой.
Что такое GenCeption и как он устроен
GenCeption — это не очередная специализированная модель для одной задачи. Это единая архитектура, которая умеет делать оценку глубины, сегментацию, восстановление позы камеры, отслеживание ключевых точек человека и определение нормалей поверхности — всё через один и тот же проход по сети, управляемый текстовым промптом.
Основа системы — открытая видеомодель Wan2.1 от Alibaba. Ключевое архитектурное решение: классические диффузионные модели генерируют видео через десятки итеративных шагов, размывая и уточняя изображение. GenCeption делает это за один прямой проход — что принципиально для практического применения в компьютерном зрении, где скорость критична.
Элегантность подхода — в унификации форматов вывода. Карта глубины, маска сегментации, карта нормалей — всё это представляется как стандартное трёхканальное RGB-изображение. Текстовый промпт играет роль инструкции: хочешь глубину — напиши «depth», хочешь сегментацию — «segmentation». Для задач, где выход не является изображением (например, 3D-ключевые точки), добавляются отдельные обучаемые модули.
Данные — вот где начинается самое интересное
Обучение GenCeption — это отдельная история, которая меня как эксперта впечатляет больше, чем сами бенчмарки. Основной датасет состоит всего из 7 500 синтетических видео, созданных из комбинации 800 цифровых моделей людей и 200 последовательностей движений из датасета захвата движения, отрендеренных в Blender.
Для сравнения: конкурирующие системы вроде D4RT и VGGT-Omega требуют на от 7 до 500 раз больше обучающих данных для достижения сопоставимой точности. Это не просто академический результат — это прямое указание на то, что видеопретренинг формирует принципиально другие представления о пространстве и геометрии, которые потом очень дёшево адаптируются под конкретные задачи.
По точности GenCeption, по данным авторов, конкурентоспособен или превосходит специализированные системы — DepthAnything3, SAM3, Sapiens, Lotus-2 и другие. Оговорка честная: независимой перепроверки этих сравнений ещё не было, и неизвестно, были ли базовые модели дополнительно дотюнены для этого сравнения.
Генерализация как главный аргумент
Самый сильный довод в пользу тезиса DeepMind — это не бенчмарки, а способность к обобщению. Модель, обученная исключительно на синтетических видео с людьми, без дополнительного дообучения:
- корректно работает на реальных видеозаписях - обобщается на сцены с несколькими людьми, хотя видела только одного - переносит навыки на категории, которых не было в обучении — животных и роботов
Это именно то поведение, которое мы наблюдаем у хороших языковых моделей: обучился на книгах — понимаешь разговорную речь. Если видеогенератор научился синтезировать физически правдоподобные движения и глубину сцены, он неизбежно построил внутреннее представление о трёхмерном мире — и это представление оказывается переносимым.
Почему компьютерное зрение всё ещё «отстаёт» от NLP
В NLP произошла унификация: трансформер с предобучением на огромных текстах стал универсальным бэкбоном для почти всего. В компьютерном зрении такой универсализации не случилось. «Segment Anything» сегментирует, «Depth Anything» оценивает глубину — у каждой задачи своя архитектура, свой пайплайн, своя разметка данных. Это дорого, медленно масштабируется и создаёт операционный кошмар для команд, которым нужны все эти функции одновременно.
GPT-момент для компьютерного зрения — это когда появится одна модель, которая делает всё. DeepMind утверждает, что видеогенераторы — это и есть тот самый недостающий общий претренинг.
Что это значит на практике
Для разработчиков и ML-инженеров: если тезис подтвердится при независимой репликации, это меняет экономику проектов компьютерного зрения. Вместо трёх отдельных моделей с тремя отдельными датасетами — один бэкбон с несколькими головами, дообученными на синтетических данных. Стоимость разметки резко падает.
Для бизнеса: автономные системы, роботика, медицинская визуализация, AR — все эти области выиграют, если удастся поддерживать одну модель вместо зоопарка специализированных систем.
Для российской аудитории: GenCeption пока существует только как исследовательская работа, API или продукта нет. Базовая модель Wan2.1 от Alibaba доступна на HuggingFace без ограничений, так что российские исследователи могут воспроизводить эксперименты самостоятельно — VPN для этого не нужен.
Спорный тезис с сильными доказательствами
Авторы честно называют вещи своими именами: идея о том, что видеогенераторы содержат модели мира, остаётся дискуссионной в академическом сообществе. GenCeption — это аргумент в этой дискуссии, а не закрытый вопрос.
Но аргумент сильный. Когда модель, обученная на синтетических людях в Blender, правильно определяет глубину у реального кота на реальном видео — это не случайность. Это признак того, что внутри видеогенератора действительно живёт что-то похожее на понимание физического мира.
Я слежу за этим направлением несколько лет, и у меня ощущение, что мы находимся примерно там, где NLP был в 2018-м — перед тем, как GPT-2 показал, что масштаб меняет всё. Если кто-то возьмёт эту идею и обучит видеогенератор в сто раз большего масштаба с той же логикой, результаты могут оказаться неожиданными.
Информация подтверждена несколькими независимыми публикациями, освещавшими выход этой исследовательской работы.
Источники
Похожие новости
MiniMax H3: первая открытая модель на вершине видеорейтинга
Китайская MiniMax выложила веса модели H3 в открытый доступ — и та сразу возглавила мировой рейтинг по видеоредактированию, обогнав всех закрытых конкурентов.
ByteDance Seedance 2.5: 30 секунд видео с аудио за один проход
ByteDance выпустила Seedance 2.5 — ИИ-модель, которая генерирует 30-секундное видео вместе со звуком за один проход, втрое превышая возможности Google Gemini.
FLUX 3 от Black Forest Labs: один мультимодальный монстр для всего
Black Forest Labs выпустила FLUX 3 — единую мультимодальную модель для изображений, видео, аудио и управления роботами, которая уже обходит Seedance 2.0 и Grok Imagine.