G
ВидеоGoogle DeepMindGenCeptionкомпьютерное зрениеWan2.1world model

Google DeepMind: видеогенераторы уже содержат модели мира для компьютерного зрения

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·5 мин чтения
Google DeepMind: видеогенераторы уже содержат модели мира для компьютерного зрения

Когда побочный эффект оказывается главным открытием

Есть красивая история про языковые модели: они научились понимать мир просто потому, что предсказывали следующий токен. Никто специально не закладывал в них знание грамматики, логики или физики — всё это появилось как побочный эффект обучения на огромных текстовых корпусах. Теперь исследователи из Google DeepMind задают провокационный вопрос: а не происходит ли то же самое с видеогенераторами?

Ответ, который они предлагают в своей работе, принятой на Европейскую конференцию по компьютерному зрению, — скорее всего, да. И подтверждают это вполне конкретной системой.

Что такое GenCeption и как он устроен

GenCeption — это не очередная специализированная модель для одной задачи. Это единая архитектура, которая умеет делать оценку глубины, сегментацию, восстановление позы камеры, отслеживание ключевых точек человека и определение нормалей поверхности — всё через один и тот же проход по сети, управляемый текстовым промптом.

Основа системы — открытая видеомодель Wan2.1 от Alibaba. Ключевое архитектурное решение: классические диффузионные модели генерируют видео через десятки итеративных шагов, размывая и уточняя изображение. GenCeption делает это за один прямой проход — что принципиально для практического применения в компьютерном зрении, где скорость критична.

Элегантность подхода — в унификации форматов вывода. Карта глубины, маска сегментации, карта нормалей — всё это представляется как стандартное трёхканальное RGB-изображение. Текстовый промпт играет роль инструкции: хочешь глубину — напиши «depth», хочешь сегментацию — «segmentation». Для задач, где выход не является изображением (например, 3D-ключевые точки), добавляются отдельные обучаемые модули.

Данные — вот где начинается самое интересное

Обучение GenCeption — это отдельная история, которая меня как эксперта впечатляет больше, чем сами бенчмарки. Основной датасет состоит всего из 7 500 синтетических видео, созданных из комбинации 800 цифровых моделей людей и 200 последовательностей движений из датасета захвата движения, отрендеренных в Blender.

Для сравнения: конкурирующие системы вроде D4RT и VGGT-Omega требуют на от 7 до 500 раз больше обучающих данных для достижения сопоставимой точности. Это не просто академический результат — это прямое указание на то, что видеопретренинг формирует принципиально другие представления о пространстве и геометрии, которые потом очень дёшево адаптируются под конкретные задачи.

По точности GenCeption, по данным авторов, конкурентоспособен или превосходит специализированные системы — DepthAnything3, SAM3, Sapiens, Lotus-2 и другие. Оговорка честная: независимой перепроверки этих сравнений ещё не было, и неизвестно, были ли базовые модели дополнительно дотюнены для этого сравнения.

Генерализация как главный аргумент

Самый сильный довод в пользу тезиса DeepMind — это не бенчмарки, а способность к обобщению. Модель, обученная исключительно на синтетических видео с людьми, без дополнительного дообучения:

- корректно работает на реальных видеозаписях - обобщается на сцены с несколькими людьми, хотя видела только одного - переносит навыки на категории, которых не было в обучении — животных и роботов

Это именно то поведение, которое мы наблюдаем у хороших языковых моделей: обучился на книгах — понимаешь разговорную речь. Если видеогенератор научился синтезировать физически правдоподобные движения и глубину сцены, он неизбежно построил внутреннее представление о трёхмерном мире — и это представление оказывается переносимым.

Почему компьютерное зрение всё ещё «отстаёт» от NLP

В NLP произошла унификация: трансформер с предобучением на огромных текстах стал универсальным бэкбоном для почти всего. В компьютерном зрении такой универсализации не случилось. «Segment Anything» сегментирует, «Depth Anything» оценивает глубину — у каждой задачи своя архитектура, свой пайплайн, своя разметка данных. Это дорого, медленно масштабируется и создаёт операционный кошмар для команд, которым нужны все эти функции одновременно.

GPT-момент для компьютерного зрения — это когда появится одна модель, которая делает всё. DeepMind утверждает, что видеогенераторы — это и есть тот самый недостающий общий претренинг.

Что это значит на практике

Для разработчиков и ML-инженеров: если тезис подтвердится при независимой репликации, это меняет экономику проектов компьютерного зрения. Вместо трёх отдельных моделей с тремя отдельными датасетами — один бэкбон с несколькими головами, дообученными на синтетических данных. Стоимость разметки резко падает.

Для бизнеса: автономные системы, роботика, медицинская визуализация, AR — все эти области выиграют, если удастся поддерживать одну модель вместо зоопарка специализированных систем.

Для российской аудитории: GenCeption пока существует только как исследовательская работа, API или продукта нет. Базовая модель Wan2.1 от Alibaba доступна на HuggingFace без ограничений, так что российские исследователи могут воспроизводить эксперименты самостоятельно — VPN для этого не нужен.

Спорный тезис с сильными доказательствами

Авторы честно называют вещи своими именами: идея о том, что видеогенераторы содержат модели мира, остаётся дискуссионной в академическом сообществе. GenCeption — это аргумент в этой дискуссии, а не закрытый вопрос.

Но аргумент сильный. Когда модель, обученная на синтетических людях в Blender, правильно определяет глубину у реального кота на реальном видео — это не случайность. Это признак того, что внутри видеогенератора действительно живёт что-то похожее на понимание физического мира.

Я слежу за этим направлением несколько лет, и у меня ощущение, что мы находимся примерно там, где NLP был в 2018-м — перед тем, как GPT-2 показал, что масштаб меняет всё. Если кто-то возьмёт эту идею и обучит видеогенератор в сто раз большего масштаба с той же логикой, результаты могут оказаться неожиданными.

Информация подтверждена несколькими независимыми публикациями, освещавшими выход этой исследовательской работы.

Все эти инструменты — уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости