LAION открыл крупнейший видеодатасет: 80 млн видео и 10 млн часов

Когда открытые данные меняют правила игры
Есть события, которые переворачивают расстановку сил в исследовательском сообществе. Релиз LAION Big Video Dataset (BVD) - именно из таких. Пока крупнейшие лаборатории мира - OpenAI, Google DeepMind, Meta - обучают свои видеомодели на закрытых корпусах, к которым никто снаружи не имеет доступа, LAION делает принципиально другой ход: выкладывает в открытый доступ 80 миллионов видео общей продолжительностью 10 миллионов часов. Это не просто большой датасет. Это попытка выровнять поле для академических исследователей, которые до сих пор вынуждены были работать с игрушечными выборками.
Что внутри BVD
Основой датасета послужили 1,3 миллиарда видеоссылок, извлеченных из CommonCrawl - масштабного веб-архива, который регулярно индексирует значительную часть публичного интернета. Из этого массива команда LAION скачала 80 миллионов видеофайлов и затем применила контентно-ориентированную сегментацию сцен: каждое видео разбивается на смысловые клипы с учетом смены визуальной картинки.
Результат - 55 миллионов клипов с автоматически сгенерированными описаниями как для видеоряда, так и для аудиодорожки. Плюс отдельный аудиосабсет на 10 миллионов клипов и 300 миллионов кадров-изображений, отобранных в точках смены сцены. Примечательно, что визуальное распределение этих кадров, по данным авторов, отличается от стандартных веб-корпусов изображений - то есть это не просто скриншоты из YouTube, а осмысленно отобранный материал.
Основная часть контента - англоязычные видео с YouTube, что важно учитывать при оценке потенциальных языковых и культурных смещений модели.
Производительность: InternVid повержен
Чтобы датасет не был просто хранилищем байтов без практической ценности, LAION обучила на нем базовую видеоязыковую модель - ViCLIP-L/14 с 400 миллионами параметров (лицензия MIT). Результаты говорят сами за себя: на стандартных бенчмарках видео-к-тексту модель, обученная на BVD, обгоняет аналоги, обученные на InternVid, на 2,1 процентных пункта.
Конкретные цифры: 63,3% top-1 на Kinetics-400, 80,5% на UCF-101, 60,4% на HMDB51 и 42,7% recall@1 на MSR-VTT для задачи видеопоиска. InternVid долгое время считался золотым стандартом открытых видеодатасетов - и вот его планка преодолена.
Важный методологический момент: обучение объединяет видео, аудио и текст в единое мультимодальное пространство. Модель учится понимать, какой визуальный контент соответствует каким описаниям и звукам - именно такой подход используют коммерческие лидеры вроде Sora и Veo 3.
Доступ: открыто, но не для всех
Схема доступа двухуровневая. URL-списки и метаданные (репозитории `laion/BVD-URLs` и `laion/BVD-V-55M-URLs`) полностью открыты на Hugging Face - любой исследователь может начать работу немедленно. Однако субсеты с реальными медиафайлами - включая BVD-V-55M и полный BVD-RAW - закрыты за заявочной формой: нужно запросить доступ вручную, ожидание занимает несколько дней.
По объему: только субсет из 55 миллионов клипов занимает 41,1 терабайта на Hugging Face. Это серьезная инфраструктурная нагрузка, и у большинства академических команд просто нет ресурсов для хранения полного корпуса. Именно поэтому LAION предлагает работать с URL-списками и скачивать только нужный срез данных.
Правовая сторона вопроса
Здесь все непросто, и LAION это прекрасно понимает. Датасет выпускается исключительно для некоммерческих исследований - коммерческое использование прямо запрещено. Правовую базу организация, судя по всему, строит на решении Гамбургского окружного суда 2024 года, которое допустило сбор охраняемых авторским правом материалов для некоммерческих исследовательских целей.
LAION также просит пользователей уважать права авторов оригинального контента и соблюдать условия использования платформ-источников. Звучит как разумный компромисс, хотя юридическая ситуация в разных юрисдикциях может отличаться - американские правообладатели уже неоднократно судились с ИИ-компаниями именно за обучающие данные.
Что это значит для индустрии
Я слежу за LAION с момента их первых релизов, и каждый раз организация делает одно и то же: берет то, что крупные игроки держат под замком, и выкладывает в открытый доступ. LAION-400M изменил ландшафт работы с изображениями, LAION-5B дал толчок развитию Stable Diffusion. BVD может сделать то же самое для видео.
До сих пор академические команды, работающие с видеомоделями, были вынуждены использовать либо маленькие кураторские датасеты (WebVid, MSVD, ActivityNet), либо вообще обходиться без видеопредобучения. BVD впервые дает им корпус, сопоставимый по масштабу с тем, что используют коммерческие лаборатории.
Для российских исследователей: проект доступен через Hugging Face и официальный сайт LAION, VPN не требуется для получения URL-списков. Доступ к медиасабсетам требует регистрации и ручного одобрения - стандартная процедура для крупных открытых датасетов.
Прогноз
Жду, что в течение следующих 6-12 месяцев на основе BVD появится несколько открытых видеомоделей, которые существенно приблизятся по качеству к коммерческим решениям. Комбинация масштаба данных, готовой базовой модели с MIT-лицензией и открытого кода создает идеальные условия для быстрого прогресса. Сообщество не заставит себя ждать.
Информация о релизе подтверждена несколькими независимыми публикациями.
Источники
Похожие новости
Gemini научился смотреть видео по-умному: минус 88% токенов
Google запустила агентный анализ видео для Gemini Flash - модель сама решает, какие фрагменты смотреть, и экономит до 88% токенов при росте точности.
Runway Solaris: ИИ генерирует интерфейсы прямо в реальном времени
Runway представила Solaris - систему, которая рисует интерфейс приложения кадр за кадром без единой строки кода. Конец эпохи фиксированных приложений?
Fal H3 Max Live: видео генерируется быстрее, чем вы его смотрите
Fal разогнал модель Minimax H3 в 35 раз и сломал главный барьер видеогенерации - теперь ИИ создает кадры быстрее реального времени. Что это меняет?