Gemini научился смотреть видео по-умному: минус 88% токенов

Представьте, что вы наняли аналитика, который вместо просмотра трехчасовой записи совещания с начала до конца сразу перематывает к нужным моментам, слушает только ключевые фрагменты и выдает выжимку. Именно так теперь работает Gemini с видео - и это не метафора, а буквальное описание архитектурного решения, которое Google представила 1-2 сентября 2026 года.
Что изменилось и почему это важно
До сих пор Gemini обрабатывал видео статически: один кадр в секунду по умолчанию, последовательно, от первого до последнего. Разработчики могли менять частоту через API, но сама логика оставалась линейной - модель "смотрела" все подряд, не задумываясь о том, нужен ли ей этот конкретный момент. Для десятиминутного ролика это терпимо. Для девяностоминутной лекции или многочасовой записи с камеры наблюдения - катастрофа с точки зрения стоимости.
Теперь Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite получили режим агентного понимания видео. Модель сама определяет, какие отрезки заслуживают внимания, с какой скоростью их просматривать и через какую модальность - визуальные кадры, аудиодорожка или транскрипт. Это не просто оптимизация промпта, а принципиально иная архитектура взаимодействия модели с видеоконтентом.
Цифры, которые трудно игнорировать
Google приводит конкретные показатели по стандартным бенчмаркам видеопонимания. На 1H-VideoQA и LVBench потребление токенов падает на 88%, стоимость обработки снижается на 66%, а точность при этом вырастает на 7%. На LongVideoBench Gemini 3.7 Flash с агентным режимом занимает первое место по соотношению качества и стоимости.
Эти цифры подтверждены несколькими независимыми публикациями, так что речь не о маркетинговой подаче в вакууме. 88% экономии токенов - это не "до 10% при идеальных условиях", это реальный порядок величин на длинных видео.
Для разработчиков, которые сейчас платят за обработку часовых записей, это буквально меняет экономику продукта. Задачи, которые раньше были нерентабельными - автоматический анализ архивов видеонаблюдения, индексация обучающих курсов, поиск по многочасовым стримам - внезапно становятся вполне разумными по бюджету.
Как это работает технически
Агентный режим строится на концепции "agentic vision", которую Google впервые представила для Gemini 3 Flash в январе 2026 года. Тогда модель научилась писать и выполнять Python-код для работы с изображениями - зумировать, кадрировать, аннотировать - в цикле "думать-действовать-наблюдать". Теперь та же логика распространяется на видео.
Практически это выглядит так: модель через внутренний инструмент загружает только релевантные фрагменты видеофайла, а не весь поток целиком. Вместо фиксированной частоты кадров - динамический цикл, в котором Gemini сам запрашивает нужные кадры, аудио или транскрипт из нужных временных отрезков.
Особо выделю несколько новых возможностей, которые стали практически реализуемыми:
- Субсекундный поиск момента: модель находит события короче одной секунды - смену состояния, монтажный стык, мгновенный жест. При фиксированном 1 FPS такие события просто пропадали. - Переменная частота дискретизации: подозрительный временной отрезок модель автоматически пересканирует с повышенной детализацией. - Точный счетчик: корректный подсчет повторяющихся движений и объектов на протяжении длинного видео - задача, которая раньше ломалась на длинных роликах.
Доступность и стоимость
Функция уже работает через Gemini API в Google AI Studio и на Gemini Enterprise Agent Platform - для загружаемых видеофайлов и YouTube-ссылок. Активируется одним параметром в конфиге API: режим обработки переключается на `"agentic"`. Дополнительной платы нет - тарификация идет по стандартным токенным ценам, которые, впрочем, теперь расходуются кратно эффективнее.
Интеграция в потребительское приложение Gemini и YouTube пока не запущена - запланирована на более поздний срок. Для российских разработчиков ситуация стандартная: Gemini API технически доступен через VPN, оплата требует нероссийской карты или Google Cloud billing через посредника.
Контекст и конкуренция
GPT-4o от OpenAI и Claude 3.7 от Anthropic тоже умеют работать с видео, но оба используют преимущественно статическую или полустатическую обработку. Динамический агентный подход, где модель сама управляет стратегией просмотра, - это то, чего у конкурентов пока публично не заявлено в таком виде.
Gemini 3.7 Flash при этом позиционируется не как топовая модель для сложных рассуждений (это зона Gemini Ultra), а как рабочая лошадка для высоконагруженных пайплайнов. Агентный видеоанализ органично ложится именно в эту нишу: дешевая, быстрая, точная обработка больших объемов видеоконтента.
Меня в этом релизе больше всего впечатляет не сама экономия токенов, а то, что модель теперь принимает эпистемические решения о видео - она не просто обрабатывает поток, а выбирает, что именно смотреть. Это качественный сдвиг в том, как языковые модели взаимодействуют с временными медиа. И судя по тому, что Google планирует интеграцию в YouTube, это только начало.
Информация подтверждена несколькими независимыми публикациями, включая официальный блог Google DeepMind.
Источники
Похожие новости
Runway Solaris: ИИ генерирует интерфейсы прямо в реальном времени
Runway представила Solaris - систему, которая рисует интерфейс приложения кадр за кадром без единой строки кода. Конец эпохи фиксированных приложений?
Fal H3 Max Live: видео генерируется быстрее, чем вы его смотрите
Fal разогнал модель Minimax H3 в 35 раз и сломал главный барьер видеогенерации - теперь ИИ создает кадры быстрее реального времени. Что это меняет?
LAION открыл крупнейший видеодатасет: 80 млн видео и 10 млн часов
Некоммерческая организация LAION выпустила Big Video Dataset - один из крупнейших открытых наборов данных для обучения видеомоделей, побивший предыдущий эталон InternVid.