N
ИИ-чатNetflixGenRecрекомендательные системыязыковые моделиперсонализация

Netflix тестирует языковую модель как альтернативу ручной логике рекомендаций: что такое GenRec

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения
Netflix тестирует языковую модель как альтернативу ручной логике рекомендаций: что такое GenRec

Конец эпохи ручных фичей

Представьте себе команду инженеров, которая годами вручную прописывала тысячи параметров - жанровые предпочтения, время просмотра, реакция на трейлеры, поведение в выходные против будних дней. Это и есть то, как Netflix строил свои рекомендации последние годы. Теперь компания тестирует альтернативу: внутренний проект GenRec показал, что языковая модель справляется лучше продакшн-ранжировщика - и при этом требует в 40 раз меньше размеченных данных на ключевом этапе обучения.

Это не просто технический эксперимент. Это сигнал всей индустрии о том, куда движется персонализация.

Что такое GenRec и как это работает

GenRec - не ChatGPT, встроенный в каталог. Это двухэтапная система, выстроенная поверх неназванной открытой языковой модели. На первом этапе модель дообучается на данных Netflix - она начинает "понимать" каталог, поведение пользователей, специфику платформы. На втором этапе из нее делают конкретно ранжировщик рекомендаций, и этот этап обновляется значительно чаще, чтобы успевать за новинками и меняющимися вкусами аудитории.

Главный трюк - в том, как представляются данные о пользователе. Вместо плотных числовых векторов и хитро сконструированных признаков история просмотров превращается в обычный текст. Досмотрел сериал до конца за два дня - это одна фраза. Поставил лайк, но бросил на третьей серии - другая. Netflix фильтрует эти события агрессивно: длинные сессии передаются в деталях, случайные клики и беглые скроллы отбрасываются, марафоны сжимаются. Модель сама улавливает паттерны - жанровые предпочтения, смену интересов со временем - без того, чтобы кто-то их явно прописывал.

Техническая изящность: один проход, без галлюцинаций

Одна из главных проблем с обычными языковыми моделями в роли рекомендательных систем - они начинают советовать контент, которого не существует. Hallucinations в контексте каталога - это катастрофа. Netflix решил это отдельным компонентом, который ограничивает модель только реальными позициями каталога. Модель не генерирует текст - она скорит существующие варианты за один проход, используя vLLM в специальном режиме. Это радикально снижает вычислительные затраты.

Интересный нюанс с контекстным окном: Netflix обнаружил, что за пределами определенной длины каждое дополнительное событие в промпте почти не улучшает качество ранжирования, но добавляет вычислительные расходы. То есть существует практический оптимум - и компания его нашла.

Цифры: скромно, но убедительно

Результаты офлайн-тестирования показали улучшение качества ранжирования примерно на 1,6% по сравнению с продакшн-системой, которую полировали годами. Звучит не сенсационно, но в масштабе Netflix с его ~300 миллионами подписчиков даже такой прирост статистически значим.

Четырехнедельный A/B-тест на реальных пользователях - примерно 10% трафика - подтвердил офлайн-результаты. Это принципиально: часто модели хорошо выглядят в лабораторных условиях и разочаровывают в продакшне. Здесь корреляция сохранилась.

Отдельно впечатляет экономия на разметке данных. В 40 раз меньше примеров для второго этапа обучения - это означает, что систему можно быстрее адаптировать к новым типам контента: играм, подкастам, живым трансляциям. Именно это узкое место усложняло старую архитектуру - каждый новый формат требовал новых вручную прописанных признаков.

Почему это важнее, чем кажется

Я слежу за рекомендательными системами давно, и вот что меня здесь цепляет: Netflix движется к языковым моделям как альтернативе hand-crafted feature engineering. Большинство компаний держатся за legacy-системы из инерции и корпоративной политики.

Сравните с тем, что делают конкуренты. Spotify уже несколько лет экспериментирует с трансформерами для музыкальных рекомендаций. YouTube использует двухбашенные нейросети, где одна башня кодирует пользователя, другая - контент. Но перевод всего поведения пользователя в plain text как интерфейс - это более радикальный шаг, чем кажется. Это означает, что можно использовать общие достижения в обучении языковых моделей напрямую, без специальной архитектурной работы.

Для разработчиков рекомендательных систем это сигнал пересмотреть свои стеки. Если у вас есть приложение с историей взаимодействий - игра, маркетплейс, стриминг - текстовое представление событий может оказаться неожиданно мощным.

Ограничения и честность Netflix

GenRec пока тестируется как альтернатива продакшн-ранжировщику, а не полная замена существующей системы. Вопросы масштабируемости, задержек и стоимости инференса в полном продакшне остаются открытыми.

Также стоит понимать: 40-кратная экономия на размеченных данных относится конкретно ко второму этапу обучения - не ко всему пайплайну. Первый этап, адаптация базовой языковой модели к данным Netflix, требует своих ресурсов, о которых компания публично не говорит.

Что дальше

Netflix прямо заявляет, что видит в этом часть более широкого перехода к универсальным языковым моделям вместо специализированных архитектур. Это логично: по мере того как базовые модели становятся мощнее и дешевле, тонкая настройка под конкретную задачу становится все более привлекательной альтернативой строительству с нуля.

Для российских разработчиков и исследователей: подход GenRec воспроизводим с открытыми моделями - Llama, Mistral, Qwen. Главная ценность здесь не в конкретной модели, а в архитектурном решении: текстовое представление поведения пользователя плюс двухэтапное обучение плюс ограничение выдачи реальным каталогом. Это можно адаптировать для любого рекомендательного сервиса, работающего в любой юрисдикции.

Источники

Все эти инструменты - уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости