К основному содержимому
#AI

Netflix's Big Bet: One model to rule recommentdations (AI)

#AI #Engineering #ML #Architecture #Software #Data

Посмотрел вчера интересное выступление Есу Фэна (Yesu Feng) из Netflix про использование генеративных foundation-моделей для персональных рекомендаций. Кстати, Yesu Feng до прихода в Netflix работал в LinkedIn над лентой новостей и в Uber над оптимизацией маркетплейса. Я выделил для себя следующие ключевые идеи

1. Единая foundation-модель для всей системы рекомендаций Вместо множества специализированных моделей (для разных страниц, жанров, форматов контента) Netflix переходит к одной "базовой" автогрес­сивной трансформер-модели, способной охватить все варианты использования. 2. Масштабирование как основной драйвер качества Они пришли к этому сформулировав две достаточно логичные гипотезы

  • При увеличении объёма данных и параметров модели персонализация улучшается по тем же законам масштабирования, что и у LLM.
  • Интеграция этой модели во все подсистемы создаёт синергетический эффект и ускоряет инновации. 3. Особенности данных и обучения В итоге, модель получилась многоуровневая
  • На базовом уровне ребята делали event representation: when, where (locale & device & canvas), what (action type & entity & duration related)
  • Дальше был уровень embedding/feature transformation - тут надо было объединять id embedding и дополнительные semantic embeddings, чтобы решать проблему холодного старта (например, новый контент)
  • Следующий уровень содержал transformer/attention - hidden state layers отсюда использовались в качестве user representation, надо было гарантировать стабильность репрезантации пользователей, также надо было уметь явно адаптироваться под разные цели пользователей, также надо было понять как агрегрировать разные уровни и разные sequence для получения этой репрезентации
  • На верхнем уровне располагалась objective loss function, которая была сложной - так как на выходе LLM было несколько последовательнотельностей (sequences) - это давало мультизадачностью на уровне функции потерь (предсказание типа действия, длительности сеанса, устройства и пр.) -- main objective: entity id -- auxiliary objectives: action types, entity metadate, duration, device, time -- reward, weight & mask 4. Уроки из мира LLM При построении LLM модели ребята набили ряд шишек и они поделились ими
  • Много­токенное предсказание для повышения устойчивости к временным сдвигам и фокусировки на долгосрочном поведении.
  • Многослойное представление и самодистилляция для стабильности эмбеддингов пользователя.
  • Обработка длинных контекстных окон через прогрессивное увеличение длины и разреженное внимание. 5. Сценарии применения foundation-модели Они пришли к следующим сценариям
  • Встраивание как подграф в downstream-модель.
  • Экспорт и обновление эмбеддингов пользователей и контента в центральном хранилище.
  • Дообучение или дистилляция для узкоспециализированных задач с жёсткими требованиями по задержке. 6. Результаты и выводы
  • Масштабирование модели от десятков миллионов до миллиарда параметров подтверждает закономерности роста качества при увеличении данных.
  • Внедрение единой модели привело к заметным A/B-выигрышам и консолидации инфраструктуры: ускорилась разработка новых функций и снизились дублирующиеся усилия.
  • Основная "ставка" Netflix полностью оправдала себя: foundation-модель оказалась масштабируемым и гибким решением для персонализации рекомендации.

Этот подход планируют развивать в следующих направлениях

  • Универсальные представления для гетерогенных сущностей (видео, игры, прямые трансляции и пр.).
  • Генеративный подбор коллекций при помощи многошагового декодирования.
  • Быстрая адаптация через prompt-тюнинг и «мягкие» токены для оперативной смены целей модели.

#AI #Engineering #ML #Architecture #Software #Data