Yann LeCun про JEPA: предсказывать не пиксели, а состояние мира (Рубрика AI)
Посмотрел лекцию Яна Лекуна «World Models: Enabling the Next AI Revolution», прочитанную 29 мая 2026 года в ETH Zurich. Получился почти исследовательский манифест: для физического мира недостаточно генерировать следующий токен - нужно строить абстрактное состояние мира, предсказывать последствия действий и уже поверх этого планировать. Кстати, Ян Лекун в конце прошлого года ушел из запрещенной в России компании Meta, где он долгое время был Chief Scientist (я как-то даже писал об этом).
Лекун продолжает свой давний спор с мейнстримом в виде LLM. В предобучении авторегрессионная модель минимизирует cross-entropy следующего токена - повышает вероятность правильного продолжения. Instruction tuning (SFT), обучение на предпочтениях (RLHF), reinforcement learning и дистилляция меняют поведение, но в основе остается то же предсказание следующего токена. По Лекуну, для сильного языкового интерфейса этого достаточно, а для модели физического мира - нет. Оговорюсь: это не консенсус. Reasoning-модели, поиск и инструменты делают границу менее абсолютной, но сам контраст помогает понять, зачем нужна JEPA.
В Joint Embedding Predictive Architecture меняется объект предсказания:
- Context encoder переводит видимую часть X в векторное представление;
- Target encoder кодирует скрытый фрагмент или будущее состояние Y;
- Predictor по X и действию A предсказывает представление Y;
- Loss - расстояние между предсказанным и целевым векторами, а не ошибка в каждом пикселе.
Если совсем просто, обучение сближает два сжатых описания скрытого фрагмента: предсказанное по видимой части изображения или видео и построенное по самому фрагменту. Детали различаются между версиями JEPA, но суть одна: совпадать должны полезные признаки сцены, и модель получает право отбрасывать непредсказуемое. Чтобы понять, куда покатится мяч, не нужно угадывать движение каждой травинки - хватит объектов, геометрии, движения и последствий действия. Такое пространство менее детальное, зато пригодно для предсказания на дальнем горизонте.
У подхода есть известная ловушка: если оба encoder'а выдают постоянный вектор, ошибка равна нулю, хотя модель ничему не научилась, - это коллапс представлений. В I-JEPA и V-JEPA от него защищаются так: целевая ветка не получает градиент и обновляется как exponential moving average основной сети. В LeJEPA вместо teacher-student схемы стоит регуляризатор SIGReg, подталкивающий embeddings к изотропному гауссовскому распределению. Лекун признает, что этот вариант пока не масштабирован так же хорошо, как I-JEPA и V-JEPA.
Когда predictor учитывает действие, получается action-conditioned world model: она предсказывает уже не просто будущее, а последствия конкретного движения робота. Система прокручивает варианты в latent space и выбирает последовательность с минимальной энергией (energy) - мерой несовместимости с целью и ограничениями. В V-JEPA 2-AC планировщик CEM минимизирует L1-расстояние до embedding целевой картинки, выполняет первое действие и перепланирует. По сути это MPC, только модель динамики выучена из данных.
С LLM все это не обязательно конкурирует: в V-JEPA 2 визуальный encoder соединяли с Llama 3.1 8B для video question answering. Система может быть составной: LLM - язык, знания и инструменты; world model - состояние и динамика; planner - действия.
Отдельно от выступления мне было интересно прикинуть, что из этого уже живет в продакшене, а что пока остается исследованиями.
- В продакшене давно живут авторегрессионные LLM, мультимодальные модели, embeddings, vision encoders и классический MPC - но как отдельные кирпичи, а не готовая JEPA-система.
- V-JEPA 2/2.1 можно брать как открытые video encoders - для классификации, поиска, предсказания действий или как визуальную часть VLM. Но открытые веса, интеграция в Transformers и коммерческая лицензия - еще не развертывание в проде.
- V-JEPA 2-AC дообучили примерно на 62 часах роботизированного видео и без адаптации под конкретную установку запустили на манипуляторах Franka в двух лабораториях. Роботы выполняли reach, grasp и pick-and-place по визуальной цели. Правда, это исследование, а не серийный робот.
- Иерархическое планирование, длинные горизонты, объединение зрения со звуком и осязанием, заявленная безопасность через guardrail objectives - тоже пока исследования. Я не нашел в официальных источниках подтверждения, что JEPA уже обслуживает Meta AI, Instagram, очки или коммерческого робота.
В конце Лекун дает исследователям несколько намеренно провокационных советов:
- Академическим группам не пытаться обыграть индустрию масштабированием LLM, а идти в нерешенные задачи world models и physical AI;
- Для понимания мира изучать joint-embedding и energy-based модели и не считать генерацию пикселей готовой моделью мира;
- Развивать регуляризованные методы и максимизацию информативности вместо опоры только на contrastive learning;
- Учиться в основном наблюдением, а RL включать экономно - поверх хороших представлений, когда без него нельзя.
Для меня это не запрет работать с LLM: они уже решают реальные задачи, а тезисы Лекуна еще предстоит доказать. Это совет о выборе фронтира: идти туда, где нужно предсказывать последствия и управлять процессом, а не соревноваться в красоте генерации.
P.S. Вчера с друзьями обсуждали за пивом вопросы LLM, World Models, AI в разработке и ритейле ... и я понял, что плохо шарю в World Models - пришлось достать из watch list это видео, до которого не доходили руки и посмотреть его сегодня утром:)
#AI #JEPA #WorldModels #Research #Robotics #Engineering