К основному содержимому
к странице архива
#Robotics

Сергей Левин: почему акробатические трюки — плохой тест для робота (Рубрика #Robotics)

#Robotics #AI #Engineering #Research #Architecture

В мае я начал рубрику про робототехнику с вопроса: где реальный инженерный прогресс, а где хорошо поставленное демо? Интервью Сергея Левина, опубликованное 24 августа 2026 года, даёт полезный критерий: эффектный бэкфлип иногда говорит о будущем роботов меньше, чем скучная работа с незнакомой чашкой в новой комнате.

Левин — associate professor EECS в UC Berkeley и сооснователь Physical Intelligence. Его основной тезис: робототехника ещё не на стадии GPT-4/5, где рецепт уже найден и остаётся наращивать данные и модель. Отрасль всё ещё выясняет, какое сочетание архитектуры, данных и обучения масштабируется. По его оценке, компоненты уже появились, но вместе они ещё не дают предсказуемого роста. Это взгляд исследователя и одновременно ставка компании, которая строит базовые модели для роботов.

Первый тест здесь — generalization, способность переносить навык в новые условия. Отрепетированный трюк проверяет конкретный навык, а полезный робот должен перенести его на новый предмет, помещение или другую конструкцию машины. По словам Левина, в тесте Physical Intelligence модель разъединила две случайно захваченные футболки и продолжила складывать одну — восстановилась после неожиданности. В другом она не смогла открыть ящик и стала убирать столовые приборы в духовку: не зависла, а выбрала осмысленное, но неверное продолжение. Так выглядит разрыв между впечатляющим поведением и надёжностью.

За переносом стоит правильная программа обучения. Повторение одной сварочной операции научит робота лучше варить, но не сделает его универсальным: нужны разные задачи, среды, предметы и конструкции машин. Причём Левин предлагает не начинать с YouTube. Сначала широкий реальный опыт роботов должен дать модели физическую опору, а уже затем человеческие видео и симуляции могут расширять её знания. Это перспективная исследовательская гипотеза, а не установленный закон отрасли.

Дальше важна модальность промежуточного шага. Язык задаёт последовательность задачи: открыть ящик, взять предмет, убрать его. Изображение или видео показывают следующее состояние сцены — куда нужно переместить руку и что должно измениться. По результатам команды Physical Intelligence, такая визуальная подцель помогает переносить навыки между разными роботами.

Но вся гипотеза упирается в последние проценты. Даже условные 95% успеха означают ошибку в каждой двадцатой попытке. Левин считает, что этот участок потребует обучения с подкреплением на автономно собранном опыте. И здесь важна оговорка: в 13-часовом опыте PI, описанном Левиным и в статье команды, человек примерно раз в пять минут задавал высокоуровневую команду, включая уборку после ошибки. Это длинный прогон, но ещё не полностью автономная смена.

У масштабирования есть и индустриальный слой. Отвечая на вопрос о Китае, Левин не говорит в терминах победитель/проигравший. Его урок в другом: модели не взлетают отдельно от производства, цепочек поставок, открытых разработок и доступного качественного железа. Масштабирование Physical AI — это вся система вокруг обучения модели.

Прогноз у Левина осторожно оптимистичный: структурированные применения могут появляться уже сейчас, среды вроде дома — через несколько лет, вероятно раньше чем через десять лет. Но это прогноз, не план. И раздел про безопасность в интервью заметно слабее технической части: Левин предлагает выводить системы в мир, наблюдать и корректировать подход. Это не заменяет проверки, ограничения и доказательство готовности, о которых я недавно писал на примере Waymo.

Эту запись стоит смотреть как инструкцию к следующему рободемо. Новый ли перед роботом предмет? Работает ли он в другой комнате? Как часто вмешивается оператор? Умеет ли система восстановиться после ошибки — и превратить её в данные? Именно эти вопросы стоит держать в голове, когда гуманоид снова красиво сделает бэкфлип.

#Robotics #AI #Engineering #Research #Architecture

Открыть видео на YouTube