К основному содержимому
к странице архива
#Robotics

Челси Финн: GPT-эра робототехники на пороге (Рубрика Robotics)

#Robotics #AI #Engineering #Research #Architecture

Посмотрел выступление Челси Финн «This Is the State of the Art in Robotics» на Startup School 2026, опубликованное 12 августа 2026 года. За эффектными демо Финн предлагает увидеть более важный сдвиг: ChatGPT стал общей моделью для работы с текстом, а Physical AI пытается сделать то же для действий в реальном мире.

Параллель здесь архитектурная. Вместо отдельного конвейера под каждую задачу — одна предобученная основа, которой дают разные инструкции. Physical Intelligence переносит этот принцип в робототехнику: от политики под одну операцию и одного робота к общей vision-language-action модели (VLA). На входе у неё изображения, инструкция и контекст, на выходе — управляющие действия. Правда, робот сходу должен работать без human in the loop — он сам меняет среду, а у пролитого кофе или столкновения нет кнопки undo. Поэтому Physical AI становится полезным не после удачного демо, а когда система часами работает без постоянного присмотра и восстанавливается после ошибок.

Финн показывает три части такого контура.

1️⃣ Разнородные данные У LLM есть огромный корпус текстов, но готового «интернета физических действий» нет. Вместо этого используются демонстрации операторов, автономные попытки, видео людей, данные из интернета и траектории разных роботов. Видео помогает понять задачу, а моторный навык приходится нарабатывать на самой машине. 2️⃣ Обучение с подкреплением на собственном опыте Когда робот оказывается в тупике, то оператор показывает роботу способ восстановления, а модель ценности (value function) оценивает движение к успеху, затем VLA дообучается на этих попытках. По данным Physical Intelligence, RECAP более чем вдвое повысил пропускную способность на части сложных задач и примерно вдвое сократил отказы. Для эспрессо компания сообщает об успехе выше 90% и 13-часовом прогоне повторяющегося сценария. Это результаты команды, а не независимая проверка. 3️⃣ Память Для уборки кухни мало текущих показаний сенсоров: нужно помнить завершённые шаги. В системе MEM (Multi-Scale Embodied Memory) короткая история остаётся видео, а длинная сжимается в текст. Получается любопытная инверсия: язык внутри робота служит планом и памятью, а моторный навык рождается из физического опыта.

Новая π0.7 объединяет инструкцию, ближайшую подзадачу, сведения о качестве данных и визуальную подцель от модели мира. По утверждению компании, единая VLA-модель сравнялась со специализированными политиками и показала ранние признаки композиционного обобщения — переноса знакомых навыков на новые сочетания задач и роботов. Универсальный робот из этого пока не получился.

Финн делает важную оговорку: буквального «момента ChatGPT» может не быть. Софт распространяется мгновенно, а машины нужно произвести, установить и обслуживать. GPT-эра робототехники будет похожа не на миллион пользователей за пять дней, а на постепенный рост числа задач, которые одна модель выполняет надёжно и автономно.

Для меня главный вывод такой: «ChatGPT для физического мира» близится и общими будут модель, инструкция и перенос знаний между задачами. Также Physical AI нужны собственный опыт, память, проверки качества, безопасное восстановление и измеримая надёжность. ChatGPT научил модели работать со смыслами текстов, а робототехнике ещё предстоит доказать, что смыслы можно стабильно превращать в действия в реальном мире.

#Robotics #AI #Engineering #Research #Architecture