Physical AI начинается там, где решение меняет физический мир
В этой статье под , понимается система, замкнутая в контур «восприятие → решение → действие → новое восприятие». Камеры, лидары, микрофоны и датчики положения дают ей неполную картину среды; модель выбирает следующий шаг; приводы меняют положение тела или объекта; последствия возвращаются как новый поток сигналов. Интеллект здесь нельзя отделить от корпуса, задержки, трения, энергии и права на ошибку.
Такое определение шире гуманоидов. Манипулятор на линии, беспилотное такси, складской мобильный робот, дрон, уборочная машина и двуногий помощник принадлежат одной области, если способны воспринимать изменчивую обстановку и выбирать физическое действие. Форма тела влияет на сложность задачи, но не задаёт границу этой области. Миллион работающих тележек может быть важнее для экономики отрасли, чем один робот, эффектно складывающий бельё.
С другой стороны, не всякая автоматика относится к ИИ в физическом мире. Станок, выполняющий неизменную программу в ограждённой ячейке, действует в мире, но почти не выбирает поведение по ситуации. Цифровой агент может рассуждать и пользоваться инструментами, но его ошибка обычно обратима транзакцией, повторным запросом или восстановлением файла. Робот объединяет обе сложности: должен понимать задачу и безопасно исполнить её через несовершенное тело.
Полезно различать четыре уровня. На первом — фиксированная автоматизация: известный объект, известная траектория, контролируемая сцена. На втором — автономия в заданной области: машина сама выбирает поведение, но только в очерченных условиях. На третьем — обучаемый робот, который осваивает семейство задач на одном типе тела. На четвёртом — обещание общего физического интеллекта: перенос навыков между задачами, площадками и телами при небольшом числе новых демонстраций. Большая часть путаницы возникает, когда доказательство второго уровня рекламируют как достижение четвёртого.
Поэтому вопрос о «ChatGPT-моменте» нельзя свести к тому, стал ли робот похож на человека или научился понимать голосовую команду. ChatGPT соединил обобщающую модель, естественный интерфейс, доступный продукт и экономику массового использования. Для физического мира нужно проверить тот же переход целиком: от нового режима обучения до надёжной полезной работы вне лаборатории.
Четыре акта: от программы движения к общей модели действий
Историю робототехники удобно читать не как парад машин, а как смену ответа на один вопрос: где хранится способность действовать? Сначала она жила в механизме, жёсткой программе и символической модели мира, затем — в реактивной связи восприятия с движением, после — в выученных на опыте навыках отдельных задач, а сегодня всё больше упаковывается в параметры общей модели и данные флота.
Акт I, 1948–1973: запрограммировать физический мир
Кибернетика Норберта Винера в 1948 году дала язык обратной связи: машина не просто исполняет команду, а сравнивает наблюдаемое состояние с желаемым и корректирует действие. «Черепахи» Уильяма Грея Уолтера, построенные в 1948–1949 годах, показали, что несколько простых контуров могут порождать внешне сложное поведение. Но главным промышленным событием стал Unimate: запатентованный Джорджем Деволом в 1954-м программируемый манипулятор с 1961 года работал на General Motors, перекладывая горячие детали. Это была революция повторяемости, а не понимания.
Важное наследие той эпохи — разделение мира на машину и тщательно подготовленное окружение. Если объект всегда лежит в оснастке, освещение постоянно, а человек отделён ограждением, сложность можно вынести из алгоритма в проектирование линии. Этот принцип до сих пор делает традиционного промышленного робота быстрее, дешевле и надёжнее универсального там, где задача не меняется.
Созданный в SRI в 1966–1972 годах Shakey связал камеру, дальномер, планирование и движение. Вместо готовой траектории ему задавали цель: например, переместить блок или пройти в соседнюю комнату. Из проекта выросли алгоритм поиска A* и язык планирования STRIPS. Схема «воспринять — построить модель — составить план — исполнить» стала каноном.
Ограничение проявилось вместе с успехом. Мир Shakey был медленным, плоским и специально размеченным; построение полной символической модели занимало много времени, а небольшое расхождение между описанием и реальностью разрушало план. WABOT-1 в 1973 году показал впечатляющую интеграцию двуногого движения, зрения, речи и рук, но не отменил эту проблему: собрать подсистемы в человеческой форме — не то же самое, что добиться устойчивой автономии.
Акт II, 1986–2007: действовать в неопределённости
В 1980-х Родни Брукс атаковал саму идею единой полной модели. Архитектура подчинения связывала простые уровни поведения — не столкнуться, двигаться, исследовать — и позволяла роботу отвечать на мир быстрее, а статья «Intelligence Without Representation» закрепила мысль: среда может быть собственной лучшей моделью, если машина достаточно часто замыкает обратную связь. Чистая реактивность при этом упёрлась в зеркальную границу: лабиринт, тупик или необходимость сначала освободить проход требуют памяти и планирования. Поэтому победил гибрид — быстрые слои удерживают машину от столкновения, медленные строят маршрут, — и современный многочастотный стек остаётся развитием этого компромисса, а не разрывом с ним.
Почти одновременно ALVINN Дина Померло учился связывать изображение дороги с направлением руля — не по явным правилам, а по демонстрациям водителя. Авторы искусственно смещали наблюдения, чтобы показать сети ошибки, которых человек в хорошем заезде почти не совершает, и научить её возвращаться к центру полосы. Уже здесь присутствовали три сегодняшние идеи: обучение по демонстрациям, синтетическое расширение данных и восстановление после ухода с правильной траектории. В 1995 году Navlab проехал большую часть маршрута через США без рук на руле, но слабая камера, единственный выход руления и страхующий водитель делали систему исследованием политики, а не автономным автомобилем.
DARPA Grand Challenge превратила автономное вождение в измеримую инженерную гонку. В 2004 году ни один участник не завершил пустынный маршрут: машины сходили из-за пыли, ошибок восприятия и механических отказов, и «интеллект» нельзя было измерить вне надёжности всего корпуса. В 2005-м финишировали пять машин, а Stanley Стэнфорда преодолел примерно 132 мили за 6 часов 53 минуты — команды выиграли не одним универсальным алгоритмом, а коротким циклом полевых испытаний, калибровкой, слиянием датчиков и управлением скоростью. Urban Challenge 2007 года добавил перекрёстки, приоритет и намерения других участников; отсюда выросла классическая архитектура беспилотника — локализация, восприятие, предсказание, планирование, контроль и операционный разбор каждого отклонения, — которую нейросети с тех пор меняют изнутри, не отменяя задачи системы целиком.
Акт III, 2012–2020: учиться на опыте
Победа AlexNet на ImageNet в 2012 году изменила экономику восприятия: зрительные признаки перестали конструировать вручную, а качество стало расти вместе с данными и вычислениями. Камера из специального датчика для одной детали начала превращаться в общий вход для множества объектов. Но размеченные фотографии статичны и не отвечают, какое действие безопасно: между «это кружка» и «возьми её за ручку, не задев соседнюю» оставался слой геометрии, динамики и опыта контакта.
Этот слой отрасль стала закрывать масштабом опыта. Google обучал множество одинаковых рук на сотнях тысяч попыток захвата, где неудача автоматически становилась отрицательным примером; QT-Opt использовал около 580 тысяч реальных захватов, переиспользовал прошлый опыт вне текущей политики и сообщил 96% успеха. Это первичный результат авторов в узкой постановке: 96% на подготовленной процедуре не означают 96% на любой кухне. Но проект показал будущий промышленный контур — флот производит данные, централизованно обученная политика возвращается на флот, а редкие ошибки задают следующую кампанию сбора.
Параллельно отрасль научилась переносить навыки из виртуальной среды. стал практичнее благодаря случайному изменению текстур, масс, трения и задержек во время обучения: разброс работает как прививка против чрезмерной уверенности симулятора и вынуждает искать устойчивое решение. OpenAI Dactyl в 2018–2019 годах продемонстрировал манипуляции многопалой рукой, обученной именно так, — и одновременно цену последнего процента: реальная система зависела от точного наблюдения, сложной руки и контролируемой постановки, а чем тоньше контакт, тем сильнее небольшая ошибка формы и трения меняет исход. Симуляция осталась незаменимым множителем данных, но не единственным доказательством безопасности.
К 2020 году вертикальные системы уже могли быть настоящим продуктом. Waymo запустила поездки без водителя в части Финикса, Roomba давно доказала массовый спрос на узкую бытовую автономию, склады наполнялись мобильными роботами. Не хватало другого: общего представления, которое связывает интернет-знание о мире, естественную постановку задачи и разнообразные моторные навыки.
Акт IV, с 2022 года: масштабировать общую стратегию
Именно эту границу пересекли модели 2022–2023 годов. SayCan подключил языковое планирование к доступным навыкам робота, Gato представил текст, изображения и управление в одной последовательности, RT-1 обучил один трансформер на сотнях реальных задач, RT-2 добавил веб-знание, а Open X-Embodiment собрал траектории разных лабораторий и тел в общий корпус. Единица разработки сменилась: вместо конвейера под конкретную задачу — модель, корпус данных и дообучение, обслуживающие целое семейство задач.
Так замыкается дуга этой истории: способность действовать, которая когда-то жила в механизме и жёсткой программе, теперь хранится в параметрах общей модели и данных флота. Перелом при этом не отменил планирование, контроль, карты и безопасность. Как он устроен изнутри — от RT-1 до Open X — и почему это ещё не ChatGPT-момент, разбирают секция о переломе 2022–2023 годов и проверка по пяти критериям вслед за ней.
Почему физический мир не масштабируется как текст
Языковая модель получает почти идеальную абстракцию: последовательность дискретных токенов. Для робота один «пример» — синхронизированная траектория из видео, глубины, усилий, положения суставов, команды, действий и результата. Камера видит не всё, датчик шумит, предмет закрывает захват, ткань меняет форму. Даже два внешне одинаковых эпизода не обязаны иметь одинаковую динамику.
Интернет дал языковым моделям триллионы уже записанных человеческих действий со словами. Для робототехники данные приходится физически производить. Нужны аппарат, площадка, оператор, сброс сцены после попытки и ремонт после столкновения. Неудачный ответ чат-бота можно пометить за секунды; неудачный захват иногда требует человека, который поднимет упавший предмет, распутает кабель и вернёт робота в исходную позу.
Далее — неодинаковые тела. Текстовый токен «яблоко» имеет один смысл для разных моделей, но команда «возьми яблоко» превращается в разные пространства действий для шестикоординатной руки, двухрукого гуманоида и мобильной платформы. Отличаются длины звеньев, камеры, захваты, частоты управления и пределы усилия. Общий корпус должен научиться отделять смысл навыка от конкретной кинематики, не потеряв точности исполнения.
Третье отличие — реальное время. Семантический план может ждать сотни миллисекунд, балансирующий робот — нет. Контакт стопы с полом или соскальзывание чашки требуют ответа на частотах от десятков до тысяч герц. Большая модель, последовательно выдающая низкоуровневые команды, добавляет задержку и нестабильность именно там, где нужен предсказуемый контур.
Четвёртое — необратимость и безопасность. Цена галлюцинации зависит от массы и скорости тела. Ошибка рекомендации может повредить деталь, остановить линию, заблокировать дорогу или травмировать человека. Поэтому физический продукт обязан не только редко ошибаться, но и обнаруживать неопределённость, уходить в безопасное состояние и оставлять достаточно следов для разбора.
Наконец, ошибки перемножаются на длинном горизонте. В условной игрушечной модели 99% успеха каждого шага дают лишь 0,99100 ≈ 37% вероятности безошибочно завершить сто шагов. Это не модель конкретного робота: шаги зависимы, часть ошибок восстанавливаема. Но арифметика объясняет, почему короткий ролик с одним удачным захватом почти ничего не говорит о четырёхчасовой смене. Нужны восстановление, повторное планирование и метрика автономного времени между вмешательствами.
В реальной задаче отказы образуют цепочки. Неровно поставленная коробка закрывает следующую; маленькая ошибка локализации меняет угол захвата; дополнительная попытка расходует батарею и сдвигает расписание. Поэтому тестировать надо не только атомарный навык, но и состояние, которое он оставляет после себя. «Успех» захвата, после которого предмет лежит неустойчиво и падает через минуту, — отложенный отказ длинной задачи.
Восстановление тоже имеет уровни. На первом робот замечает отсутствие ожидаемого результата и повторяет движение с другой траекторией. На втором пересматривает подцель: освобождает обзор, меняет руку или сначала передвигает мешающий предмет. На третьем признаёт границу компетентности, переводит тело в безопасную позу и просит оператора о минимальном решении, не передавая ему всю задачу. Зрелость проявляется не в обещании «никогда не ошибаться», а в том, какую долю сбоев система обнаруживает и закрывает сама.
При этом осторожность не бесплатна. Робот, который останавливается при каждом блике или близком человеке, может иметь идеальную статистику столкновений и нулевую производительность. Слишком уверенная политика увеличивает риск, слишком консервативная — ложные остановки и запросы помощи. Продукт выбирает рабочую точку между этими ошибками для конкретной цены последствия; одной средней точности модели для такого выбора недостаточно.
Хвост распределения важнее среднего. Тысяча одинаковых коробок создаёт красивую метрику, но прозрачная плёнка, повреждённый угол, новый поставщик упаковки или тень от сотрудника могут составить именно ту долю, которая требует почти всю человеческую поддержку. Поэтому закрытый тест должен содержать редкие состояния, а эксплуатационный отчёт — показывать не только долю успеха, но и типы отказов, тяжесть последствий и время возврата к работе.
| Ограничение | В цифровом продукте | В физическом мире |
|---|---|---|
| Данные | Логи и копии почти бесплатны | Эпизод требует тела, оператора, времени и сброса сцены |
| Интерфейс | Токены и API сравнительно единообразны | Датчики и пространства действий зависят от корпуса |
| Задержка | Секунды часто приемлемы | Баланс и контакт требуют миллисекунд |
| Ошибка | Ответ можно отменить или перегенерировать | Последствие может быть материальным и необратимым |
| Проверка | Совпадение ответа иногда автоматизируется | Нужно измерять процесс, среду, безопасность и полезный результат |
Перелом 2022–2023 годов: язык вошёл в контур управления
До 2022 года типичная обучаемая система всё ещё состояла из отдельных навыков и специальной логики их выбора. SayCan показал промежуточный мост: языковая модель предлагала осмысленные шаги, а выученная функция доступности проверяла, может ли робот выполнить их сейчас. Фраза «я пролил напиток» превращалась не в моторные команды, а в последовательность вроде «найти губку — взять — принести». Язык стал планировщиком, но библиотека физических умений оставалась заранее определённой.
RT-1 сделал следующий шаг. Google обучил один трансформер на примерно 130 тысячах эпизодов, более чем 700 задачах, собранных 13 роботами за 17 месяцев. Модель получала изображения и инструкцию, а выдавала дискретизированные действия. Главное было не в каждой цифре отдельно — это первичный отчёт авторов на собственной платформе, — а в смене единицы разработки: вместо отдельной модели для навыка появился общий робототехнический корпус и одна политика.
RT-2 соединил эту политику с , предварительно обученной на изображениях и тексте из интернета. Действия представили как ещё одну последовательность токенов и дообучили модель совместно на веб-данных и роботизированных траекториях. Так возникла : она воспринимает сцену, понимает инструкцию и выдаёт короткий фрагмент физического поведения в одном обучаемом представлении.
Демонстрация «перемести предмет к вымершему животному» стала символом сдвига: робот мог использовать веб-знание, что динозавр — вымершее животное, хотя такой инструкции не было в его наборе моторных задач. В экспериментах авторы сообщили улучшение обобщения на новые ситуации по сравнению с RT-1 и другими базовыми линиями. Но граница принципиальна: интернет-знание помогло выбрать и скомбинировать известные движения, оно не породило точный новый моторный примитив без физических данных.
Open X-Embodiment расширил идею с одной лаборатории на сообщество. В общий набор вошло более миллиона траекторий с 22 типами роботов, 527 навыками и примерно 160 тысячами формулировок задач. RT-X обучался на смеси несовместимых камер, рук и действий. Авторы показали положительный перенос на несколько платформ, хотя не универсальную взаимозаменяемость тел. Важнее всего появился аналог общего корпуса: разнородие перестало быть только помехой и стало источником масштаба.
Три решения вместе образуют настоящий архитектурный перелом. Естественный язык становится интерфейсом задачи. Действие становится выходной модальностью рядом с текстом и изображением. Траектории разных навыков и тел становятся совместным обучающим материалом. Теперь новый робот проектируют не только как механику с набором программ, а как участника растущего контура данных, моделей и удалённых обновлений.
Но перелом в методе не равен перелому в продукте. RT-2 работал на лабораторной платформе и с короткими задачами. Open X объединял данные постфактум, а их разметка и качество различались. Ни тот ни другой проект не дал человеку кнопку, после которой любой робот надёжно выполняет любую бытовую работу. Именно поэтому сравнение с ChatGPT требует более строгой рубрики.
Случился ли ChatGPT-момент: проверка по пяти критериям
Выражение «ChatGPT-момент» соблазняет выбрать красивую дату. Но выпуск ChatGPT был не только научным результатом: он собрал несколько уже созревших линий в продукт, понятный без инструкции и полезный миллионам людей. Для ИИ в физическом мире я предлагаю пять проверок: обобщение, естественный интерфейс, маховик данных, внешнее внедрение, надёжность и экономика. Первые три говорят о новой платформе; последние два — о состоявшемся рынке.
1. Обобщение за пределы выученного сценария
RT-2, RT-X, Gemini Robotics и семейство π дают содержательное «да, но». Они переносят семантические понятия, следуют новым языковым инструкциям, комбинируют виденные навыки и иногда адаптируются к новой сцене. Это уже иной класс систем по сравнению с классификатором предмета плюс вручную написанный автомат. Однако длинные задачи, новые контактные режимы и восстановление после собственной ошибки остаются заметно слабее коротких демонстраций.
2. Естественный интерфейс
Здесь перелом почти состоялся. Фразу «убери продукты и вытри стол» больше не обязательно переводить в дерево состояний вручную. Мультимодальная модель может разложить намерение на подцели и связать слова с объектами в кадре. Но естественность команды не гарантирует физической компетентности. Робот может правильно объяснить, что крышку надо повернуть против часовой стрелки, и не суметь приложить нужное усилие.
3. Маховик данных и масштаба
Общий формат траекторий, перенос интернет-представлений, телеприсутствие, синтетические данные и журналы флота уже складываются в маховик. Open X, DROID и AgiBot World — признаки того, что данные перестают быть частной коллекцией одного эксперимента. Но маховик медленнее текстового: траектории дороже, лицензии и приватность сложнее, а действие одного тела нельзя без преобразования воспроизвести на другом.
4. Внешнее внедрение
У универсальных роботов здесь пока разрыв. Публичные испытания у BMW, Mercedes-Benz, GXO и других партнёров доказывают интерес и отдельные рабочие операции, но не широкое тиражирование автономной платформы между площадками. В роботакси картина иная: пассажир заказывает поездку, машина приезжает без водителя, услуга повторяется сотни тысяч раз в неделю. Пользователь взаимодействует с продуктом, а не с лабораторной демонстрацией.
5. Надёжность и экономика
Это главный незакрытый критерий общего робота. Процент успешных эпизодов в подготовленной сцене нельзя напрямую перевести в стоимость полезного часа. Нужны данные о вмешательствах, времени восстановления, износе захвата, энергии, смене батарей, ложных остановках, безопасности рядом с человеком и работе в течение месяцев. У автономных машин экономика тоже не полностью раскрыта, но повторяемая оплачиваемая услуга и крупный полностью беспилотный пробег уже существуют.
| Направление | Что уже доказано | Чего ещё нет | Вердикт |
|---|---|---|---|
| RT-2 | Новый режим обобщения: веб-знание выбирает и комбинирует физические навыки | Массового продукта и эксплуатационной надёжности | GPT-3-момент архитектуры |
| Open X-Embodiment | Общий корпус из более чем миллиона траекторий разных тел | Универсальной взаимозаменяемости тел и единого контроля качества | Ранний ImageNet-момент корпуса |
| Waymo и Apollo Go | Повторяемая полностью беспилотная услуга в ограниченных городских зонах | Географической универсальности и полностью раскрытой экономики | Вертикальный ChatGPT-момент |
| Гуманоиды | Языковой интерфейс, перенос отдельных навыков, первые пилоты | Длинной смены без вмешательств и масштабного независимого внедрения | Ранний платформенный этап |
| Область в целом | Архитектура базовых моделей и начало маховика данных | Горизонтального продукта для произвольного тела и задачи | Момент ещё не завершён |
Мой вердикт поэтому трёхчастный. RT-2 — GPT-3-момент робототехники: исследовательский результат, после которого прежняя архитектура стала выглядеть ограниченной, а направление масштабирования — очевидным. Open X-Embodiment сыграл при нём роль раннего ImageNet-момента: не новая архитектура, а общий корпус, на котором её можно масштабировать. Waymo и Apollo Go прошли вертикальный ChatGPT-момент: сложный стек превратился в понятную услугу внутри очерченного домена. Универсальный робот ChatGPT-момента ещё не пережил: платформа формируется, но продуктовая доступность, надёжность и экономика не сошлись в одной системе.
Новый подход: не одна большая модель, а многочастотный стек
Маркетинговая фраза «LLM управляет роботом» создаёт неверную картину, будто модель по текстовой команде непосредственно выдаёт моменты на двигатели. Производительная система устроена иначе. Она разделяет рассуждение и физическую стабилизацию по временны́м масштабам, а между ними размещает обучаемый переводчик из намерения в короткое действие.
| Уровень | Типичный масштаб времени | Ответственность | Выход |
|---|---|---|---|
| Семантический планировщик | Секунды и сотни миллисекунд | Декомпозиция цели, смысл сцены, память, выбор инструмента | Языковой план, подцель, целевой объект или область |
| VLA-политика действий | Десятки и сотни миллисекунд | Превратить изображение, состояние и инструкцию в короткие пакеты движений | Позы, точки траектории, состояние захвата или латентные действия |
| Контроллер тела | Примерно 100–1000 Гц в зависимости от системы | Баланс, усилие, слежение за целью, реакция на возмущение | Команды положения, скорости или момента суставов |
| Контур безопасности | Независим и активен непрерывно | Пределы скорости и усилия, контролируемая остановка, геозоны, аварийный режим | Разрешить, ограничить или остановить |
Медленный уровень: смысл, память и план
На верхнем уровне мультимодальная модель распознаёт объекты и отношения, связывает инструкцию с текущей сценой, вспоминает предыдущие шаги и выбирает подцель. Она может работать раз в несколько секунд: «сначала освободи место у раковины», «эта чашка принадлежит верхней полке», «после неудачного захвата подойди с другой стороны». Здесь особенно полезны интернет-знание и языковое рассуждение.
Средний уровень: политика действий
Затем эксперт действий или VLA-политика превращает подцель и наблюдение в небольшой пакет движений — например, траекторию кисти и захвата на следующие полсекунды. Диффузионные политики хорошо представляют несколько правдоподобных способов действия вместо усреднения несовместимых демонстраций. Пакеты действий уменьшают число дорогих обращений к большой модели, а пересчёт на скользящем горизонте позволяет корректировать курс по новому изображению.
Семейство π от Physical Intelligence иллюстрирует эту конструкцию: крупная визуально-языковая часть несёт семантику, а меньший эксперт действий обучается на непрерывных роботизированных сигналах. π0.5 добавила иерархию и способность работать в новых домашних сценах; последующие версии исследуют память, обучение с подкреплением и более длинные задачи. Это первичные результаты разработчика: существенные как доказательство направления, но ещё не независимый стандарт надёжности.
Быстрый уровень: тело и контакт
Низкоуровневый контроллер получает желаемую позу, скорость или усилие и стабилизирует реальное тело. Здесь живут обратная кинематика, управление с прогнозирующей моделью, регуляторы суставов и выученные политики локомоции. Частота может составлять сотни герц, а приводной контур — около килогерца. Helix 02 компании Figure делает это разделение особенно наглядным: заявлены семантический S2, полнотелесный S1 на 200 Гц и выученный S0 на 1 кГц. Четырёхминутная непрерывная демонстрация из 61 действия впечатляет, но остаётся заявлением поставщика на собственной системе.
Отдельный уровень: жёсткие границы безопасности
Ограничение скорости и усилия, аварийная остановка, геозоны, обнаружение человека, контроль состояния батареи и независимая проверка команды не должны зависеть от творческой способности модели. Они образуют детерминированную оболочку, которая может отменить действие любого уровня. Чем свободнее семантический планировщик, тем яснее должны быть права, пределы и состояние, после которого управление передаётся оператору.
Автономное вождение десятилетиями развивает тот же гибридный принцип. Нейросети распознают мир и предсказывают его развитие, планировщик сравнивает траектории, контроллер исполняет выбранную, а отдельные механизмы проверяют столкновения и исправность. Сквозное обучение может расширять область выученного стека, но продуктовая система всё равно должна наблюдать собственное здоровье, журналировать решение и безопасно деградировать.
Отсюда меняется и устройство команды. Механика, датчики и приводы проектируются вместе с пространством данных; исследователи моделей отвечают не только за среднюю успешность, но и за уверенность и восстановление; инфраструктура флота становится частью продукта; безопасность накладывает ограничения до обучения, во время исполнения и после обновления. ИИ в физическом мире — не «модель внутри корпуса», а распределённая киберфизическая платформа.
Маховик данных: как робот превращает опыт в следующую версию
Если архитектура базовой модели становится воспроизводимой, главным преимуществом оказывается не контрольная точка, а способность непрерывно добывать разнообразный опыт. Хороший маховик начинается не с максимального числа часов видео, а с ответа на вопрос: какой отказ сегодняшнего флота должен стать завтрашним обучающим примером?
Первый источник — интернет и человеческое видео. Они дают понятия, объекты, причинные подсказки и разнообразие сцен, но редко содержат точные суставные действия и усилия. Модель может понять, что человек открывает тугую банку двумя руками, но не восстановить по обычному ролику крутящий момент, положение скрытых пальцев и трение крышки. Поэтому видео удешевляет семантику и представление движения, а не заменяет роботизированную траекторию.
Второй источник — дистанционные демонстрации. Оператор ведёт руки робота, использует VR-контроллеры, экзоскелет или специальный манипулятор; система записывает наблюдения и действия. DROID собрал около 76 тысяч траекторий, 350 часов взаимодействия и 564 сцены с помощью распределённого набора. AgiBot World сообщил более чем о миллионе траекторий по 217 задачам. Это важные масштабы, но наборы различаются по телам, лицензиям, качеству и тому, насколько задачи отражают реальную эксплуатацию.
Часы сами по себе — слабая единица качества. Сто часов одного плавного перекладывания могут быть менее полезны, чем десять часов с разными объектами, захватами, ошибками и восстановлением. Для траектории важны синхронизация сенсоров, точность калибровки, формулировка цели, исход и причина остановки. Если камера отстаёт от команды на несколько кадров или оператор завершает неудачный эпизод без метки, модель получает ложную причинную связь.
Объединение тел требует ещё одного слоя инженерии. Одни наборы записывают углы суставов, другие — положение кисти, третьи — скорость основания и состояние простого захвата. Можно привести действия к общему положению рабочего органа, токенизировать аппаратно-зависимые команды или обучить отдельные адаптеры. Каждый выбор что-то теряет: абстрактное действие лучше переносится, но скрывает усилие и достижимость; точная суставная команда исполнима, но привязана к кинематике. Open X показал, что смесь полезна, а не что проблема представления уже решена.
Третий источник — симуляция и цифровые двойники. В виртуальном мире можно параллельно падать миллионы раз, менять массу предмета, создавать редкие дорожные сцены и автоматически получать идеальную разметку. NVIDIA связывает GR00T с Isaac и Cosmos именно как конвейер синтетического опыта. Но симулятор кодирует предположения разработчика: мягкий пакет, влажная ткань, люфт редуктора или блик на мокром асфальте легко оказываются за его границей.
Четвёртый источник — , которая учится предсказывать следующее состояние по наблюдению и действию. Она позволяет воображать варианты, проверять подцели и генерировать визуальное разнообразие без каждого физического прогона. Но правдоподобный ролик не гарантирует верной контактной динамики. Практический рецепт гибриден: физический симулятор там, где известны законы; выученная модель — для сложного распределения сцен; случайное изменение параметров — против переобучения; реальный робот — для окончательной калибровки.
Пятый источник — автономные попытки и контролируемые ошибки. AutoRT использовал более 50 роботов и собрал около 77 тысяч эпизодов в офисных средах. После начального обучения система сама выбирает доступные задачи, выполняет их и сохраняет результат. Здесь появляется масштаб, но одновременно возникает риск засорить корпус повторяющимися лёгкими действиями или закрепить собственную ошибку. Нужны выбор информативных эпизодов и физические правила безопасности.
Шестой и самый ценный источник — вмешательство человека в реальной работе. Момент, когда оператор остановил руку, перестроил маршрут или удалённо завершил задачу, содержит границу компетентности текущей модели. Подход DAgger и его современные варианты превращают такие состояния в новые демонстрации. Журналы флота добавляют частоту отказов, сезонность, износ и редкие сочетания условий, которых лаборатория не придумала бы заранее.
Демонстрации опытного оператора почти не содержат состояний, возникающих после плохого решения: человек заранее обходит их. Развёрнутая политика, наоборот, чаще попадает именно туда. Это сдвиг распределения между обучением и эксплуатацией. Записывать только красивые успешные эпизоды значит учить начало задачи и игнорировать её хвост. Поэтому вмешательство, безопасный повтор и последовательность до полного восстановления ценнее очередной копии штатной траектории.
У маховика есть задержка обратной связи. Событие надо выгрузить, проверить, разметить, воспроизвести, включить в смесь, обучить и провести через регрессионные испытания. Для текста этот цикл может занимать часы или дни; выпуск на физический флот требует осторожной раскатки и наблюдения за новой динамикой. Скорость обучения компании определяется не только числом роботов, но и временем от вмешательства до безопасно подтверждённого исправления.
Наконец, эксплуатационное видео содержит лица, экраны, дома, производственные секреты и действия сотрудников. Флот данных обязан фильтровать чувствительные фрагменты, ограничивать срок хранения, связывать эпизод с версией модели и сохранять происхождение разметки. Иначе самый ценный источник опыта превращается в юридический и организационный долг, который невозможно бездумно объединить в общий корпус.
Настоящая платформа замыкает цикл: выбирает редкие и дорогие неудачи, очищает их от персональных и чувствительных данных, воспроизводит в симуляции, дообучает модель, проверяет на закрытом наборе сценариев, выпускает на небольшой флот и сравнивает вмешательства до и после. Без этого робот остаётся демонстрацией, которая улучшается отдельными кампаниями. С этим контуром каждый рабочий час потенциально укрепляет продукт.
Почему все снова строят гуманоидов — и что они пока доказали
Человеческая форма — не эстетическая прихоть. Мир уже построен под человека: двери, лестницы, полки, инструменты, рабочие места и проходы имеют человеческий масштаб. Две руки позволяют удерживать объект и одновременно воздействовать на него, а ноги открывают инфраструктуру без специальных рельсов. Кроме того, человеческое видео и движения оператора легче сопоставить похожей кинематике.
Но универсальность инфраструктуры оплачивается сложностью тела. Колёсная база энергоэффективнее и устойчивее на ровном полу; стационарная рука жёстче и точнее; специальный захват надёжнее человеческой кисти на одной детали. Гуманоид постоянно платит за баланс, лёгкие и мощные приводы, батарею, охлаждение, сенсорику стоп, защиту при падении и безопасность рядом с людьми. Если процесс можно недорого адаптировать под специальную машину, форма человека не гарантирует лучшую экономику.
Gemini Robotics показала, как знания Gemini дополняются физическими действиями и пространственным рассуждением; Gemini Robotics-ER отделяет воплощённое рассуждение от низкоуровневой политики. В июле 2026 года Gemini Robotics 2 расширила работу к полнотелесным задачам. Показатели успеха в собственных материалах заметно различаются между задачами — примерно от трети до более чем 90%. Это не слабость публикации, а напоминание, что одна средняя цифра скрывает разную физическую трудность.
В материалах Gemini особенно важно разделять три типа переноса. Семантический перенос — понять новый объект или переформулированную команду — опирается на сильную визуально-языковую базу. Комбинаторный — собрать новую последовательность из знакомых навыков — требует планирования и памяти. Физический — исполнить новый контакт, усилие или захват — всё ещё требует подходящих траекторий. Демонстрация первого типа не должна автоматически считаться доказательством третьего.
Разделение Gemini Robotics-ER и политики действий полезно и организационно. Одна и та же система рассуждения может планировать для разных тел, если каждое имеет проверенный исполнитель навыка. Но ошибка верхнего уровня тогда встречается с ограничением нижнего: план «потяни ящик» может быть логичен, а конкретный захват — не выдержать усилие. Контракт между уровнями обязан описывать достижимость, неопределённость и безопасный отказ, а не только имя навыка.
NVIDIA GR00T N1 предлагает открытую двухсистемную модель: медленная система рассуждает о сцене и инструкции, быстрая генерирует движения. N1.7 и экосистема Isaac/Cosmos усиливают акцент на синтетических данных. При этом собственный FAQ честно очерчивает раннюю стадию: порядка сотни демонстраций для новой задачи, нет долговременной памяти и самостоятельного повторения после ошибки, произвольное новое тело не подключается без адаптации.
Открытость GR00T снижает порог эксперимента: команда может исследовать адаптацию без собственного предобучения всей модели. Но синтетический конвейер переносит в результат границы симулятора, а «около ста демонстраций» — не универсальная цена навыка. Простое перекладывание одинаковых объектов и двуручная работа с мягким, прозрачным или заедающим предметом требуют разного покрытия. Считать нужно кривую качества по мере добавления демонстраций и результат на скрытых вариантах, а не один рецепт.
π0 и последующие модели Physical Intelligence демонстрируют разнообразные руки и мобильные платформы, сложные бытовые сцены и иерархию команд. Helix и Helix 02 связывают семантику с полнотелесной координацией роботов Figure. Это важные ранние доказательства одной гипотезы: общая модель может быстрее осваивать семейство задач и использовать данные разных воплощений. Они ещё не доказывают другую гипотезу — что один серийный гуманоид проведёт полную смену на незнакомой площадке дешевле специализированной автоматизации.
У π сильна ставка на разнородный общий корпус и непрерывные действия, у Helix — на вертикально интегрированное тело и полный частотный стек. Эти стратегии дополняют и конкурируют друг с другом. Первая обещает амортизировать данные между платформами, вторая — убрать неопределённость интерфейса «модель — привод». Пока нет общего испытания, где одинаковая задача, объекты, бюджет демонстраций и правила вмешательства применены к системам разных поставщиков, сравнивать ролики как лидерборд нельзя.
| Семейство | Сильная идея | Публичное доказательство | Незакрытая граница |
|---|---|---|---|
| Gemini Robotics | Веб-знание, пространственное рассуждение и действие | Перенос команд и навыков между несколькими роботами | Разброс задач, длинный горизонт и внешняя проверка |
| GR00T | Открытая двухсистемная модель плюс симуляционный конвейер | Адаптация гуманоидных навыков и синтетические данные | Память, восстановление и произвольное новое тело |
| π | VLM с отдельным экспертом непрерывных действий | Разные корпуса, бытовые манипуляции, иерархия | Полная смена и стандартизированный внешний бенчмарк |
| Helix 02 | Единая иерархия от семантики до привода | Непрерывная полнотелесная демонстрация | Независимое измерение надёжности и экономики |
Поэтому сегодняшняя волна гуманоидов одновременно рациональна и перегрета. Рациональна, потому что базовые модели наконец обещают амортизировать сложное универсальное тело на множество навыков. Перегрета, потому что капитализацию будущей платформы легко принять за доказанную производительность текущей машины. Правильный вопрос к пилоту не «насколько робот похож на человека?», а «какую долю смены он выполняет без скрытого оператора и какой процесс становится дешевле после учёта всей поддержки?»
Экономическая единица гуманоида — не цена корпуса, а стоимость закрытого рабочего окна. Если батарея требует паузы, удалённый оператор ведёт сложные эпизоды, а инженер ежедневно калибрует руки, дешёвая машина может давать дорогую операцию. И наоборот, сравнительно дорогой робот может окупаться на трёхсменном процессе, если быстро меняет задачи и требует мало инфраструктуры. Поэтому пилот должен измерять загрузку, полезную пропускную способность и труд поддержки вместе, а не после технического успеха.
Большая часть Physical AI уже работает — просто она не похожа на человека
Медийная картина перевёрнута относительно установленной базы. International Federation of Robotics в отчёте World Robotics 2025 зафиксировала 542 тысячи новых промышленных роботов, установленных в 2024 году. Это статистика отраслевой организации, собранная по рынкам, а не прогноз. Более половины установок пришлись на Китай, где работал парк свыше двух миллионов промышленных роботов. Именно манипуляторы для сварки, окраски, перемещения и сборки составляют основной измеримый физический масштаб.
В сервисной робототехнике IFR сообщила о 102,9 тысячи проданных в 2024 году профессиональных транспортных и логистических роботов и примерно 20 миллионах потребительских сервисных роботов, главным образом систем для уборки пола. Здесь важно примечание методологии: сервисные цифры основаны на выборке 294 поставщиков и не претендуют на полный рынок. Даже с этой оговоркой порядок величин показывает, почему массовый ИИ в физическом мире сегодня имеет колёса, щётки и узкую задачу чаще, чем две ноги и пять пальцев.
Amazon в июне 2025 года объявила о миллионном роботе в своей сети: разные типы машин перемещают стеллажи, сортируют посылки и работают более чем на 300 объектах. Компания также заявила, что модель координации DeepFleet сокращает время перемещения флота на 10%. Миллион — первичный факт поставщика о развёрнутом парке, а 10% — его внутреннее измерение без независимого аудита. Но это уже правильный уровень разговора: не единичный трюк, а сеть машин, оркестрация и экономия времени процесса.
Автомобиль — ещё один негуманоидный робот, только с исключительно дорогой ошибкой. Здесь зрелость достигается не общей способностью ездить «везде», а последовательным расширением : географии, погоды, скоростей, типов дорог и иных условий, в которых система берёт ответственность. Плотные карты, удалённая помощь, резервирование датчиков, техническое обслуживание и операционный центр — не костыли вокруг модели, а части автономного продукта.
По данным самой Waymo на февраль 2026 года, сервис выполнял более 400 тысяч поездок в неделю, 15 миллионов за 2025 год и свыше 20 миллионов за всё время. Компания сообщала о 127 миллионах полностью беспилотных миль и примерно 90-процентном снижении аварий с тяжёлыми травмами относительно человеческого ориентира в сопоставимых условиях. Методология сравнения публична и значительно строже обычного деморолика, но исходные эксплуатационные данные и вывод принадлежат поставщику.
Baidu в отчётности за первый квартал 2026 года указала 3,2 миллиона полностью беспилотных поездок Apollo Go за квартал, недельный пик свыше 350 тысяч в марте и более 22 миллионов поездок накопленным итогом к апрелю. К маю компания говорила о присутствии в 27 городах, 330 миллионах автономных километров и 220 миллионах километров без водителя. Это официальное, но внутреннее и неаудированное раскрытие. Вместе с Waymo оно показывает, что вертикальный порог пройден двумя разными экосистемами, а не одной показательной зоной.
| Домен | Публичный показатель | Тип свидетельства | Что он действительно доказывает |
|---|---|---|---|
| Промышленные роботы | 542 тыс. установок в 2024 году | Статистика IFR | Серийный зрелый рынок в структурированной среде |
| Потребительские роботы | Около 20 млн продаж в 2024 году | Выборка IFR из 294 поставщиков | Массовость узкой дешёвой автономии |
| Amazon Robotics | 1 млн роботов более чем на 300 объектах | Заявление компании | Флот, оркестрацию и повторяемую логистическую работу |
| Waymo | Более 400 тыс. поездок в неделю | Заявление компании с методологией безопасности | Повторяемый полностью беспилотный сервис |
| Apollo Go | 3,2 млн полностью беспилотных поездок за квартал | Официальное неаудированное раскрытие Baidu | Крупный вертикальный сервис в нескольких городах |
Эти домены объясняют и стратегию общего робота. Узкая машина выигрывает, когда процесс стабилен и объём велик; обучаемая универсальная — когда задач много, они меняются, а перестройка среды дорога. Будущее не обязано заменить первое вторым. Скорее, базовые модели проникнут в специальные тела: улучшат исключения, переналадку, человеческий интерфейс и координацию уже работающих флотов.
Кого нет на карте
У этого обзора есть сознательная граница: он опирается на игроков, чью работу можно прочитать по публичным проверяемым данным — первичным работам, статистике IFR, заявлениям поставщиков с методологией. Несколько крупных имён в такую рамку не помещаются, и промолчать о них значило бы выдать ошибку выборки за нейтральность.
Первое — Tesla. Компания управляет, по-видимому, крупнейшим флотом автономии под надзором водителя и развивает гуманоида Optimus. Но её публичные показатели построены вокруг миль под надзором, а мили со страхующим человеком и полностью беспилотные поездки — разные измеряемые величины: ответственный за безопасность водитель меняет саму единицу учёта, и текст выше последовательно считает только вторую. Пока раскрытие не позволяет заполнить строку «поездки без водителя и вмешательства на единицу пробега», в таблицах вердиктов Tesla нет — это граница метода, а не оценка технологии.
Второе — китайская гуманоидная волна: Unitree, UBTech, AgiBot и другие производители уже продают серийное железо, а не только показывают ролики. Выше AgiBot упоминается лишь как источник обучающего корпуса, хотя компания прежде всего выпускает роботов. Структурно эта волна опирается на факт, который статья уже зафиксировала: более половины мировых установок промышленных роботов приходится на Китай, а работающий парк там превышает два миллиона машин. Производственная база есть; не хватает публичных эксплуатационных данных уровня описанной здесь лестницы свидетельств.
Третье — Boston Dynamics, два десятилетия задававшая планку динамического управления телом: Atlas и Spot показали, что физически возможно, задолго до нынешней волны. Компания редко публикует показатели вида «вмешательства на час работы», поэтому строки в рубрике вердиктов у неё тоже нет. Это напоминание о пределах самой рубрики: карта в этой статье описывает доказанную полезную работу, а не полноту инженерных достижений отрасли.
Капитал оценивает платформу раньше, чем эксплуатация доказывает продукт
Объём инвестиций показывает ожидание будущей ренты, но не число полезных операций сегодня. Figure в сентябре 2025 года объявила более чем о миллиарде долларов серии C при оценке 39 миллиардов после сделки. Skild AI в январе 2026-го привлекла 1,4 миллиарда при оценке свыше 14 миллиардов. Apptronik к февралю 2026 года увеличила серию A более чем до 935 миллионов. Waymo привлекла 16 миллиардов при оценке 126 миллиардов. Все суммы — официальные заявления компаний о сделках, а не оценка их операционной рентабельности.
Эти раунды финансируют разные ставки. Figure и Apptronik строят тело, производство, данные и внедрение гуманоидов. Skild продаёт идею «мозга», переносимого между разными роботами. Waymo масштабирует уже работающую вертикаль и её капиталоёмкий флот. Сравнивать их как один рейтинг некорректно: у них разные единицы продукта, горизонт выручки и стоимость материальной инфраструктуры.
Между раундом и зрелым рынком лежит лестница свидетельств. Ролик показывает физическую достижимость. Пилот на площадке клиента — совместимость с процессом. Повторяемая операция без постоянной помощи — автономность. Развёртывание у нескольких независимых клиентов с раскрытой стоимостью — продукт. На каждой ступени исчезает часть скрытой работы оператора и появляется более сильное доказательство.
Например, Figure сообщала, что на линии BMW робот провёл свыше 1 250 часов, переместил около 90 тысяч деталей и участвовал в производстве 30 тысяч автомобилей. Agility Robotics сообщала более чем о 100 тысячах перемещённых контейнеров Digit. Это полезнее лабораторной демонстрации: есть внешний процесс и накопленный объём. Но цифры остаются заявлениями поставщиков, описывают узкую операцию и не раскрывают полностью долю удалённой поддержки, простои, обслуживание и стоимость успешной операции.
Аналитические прогнозы расходятся ещё сильнее. Goldman Sachs в 2024 году оценивал возможный рынок гуманоидов примерно в 38 миллиардов долларов и 1,4 миллиона поставок к 2035 году. Morgan Stanley в 2025 году рассматривал горизонт 2050-го и сценарий около миллиарда гуманоидов с совокупным рынком до пяти триллионов долларов. Это не две оценки одной величины: различаются год, охват цепочки стоимости, цены, производительность и сценарий внедрения. Разброс на два порядка — измерение неопределённости, а не обещание середины.
| Показатель | Что можно заключить | Чего заключать нельзя |
|---|---|---|
| Размер раунда и оценка | Инвесторы готовы финансировать конкретную платформенную гипотезу | Что продукт уже окупается или лидерство закреплено |
| Демонстрация без монтажа | Задача физически выполнима данной системой | Что она повторяется всю смену и на другом объекте |
| Часы и операции пилота | Система встроена в реальный процесс и накопила опыт | Что раскрыты вмешательства, простои и полная стоимость |
| Прогноз рынка | Как аналитик формализовал сценарий и горизонт | Что объём неизбежно материализуется |
У капитала всё же есть реальный технологический эффект: он позволяет производить больше одинаковых тел, собирать больше данных и дольше выдерживать цикл внедрения. Но возникает и риск метрики тщеславия: компания оптимизирует зрелищность следующего навыка вместо времени между вмешательствами. Поэтому инвестиционный рассказ нужно каждый квартал переводить в эксплуатационные показатели.
Полная стоимость особенно чувствительна к загрузке. Корпус, вычисления и интеграция — в основном постоянные затраты; оператор, энергия, расходники и брак растут с работой. Если робот куплен для восьми задач, но автономно освоил одну и ждёт новую оснастку, обещанная универсальность не превращается в использование. Экономическая модель должна показывать сценарии по числу смен, объёму, сроку службы, остаточной стоимости и требуемой доле автономии — тогда технический порог можно связать с окупаемостью, а не обсуждать отдельно.
Карта зрелости и система показателей реальной автономии
«Робототехника» не имеет одной стадии зрелости. Промышленная рука в ограждённой ячейке — давно зрелая технология. Беспилотное такси в нескольких городах — ранний масштабируемый продукт. Манипулятор на складе, который сам разбирает ограниченный поток коробок, — между ними. Домашний гуманоид общего назначения — исследовательская область, даже если отдельные навыки выглядят убедительно.
По состоянию на август 2026 года я бы разместил домены так. В зрелой зоне — фиксированные промышленные манипуляции, мобильная складская логистика и бытовая уборка. В зоне раннего масштаба — роботакси в очерченных городах и некоторые профессиональные сервисные флоты. В зоне пилотов — универсальная сортировка, мобильные манипуляторы, гуманоиды на повторяемых заводских операциях и часть сельскохозяйственных задач. В исследовательской зоне — длительная домашняя автономия, универсальная ловкость рук, работа в любой погоде и перенос на произвольное новое тело без дообучения.
Эти четыре зоны — эксплуатационная проекция четырёх уровней из первой секции. Зрелая зона — фиксированная автоматизация и узкая автономия, доведённые до серийной экономики; ранний масштаб — автономия в заданной области, ставшая публичной услугой; зона пилотов — обучаемый робот, осваивающий семейство задач в чужом процессе; исследовательская зона — обещание общего физического интеллекта. Продвижение по карте почти никогда не выглядит как скачок на следующий уровень: это накопление доказательств внутри текущего — расширение области, рост автономного времени, независимая проверка.
Медицинские роботы зрелы как управляемые человеком инструменты, но автономность клинического решения закономерно ограничена. Дроны зрелы в съёмке и контролируемой инспекции, а доставка и автономная работа в плотном городе зависят от регулирования и редких рисков. Сельское хозяйство выигрывает от больших площадей и повторяемых культур, но сталкивается с погодой, пылью, биологической вариативностью и сезонной экономикой. Карта должна быть по задачам, а не по форме машины.
Девять показателей вместо одного процента успеха
- Автономная доля времени. Сколько рабочего окна система действует без удалённого или локального оператора?
- Вмешательства. Сколько критических и некритических вмешательств приходится на час, милю или тысячу операций?
- Полезные операции в час. Не сколько движений выполнено, а сколько годных деталей, доставок или завершённых задач получил процесс?
- Стоимость успешной операции. Амортизация тела, вычисления, энергия, оператор, интеграция, площадь и простой должны быть в одном знаменателе.
- Энергия. Ватт-часы на полезную операцию и длительность смены без подзарядки показывают цену универсальности тела.
- Обслуживание. Среднее полезное время между отказами, время ремонта, расходники и доступность запасных частей.
- Безопасность. Опасные сближения, аварийные остановки, тяжесть последствий и покрытие независимыми защитами.
- Адаптация. Сколько новых демонстраций, инженерных часов и календарных дней требуется для новой задачи, площадки или корпуса?
- Независимость проверки. Работает ли показатель у внешнего клиента, на закрытом тесте и без выбора удачных эпизодов поставщиком?
Метрики нужно публиковать распределениями, а не только средним. Десять вмешательств в первые пять минут и затем стабильная работа — иной продукт, чем одно критическое вмешательство в конце смены. Полезно отдельно считать штатные запросы удалённой помощи, восстановимые ошибки и события безопасности. Иначе улучшение интерфейса оператора можно ошибочно назвать ростом автономии.
Само слово «вмешательство» нуждается в классификации. Подсказка выбора из двух безопасных вариантов, ручное доведение захвата, аварийная остановка и физическое извлечение застрявшего робота имеют разную цену и риск. Нужно считать частоту, длительность и квалификацию человека для каждого класса. Иначе поставщик может заменить постоянное телеуправление множеством коротких кликов и формально объявить резкий рост автономности.
Для нового пилота стоит заранее заморозить базовую линию: как задачу выполняет человек или специальная автоматика, сколько стоит цикл, как часто возникает брак и какой объём вариативности существует. Затем договориться о скрытом наборе сцен и запретить исключать неудобные часы из знаменателя. Только после этого процент успеха становится частью инженерного решения, а не декорацией презентации.
Проверку лучше строить ступенями. Сначала воспроизводимость на нескольких экземплярах в контролируемой сцене, затем заранее выбранные вариации, после — теневая работа рядом с текущим процессом, ограниченный продуктивный выпуск и только потом расширение окна. Версию модели, конфигурацию тела и правила удалённой помощи фиксируют для каждого этапа. Иначе улучшение между двумя неделями нельзя отделить от замены железа, ручной настройки сцены или более активной команды поддержки.
Независимая проверка не обязательно означает публичное соревнование на бенчмарке. Достаточно, чтобы клиент выбирал предметы и порядок задач, сохранял необрезанные журналы и мог повторить результат после ухода команды поставщика. Самый сильный сигнал — второй объект: новая планировка и другие сотрудники быстро показывают, является ли система продуктом или уникальным инженерным проектом вокруг одного пилота.
| Вопрос руководителя | Минимальное измерение | Красный флаг |
|---|---|---|
| Работает ли робот сам? | Полезное время между вмешательствами и доля автономных минут | Показывают только лучшие эпизоды или скрывают удалённого оператора |
| Ускоряет ли процесс? | Годные операции в час против текущей базовой линии | Считают движения робота, а не результат процесса |
| Экономит ли деньги? | Полная стоимость успешной операции на заданном объёме | Не учитывают интеграцию, простои и обслуживание |
| Осваивает ли новое? | Демонстрации, часы и стоимость до согласованного качества | Каждая задача требует новой ручной программы команды поставщика |
| Можно ли масштабировать? | Повтор результата на второй площадке и втором экземпляре | Успех держится на одном роботе и одном инженере |
| Безопасен ли выпуск? | Сценарии опасностей, независимые ограничения и журнал событий | Безопасность сводят к общей точности модели |
Что меняется теперь: робот становится продуктом данных и эксплуатации
Старый путь начинался с задачи, затем инженеры выбирали механику, программировали последовательность, настраивали зрение и сдавали ячейку. Новый путь не отменяет эту инженерную работу, но добавляет платформенный слой. Компания выбирает семейство задач и тел, проектирует формат траектории, организует демонстрации и симуляцию, обучает общую политику, выпускает её через контур безопасности и превращает эксплуатационные исключения в следующую версию.
Поэтому конкурентным преимуществом становится не самая крупная модель сама по себе. Важнее сочетание серийного и ремонтопригодного тела, разнообразных данных, быстрой адаптации, удалённой поддержки, безопасного выпуска и реального канала внедрения. Производитель, который продал тысячу роботов без качественных журналов и цикла улучшения, может учиться медленнее лаборатории с пятью хорошо инструментированными телами. Но лаборатория без клиента не увидит реального хвоста отказов.
Для технического лидера отсюда следует практический выбор: не покупать «универсальность» вообще, а назвать изменчивость, за которую бизнес готов платить. Какие предметы, люди и исключения встречаются? Что может быть структурировано дешёво? Где требуется человеческая форма, а где колёса и специальный захват лучше? Какая ошибка допустима, кто восстанавливает работу и как эпизод попадёт в данные? Эти вопросы определяют архитектуру раньше выбора VLA.
ИИ в физическом мире уже пересёк научную границу, за которой одна модель способна связывать смысл и множество действий. Это и есть перелом базовых моделей. Но физический ChatGPT должен сделать ещё один шаг: стать доступным продуктом, который месяцами создаёт полезный результат при предсказуемой цене и не требует скрытой команды спасателей. Роботакси показали, что такой переход возможен внутри узкой вертикали. Следующая глава отрасли — доказать его для более разнообразных тел и задач, не по ролику, а по журналу смены.
Пять вещей, которые стоит унести с собой
- 01У робототехники уже произошёл перелом базовых моделей: язык стал интерфейсом задачи, действие — выходной модальностью, а разнородные траектории — общим обучающим корпусом. Это важнее отдельной эффектной демонстрации.
- 02RT-2 разумнее считать GPT-3-моментом робототехники, а Open X-Embodiment — ранним ImageNet-моментом её общего корпуса: новый режим обобщения и общий обучающий материал, но ещё не массовый продукт. Вертикальный ChatGPT-момент Waymo и Apollo Go уже прошли; универсальный робот — ещё нет.
- 03Современный ИИ в физическом мире — многочастотная гибридная система. Медленное семантическое рассуждение ставит подцели, модель действий превращает их в короткие движения, быстрый контроллер стабилизирует тело, а отдельный контур безопасности ограничивает всё остальное.
- 04Главный дефицит смещается от архитектуры модели к маховику данных и эксплуатации: демонстрациям, симуляции, вмешательствам, восстановлению после ошибок, журналам флота и способности превращать отказ в следующее улучшение.
- 05Рынок стоит оценивать не по человекоподобию и размеру раунда, а по автономному времени, вмешательствам, полезным операциям в час, полной стоимости операции, безопасности и независимой проверке на новых площадках.
История, модели, эксплуатация и рынок
Истоки и исторические вехи
- Norbert Wiener — Cyberneticsкнига 1948 года о связи, управлении и обратной связи
- International Federation of Robotics — The History of Industrial Robotsофициальная отраслевая хронология Unimate и промышленной робототехники
- SRI International — Shakey the Robotистория первого мобильного робота, связавшего восприятие, планирование и действие
- A Robust Layered Control System for a Mobile RobotRodney Brooks, 1985/1986: слоистое реактивное управление и subsumption architecture
- Intelligence Without RepresentationRodney Brooks, 1991: эссе о среде как собственной лучшей модели
- ALVINN: An Autonomous Land Vehicle in a Neural Networkпервичная работа Дина Померло о нейросетевом рулении, 1989 год
- DARPA Grand Challenge for Autonomous Vehiclesофициальная хронология соревнований 2004–2007 годов
- ImageNet Classification with Deep Convolutional Neural NetworksAlexNet, первичная публикация NeurIPS 2012
- Learning Hand-Eye Coordination for Robotic GraspingGoogle Research, 2016: крупномасштабный сбор реальных захватов
- Learning DexterityOpenAI Dactyl, 2018: перенос манипуляции из симуляции в реальность
Масштабирование робототехнического обучения
- Do As I Can, Not As I Say: Grounding Language in Robotic AffordancesSayCan, 2022: языковое планирование, ограниченное доступными навыками робота
- A Generalist Agent (Gato)DeepMind, 2022: один трансформер для текста, изображений и управления
- QT-Opt: Scalable Deep Reinforcement Learning for Robotic ManipulationGoogle Research: 580 тысяч реальных попыток захвата и 96% успеха в узкой авторской оценке
- RT-1: Robotics Transformer for Real-World Control at ScaleGoogle Robotics, 2022: 130 тысяч эпизодов, более 700 задач и 13 роботов
- RT-2: New Model Translates Vision and Language into ActionGoogle DeepMind, 2023: действие как ещё одна выходная модальность
- Open X-Embodiment: Robotic Learning Datasets and RT-X Modelsпервичный проект: более миллиона траекторий, 22 воплощения и 527 навыков
- PaLM-E: An Embodied Multimodal Language Modelмультимодальная модель 2023 года для переноса знаний между задачами
- AutoRT: Embodied Foundation Models for Large-Scale Robot OrchestrationGoogle DeepMind: более 50 роботов и 77 тысяч собранных эпизодов
- DROID: A Large-Scale In-the-Wild Robot Manipulation Datasetпервичный набор: 76 тысяч траекторий, 350 часов и 564 сцены
- Diffusion Policy: Visuomotor Policy Learning via Action Diffusionпервичная работа об устойчивых многомодальных последовательностях действий
- Octo: An Open-Source Generalist Robot Policyоткрытая универсальная политика, обученная на Open X-Embodiment
- π0: A Vision-Language-Action Flow Model for General Robot ControlPhysical Intelligence, 2024: VLM и отдельный action expert
- π0.5: A Vision-Language-Action Model with Open-World Generalizationзаявленные авторами результаты переноса на новые домашние среды
- π0.7: A Steerable Model with Emergent CapabilitiesPhysical Intelligence, 2026: ранняя демонстрация обучения на опыте и длинных задач
- AgiBot Worldзаявленный создателями набор из более чем миллиона траекторий и 217 задач
Современные платформы и гуманоиды
- Gemini Robotics Brings AI into the Physical WorldGoogle DeepMind, 2025: Gemini Robotics и отдельная модель embodied reasoning
- Gemini Robotics 2 Brings Whole-Body Intelligence to Robotsзаявление Google DeepMind от 30 июля 2026 года; внутренние результаты поставщика
- NVIDIA Isaac GR00T N1: An Open Foundation Model for Humanoid Robotsпервичная публикация об открытой двухсистемной модели NVIDIA
- NVIDIA Isaac GR00T N1.7 FAQофициальный FAQ: объём демонстраций, отсутствие состояния и автономных повторов, пределы переноса между телами
- NVIDIA Cosmosплатформа генеративных моделей мира для синтетических данных Physical AI
- Introducing Helix 02: Full-Body AutonomyFigure, январь 2026 года: трёхуровневый стек 1 кГц / 200 Гц / семантический слой; заявление поставщика
- Humanoid Robots: Vision and Realityпозиция IFR о готовности рынка, батареях, безопасности и сравнении с промышленными роботами
- F.02 Contributed to the Production of 30,000 Cars at BMWэксплуатационное заявление Figure: 1250 часов, 90 тысяч деталей и одна узкая операция
- 100,000 Totes and Counting: Digit Keeps Delivering at GXOзаявление Agility Robotics об эксплуатации Digit в логистике
Автономные флоты и масштаб эксплуатации
- Waymo Raises $16 Billion Investment Roundзаявление компании: оценка $126 млрд, более 400 тысяч поездок в неделю и 127 млн автономных миль
- Waymo Safety Impactметодология и агрегированные данные компании о столкновениях; не независимый аудит всей эксплуатации
- Baidu Announces First Quarter 2026 Resultsкорпоративная отчётность Apollo Go: 3,2 млн полностью беспилотных поездок за квартал и более 22 млн накопительно
- Amazon Deploys Its One Millionth Robot and Introduces DeepFleetзаявление оператора: более 300 объектов и прогнозируемое сокращение времени перемещения на 10%
- NHTSA — Automated Driving Systemsофициальные определения уровней автоматизации и границ ответственности
Отраслевая статистика и экономика
- IFR World Robotics 2025отраслевая статистика: 542 тысячи установленных промышленных роботов в 2024 году
- World Robotics 2025 — Service Robotsвыборка IFR по 294 поставщикам: около 20 млн потребительских и 102,9 тысячи транспортно-логистических сервисных роботов
- Figure Exceeds $1B in Series C Funding at $39B Post-Money Valuationзаявление Figure от 16 сентября 2025 года; капитал не является доказательством полезной работы
- Skild AI Announces $1.4 Billion Series Cзаявление компании от 14 января 2026 года об оценке свыше $14 млрд
- Apptronik Closes Over $935 Million Series Aзаявление компании от 11 февраля 2026 года о совокупном размере раунда
- Goldman Sachs — The Global Market for Humanoid Robots Could Reach $38 Billion by 2035аналитический сценарий 2024 года: $38 млрд и 1,4 млн единиц к 2035 году, не наблюдаемый факт
- Morgan Stanley — Humanoid Robot Market Could Reach $5 Trillion by 2050аналитический сценарий 2025 года: почти 1 млрд гуманоидов и $5 трлн к 2050 году; иной горизонт и определение рынка