Сколько времени вам, человеку, нужно, чтобы сложить футболку? Секунд пять, если аккуратно и секунд десять, если прям вообще аккуратно.
А теперь другой вопрос. Как вы думаете, сколько лет понадобилось мировой робототехнике, чтобы робот сложил ту же футболку сам — без жестко прописанной программы, без специальной оснастки, просто взяв мятую тряпку из корзины?
Отвечаю: примерно шестьдесят. Первый промышленный робот встал на конвейер General Motors в 1961 году, а уверенно складывающего белье робота впервые показали осенью 2024-го. И это, честно говоря, было событием покрупнее многих громких презентаций.

При этом вокруг темы робототехники стоит такой маркетинговый звон, что даже подготовленному человеку сложно отделить реальные сдвиги от криков маркетологов. Робот танцует — акции растут. Робот падает — мемы расходятся. А что там внутри, как оно устроено и работает ли вообще — про это говорят мало.
Эта статья — попытка навести порядок. Она рассчитана на читателя, который хорошо понимает, как устроены большие языковые модели, но с роботами дела не имел. Таких на Хабре, подозреваю, большинство. Я расскажу, откуда взялся термин Physical AI, почему классическая робототехника уперлась в потолок, как устроены VLA-модели изнутри, каким инструментарием мы пользуемся, что реально происходит в Китае, США и России — и где у всей этой технологии слабые места.
Сразу предупреждаю: текст получился большой. Я разбил его на две части. Первая — матчасть: принципы, модели, инструменты. Вторая — люди, деньги и география: кейсы, страны, проблемы.
Поехали.
Знаете, как программировали промышленного робота лет тридцать назад?
Вам выдавали пульт обучения — teach pendant. Здоровенная коробка с кнопками и джойстиком, на поздних моделях — с экранчиком. Вы вручную, по миллиметру, подводили руку робота к нужной точке, нажимали «запомнить». Потом к следующей точке. Потом к следующей. Робот записывал координаты и дальше гонял по ним со скоростью и точностью, недоступной человеку. Тысячу раз. Миллион раз. И каждый такой раз он делал это одинаково.

Сдвинулась деталь на пару сантиметров — все, приехали. Робот будет старательно варить воздух в том месте, где вчера был кузов. Он не «видит» деталь. Он вообще ничего не видит. Он повторяет траекторию.
Из этого следует главное, что нужно понять про классическую промышленную робототехнику: она блестяще решает задачу повторения и очень плохо — задачу приспособления. Весь инженерный потенциал отрасли десятилетиями уходил на то, чтобы убрать из окружения робота любую неопределенность. Детали подаются строго ориентированными. Освещение фиксировано. Люди за забором. Мир вокруг робота выравнивают, вылизывают и прикручивают болтами — лишь бы железке не пришлось думать.
И это, между прочим, гигантская индустрия. По данным Международной федерации робототехники, в мире сейчас работает больше четырех миллионов промышленных роботов, ежегодно ставят еще по полмиллиона с лишним. Автопром, электроника, металлообработка. Все это трудится прямо сейчас, пока вы читаете, — без всякого искусственного интеллекта в современном смысле слова.
Но есть нюанс. Все эти миллионы машин живут в специально построенных для них мирах. А наш с вами мир — квартира, склад с мятыми коробками, стройка, кухня — для них непроходим, как болото для трамвая.
Вот на стыке этих двух миров и родилось то, о чем пойдет речь.
Здесь надо остановиться и проговорить одну вещь, без которой может быть непонятна разница между задачами для роботов и сложностью таких задач.
В восьмидесятых годах исследователь Ганс Моравек сформулировал наблюдение, которое потом назвали его именем. Если своими словами: то, что сложно для человека, часто легко для компьютера, а то, что легко для человека, для компьютера мучительно сложно. Обыграть гроссмейстера в шахматы — пожалуйста. Взять пешку с доски пальцами — вот тут начинаются проблемы.
Причина, если совсем грубо, в эволюции. Абстрактное мышление — свежая надстройка, ей десятки тысяч лет. А сенсомоторика — ходьба, хватание, координация глаз и рук — шлифовалась сотни миллионов лет. Мы просто не замечаем, какой чудовищный вычислительный аппарат работает у нас в голове, когда мы наливаем чай, не глядя на чайник.
Кто такой Моравек и при чем тут МинскийГанс Моравек — исследователь робототехники из Университета Карнеги — Меллона, один из пионеров машинного зрения для мобильных роботов. Свое наблюдение он развернуто изложил в книге Mind Children 1988 года. Похожие мысли примерно тогда же высказывали Родни Брукс (будущий сооснователь iRobot, той самой компании с пылесосами) и Марвин Минский. Формулировка Моравека мне нравится больше всех: «Сравнительно легко заставить компьютер играть в шахматы на уровне взрослого и трудно или невозможно дать ему навыки годовалого ребенка в том, что касается восприятия и подвижности». Сорок лет прошло — а фраза до сих пор актуальна.
Запомните эту мысль, мы к ней будем возвращаться всю статью. Именно парадокс Моравека — та стена, о которую десятилетиями разбивались попытки выпустить роботов из клеток. И именно ее сейчас, кажется, начали потихоньку рушить.
Теперь про сам термин. Что такое Physical AI?
Если коротко: это искусственный интеллект, который воспринимает физический мир через сенсоры и действует в нем через приводы. Не текст на входе и текст на выходе, а пиксели на входе и ньютон-метры на выходе. Все.
Термин в его нынешнем виде раскрутил Дженсен Хуанг из NVIDIA — он с 2024 года повторяет его на каждой презентации, называя «следующей волной ИИ». И тут я позволю себе авторскую ремарку. Хуанг ничего не изобрел — направление, которое он окрестил Physical AI, в науке лет тридцать называется embodied AI, «воплощенный интеллект», и им занимались задолго до того, как это стало приносить деньги венчурных инвесторов. Но Хуанг сделал то, что делают талантливые организаторы: дал старому направлению новое имя, привязал его к своему железу и софту — и внезапно у темы появились бюджеты, о которых академические лаборатории не могли и мечтать. Что-то похожее произошло в свое время с IIoTом, который стал новой страницей в истории промышленности. Хотя в чем новизна непонятно – промавтоматизация существовала за десятки лет до IIoT.
Главного Хуанг добился. Наука двигает идеи, а деньги двигают науку. И тот, кто умеет придумать науке красивую обертку и выбить бюджеты, полезен ничуть не меньше автора формулы.
Под зонтиком Physical AI сейчас живет много всего: беспилотные автомобили, складские мобильные роботы, манипуляторы с машинным зрением, дроны. Но флагманский, самый громкий и самый спорный сюжет — универсальные роботы, чаще всего человекоподобные, управляемые большими нейросетевыми моделями. О них в основном и поговорим.
Почему именно сейчас? Что изменилось-то?
Изменились три вещи, и все три — примерно одновременно, в районе 2022–2024 годов.
Первая — трансформеры доказали, что одна большая модель, обученная на горе разнородных данных, обобщает лучше, чем сто маленьких специализированных. Сначала на тексте, потом на картинках. Робототехники смотрели на это и задавали себе очевидный вопрос: а с движениями так можно?
Вторая — компьютерное зрение перестало быть узким местом. Модели вроде CLIP и его наследников научились наделять пиксели смыслом. Робот впервые получил возможность не «распознать объект класса 17», а понять, что перед ним «мятая красная футболка, лежащая рукавом вниз».
Третья — железо. Бортовые вычислители доросли до того, что модель на несколько миллиардов параметров можно крутить прямо на роботе, без облака. А электрические приводы, батареи и редукторы за десять лет подешевели и полегчали настолько, что гуманоид перестал стоить как вертолет. Спасибо, кстати, электромобилям и дронам — робототехника едет на их компонентной базе, как в свое время персоналки ехали на компонентах калькуляторов.
Сложите три фактора — и получите нынешний бум. Дальше мы разберем, как это работает технически. Но сначала — короткая остановка на том, почему НЕ работало раньше. Без этого весь дальнейший рассказ будет не до конца понятен.
Как строилось управление «умным» роботом до нейросетевой эры? Расскажу на пальцах.
Классический стек называют sense–plan–act: восприятие, планирование, действие. Это конвейер из отдельных модулей, каждый из которых писали, отлаживали и защищали на конференциях отдельные команды.
Сначала восприятие. Камеры и лидары выдают сырые данные, отдельный модуль строит из них модель мира: вот стол, вот на столе объект, вот его шестимерная поза — три координаты и три угла. Уже здесь начинаются проблемы: блик на глянцевой кружке — и оценка позы уехала на пять градусов.
Дальше планирование захвата. Специальный алгоритм по геометрии объекта считает, куда поставить пальцы, чтобы объект не выскользнул. Про это написаны тысячи диссертаций. Тысячи, я не преувеличиваю.
Потом планирование движения: как провести руку из точки А в точку Б, не задев стол, самого себя и оператора Петровича. Отдельная наука со своими алгоритмами.
И наконец контроллер, который превращает траекторию в токи на моторах.
Каждый модуль по отдельности — сложная система. А теперь соберите их в цепочку и посчитайте надежность. Пусть каждое звено срабатывает в 95 процентах случаев — звучит неплохо, да? Перемножаем пять звеньев: 0,95 в пятой степени — это примерно 0,77. Каждая четвертая попытка взять кружку — мимо. А если задача длинная, из десятка последовательных манипуляций, то вероятность дойти до конца без сбоя падает ниже вероятности выбросить орел на монетке.
Вообще это называют проблемой накопления ошибок, а я для себя назвал проблемой девяток. Одну девятку надежности — 90 процентов — вам даст студент за семестр. Вторую — 99 — лаборатория за год. А вот третья и четвертая — это пропасть, которую пока не удается преодолеть. Помните про девятки. Это, пожалуй, главный термин статьи, он будет всплывать до самого финала.
Была у классического стека и вторая беда, пострашнее первой: он не переносился. Пайплайн, вылизанный под захват деталей из ящика на заводе, ничем не помогал роботу, который должен открыть холодильник. Другие объекты, другая геометрия, другие захваты — все заново. Каждая задача решалась с нуля, знания не накапливались. Отрасль напоминала программирование до изобретения библиотек: каждый пишет свое решение.
Апофеозом эпохи остается финал DARPA Robotics Challenge летом 2015 года. Лучшие команды планеты, лучшие роботы, задачи уровня «выйти из машины, открыть дверь, повернуть вентиль». Посмотрите на ютубе нарезку падений с этого финала, она того стоит. Двухметровые машины ценой в миллионы долларов заваливаются на бок при попытке повернуть дверную ручку, складываются пополам на ровном месте, торжественно падают лицом в песок. Зал ахает. Персонал бежит поднимать. Ничего не напоминает? Я про недавнюю презентацию Aidol, растащенную на мемы.

Это вызывает смешанные чувства. С одной стороны — вот он, срез возможностей отрасли, без монтажа. С другой — понимание, что вся мировая отрасль уперлась в потолок. Больше модулей, больше PhD, больше исследований — а носок с пола поднять по-прежнему не можем.
Тупик.
Пока робототехники полировали свои конвейеры, по соседству происходило кое-что важное. Глубокое обучение вошло сначала в компьютерное зрение, потом в распознавание речи, потом в язык. Рецепт везде был одинаковый: большая модель, много данных, минимум ручной работы. Дошло до того, что фраза «горькая правда» — the bitter lesson Ричарда Саттона — стала мемом: методы, опирающиеся на масштаб вычислений и данных, в итоге всегда обходят методы, опирающиеся на человеческие знания о задаче.
Логичный вопрос: если это сработало с текстом и картинками, почему не сделать так же с движениями робота? Взять большую модель, накормить данными — и пусть сама выучит и восприятие, и захваты, и траектории, одним куском, без ручной сборки модулей. Идея очевидная, и попытки были давно.
Но тут вылезала неприятность, которая до сих пор определяет лицо всей отрасли. У языковых моделей был интернет — готовый, бесплатный, накопленный человечеством за тридцать лет корпус триллионов слов. У зрения были миллиарды фотографий. А где взять триллион примеров того, как рука берет кружку?
Нигде. Интернета движений не существует. Каждую траекторию нужно добывать: либо гонять живого робота (медленно, дорого, робот ломается), либо просить человека показывать (еще медленнее), либо симулировать (быстро, но потом окажется, что реальность отличается от симулятора, и привет).
Масштаб бедствия оцените на примере. Флагманские языковые модели учатся на триллионах токенов. Самые крупные открытые роботические датасеты — это порядка миллиона эпизодов манипуляции. Не триллионы против миллиона. Разница — шесть порядков. Если бы GPT учили на таком объеме текста, он бы освоил примерно одну районную библиотеку.
Дактиль, кубик Рубика и тринадцать тысяч летПро то, как отрасль пыталась выкрутиться симуляцией, лучше всего рассказывает история проекта Dactyl в OpenAI. В 2019 году они показали пятипалую роборуку, которая одной кистью собирает кубик Рубика. Выглядело фантастически. Внутри — обучение с подкреплением в симуляторе с приемом под названием domain randomization: параметры симуляции (трение, массы, освещение, задержки) случайно дергают в широких пределах, чтобы система выучилась устойчивой к любому раскладу. На обучение ушли тысячи лет симулированного опыта — по расчетам самих авторов, порядка десяти тысяч лет манипуляций, прокрученных на серверном кластере.
А в 2021 году OpenAI распустила робототехническую команду. Официальная формулировка звучала примерно так: в робототехнике недостаточно данных, займемся областями, где данные есть. Показательный момент: одна из самых богатых лабораторий мира посмотрела на проблему данных для роботов — и решила зайти с другой стороны. Как мы теперь знаем, зашла: сначала научила модели языку, а данные для роботов отрасль пошла собирать руками. В прямом смысле.
Вот в такой диспозиции отрасль встретила 2022 год. Классический стек — в потолке. Данных — кот наплакал. Языковые модели — на взлете.
И тогда в Google задали вопрос, который, по моему мнению, и запустил все нынешнее безумие: а что, если действия робота — это просто еще один язык?
Вот мы и добрались до аббревиатуры из заголовка. VLA — vision-language-action, «зрение-язык-действие». Сейчас объясню, что это такое, и обещаю: если вы понимаете, как работает языковая модель, то поймете и VLA. Потому что VLA — это, по большому счету, и есть языковая модель. Просто со странным словарем.
Смотрите. Языковая модель получает на вход последовательность токенов и предсказывает следующий токен. Токен — это кусочек текста. Все, что модель умеет, выражается в этом простом действии: предскажи следующий кусочек.
А теперь мысленный эксперимент. Добавим в словарь модели новые токены. Не слова, а, скажем, «сдвинуть хват по оси X на один сантиметр», «повернуть запястье на пять градусов», «сжать пальцы». Дискретизируем непрерывные движения робота на маленькие шажки — и каждому шажку присвоим номер в словаре, как слову.
Что получится? Получится модель, для которой фраза «возьми кружку» и последовательность движений, которая берет кружку, — объекты одной природы. Просто цепочки токенов. Картинка с камеры робота — тоже токены, спасибо визуальным энкодерам. И задача робота превращается в понятную и знакомую: по контексту (картинка плюс команда) предсказывай следующие токены. Только теперь эти токены крутят моторы.
В Google Robotics к этой мысли шли постепенно. В конце 2022 года вышла RT-1 — Robotics Transformer. Скромный по нынешним меркам трансформер, обученный на 130 тысячах демонстраций: парк из тринадцати роботов полтора года катался по офисным кухням Google и под присмотром операторов учился брать, класть, открывать ящики. Семьсот с лишним задач. RT-1 показала главное: одна модель может выучить много навыков сразу, и чем разнообразнее данные, тем лучше она справляется с новыми вариациями.

А летом 2023-го случилась RT-2, и вот это был уже поворотный момент. Идея дерзкая: а зачем учить модель с нуля? Возьмем готовую большую визуально-языковую модель — из тех, что насмотрелись на весь интернет и умеют отвечать на вопросы по картинкам, — и дообучим ее на роботических данных, представив действия теми самыми текстовыми токенами. Пусть знания о мире, впитанные из интернета, работают на робота.
И они заработали. Вот самый цитируемый пример из статьи про RT-2. Роботу говорят: «подними вымершее животное». На столе — несколько игрушек, среди них пластиковый динозавр. В обучающих данных робота ничего про вымерших животных не было, ни единого примера. Но модель-то читала интернет. Она знает, кто такой динозавр и что он вымер. И рука тянется к динозавру.
Понимаете, что произошло? Робот смог использовать знания из Википедии и переложил их в действия. Впервые за шестьдесят лет отрасли.
Авторы RT-2 и назвали этот класс моделей vision-language-action. Термин прижился.
Дальше события понеслись. Осенью 2023-го несколько десятков лабораторий по всему миру скинулись своими данными в общий котел — так появился Open X-Embodiment, сборный датасет на миллион с лишним эпизодов от двадцати двух разных типов роботов. Обученные на нем модели RT-X внезапно оказались лучше специализированных моделей на их же родных роботах. Данные с чужого робота помогают твоему — это был важнейший экспериментальный факт. Значит, копить можно в общую копилку.
А в 2024-м вышла OpenVLA — открытая семимиллиардная модель от команды из Стэнфорда и Беркли, собранная из открытых компонентов и обученная на почти миллионе эпизодов из того самого котла. Она обходила по качеству закрытую RT-2-X, у которой параметров было в семь раз больше. Веса выложили в открытый доступ, и с этого момента порог входа в тему рухнул: собрать своего VLA-робота стало возможно в университетской лаборатории средней руки. Без Google.
Как именно движения превращают в токеныДавайте чуть подробнее про кухню на примере робота-манипулятора. Простой способ: каждую координату действия (их обычно семь — шесть степеней свободы руки плюс схват) дискретизировать на 256 уровней и писать номера уровней как токены. Так делали RT-1 и RT-2. Работает, но плохо масштабируется на быстрое управление: на 50 герцах последовательности распухают, а соседние действия почти не отличаются — модель учится, по сути, копировать предыдущий токен. Позже придумали способы поумнее: например, в Physical Intelligence сделали токенизатор FAST, который сначала прогоняет траекторию через дискретное косинусное преобразование — то самое, что живет в JPEG, — и кодирует не сами действия, а их частотный спектр. Сжатие получается в разы больше, обучение быстрее.
Есть и второй путь. Некоторые разработчики вообще отказался от дискретных токенов в пользу непрерывных действий — про диффузию и flow matching расскажу чуть ниже.
Хорошо, архитектура понятна. Но остается вопрос из прошлой главы: откуда данные? Интернета движений нет. Кто-то же должен показать модели эти сотни тысяч эпизодов «взял-положил».
Ответ простой: показывают люди. Телеоперация — вот главный станок по производству данных в отрасли, и, подозреваю, останется им еще надолго.
Выглядит это так. Оператор управляет роботом напрямую — джойстиками, VR-контроллерами, а чаще всего специальной «ведущей» копией робота: берешься руками за легкие ручки-манипуляторы, двигаешь ими, а роботизированная пара рук повторяет за тобой один в один. Ты складываешь футболку чужими железными руками. Робот при этом пишет все: картинки с камер, положения суставов, усилия. Один проход — один эпизод. Файлик с демонстрацией.
По сути, они записывают макросы, как в старом добром Excel. Только потом на этих макросах учится нейросеть, которая должна уловить не последовательность конкретных движений, а суть.
Ключевую роль тут сыграл проект ALOHA из Стэнфорда — двурукая телеоперационная станция, которую в 2023 году собрали из сравнительно дешевых компонентов, приблизительно за двадцать тысяч долларов вместо привычных для двуруких систем сотен тысяч. Собрали — и выложили все чертежи в открытый доступ. Через год появилась Mobile ALOHA: те же руки, поставленные на колесную базу. Ролики, где эта конструкция жарит креветки, вытирает пролитое вино и вызывает лифт, вы наверняка видели — они тогда разлетелись по всем лентам. Креветки, если что, жарились после полусотни человеческих демонстраций именно этого блюда.

Но ALOHA важна не креветками, а алгоритмической находкой под капотом. Называется action chunking, и про нее стоит рассказать, потому что она сегодня в том или ином виде живет почти в каждой серьезной VLA-модели.
Проблема была такая. Если модель на каждом такте предсказывает одно действие, посмотрел-шагнул-посмотрел-шагнул, то ошибки накапливаются со страшной скоростью — помним про девятки. Плюс поведение получается дерганое: модель на каждом шаге чуть-чуть передумывает.
Решение: пусть модель предсказывает не один шаг, а сразу пачку — чанк — из полусекунды-двух будущих движений. Исполнили пачку — посмотрели на мир — предсказали следующую. Как пианист, который читает ноты не по одной, а тактами. Или, если хотите, как буферизация в видеостриминге: мы жертвуем мгновенной реакцией ради плавности и связности.
Звучит просто, но точность манипуляций на реальном железе выросла в разы.
Примерно тогда же, в 2023-м, случился второй прорыв — Diffusion Policy от команды Колумбийского университета. Идея: генерировать чанки действий диффузией, ровно как Stable Diffusion генерирует картинки — из шума, постепенным уточнением. Зачем такие сложности? Затем, что у житейских задач часто много равноправных решений: препятствие можно обойти слева, а можно справа. Обычная регрессия в такой ситуации усредняет и предсказывает «идти сквозь» — по центру, где решения нет. Диффузия же честно выучивает оба варианта и выбирает один. Для манипуляций это оказалось принципиально.
Вот из этих кубиков — предобученная визуально-языковая модель, телеоперационные данные, чанки действий, диффузионные генераторы — и собрано почти все, что сегодня гордо называют «роботическим фундаментальным интеллектом». Дальше покажу на живых примерах.
В 2024 году из Google, Стэнфорда и Беркли ушла компания людей — Карол Хаусман, Сергей Левин, Челси Финн и коллеги. Они основали стартап Physical Intelligence и объявили цель: одна универсальная модель для всех роботов сразу. Не для конкретной руки, не для конкретного гуманоида — вообще для любых. «Фундаментальная модель физического мира», как они это называют.
Осенью 2024-го они показали первую версию — π0 (пи-ноль). И вот тут я возвращаюсь к футболке из начала статьи.
π0 складывала белье. Робот подъезжал к сушильной машине, выгребал спутанный ком одежды, вытаскивал вещи по одной, встряхивал, расправлял, складывал и укладывал стопкой. Минутами. Без разметки, без специальной оснастки, с настоящим мятым бельем, которое каждый раз лежит по-новому.
Почему я так прицепился к этому белью? Объясню. Складывание одежды — задача четко по Моравеку. Ткань — деформируемый объект: у нее бесконечное число конфигураций, она мнется, слипается, свисает. Ни просчитать геометрию захвата, ни запрограммировать траекторию заранее невозможно в принципе. Классический стек на ткани бесполезен, точнее почти не работает. Десятилетиями «сложить футболку» было для роботов невыполнимо. Потому, когда π0 буднично, по-домашнему разбирал сушилку, все поняли: это революция.
Технически π0 устроена как раз по рецепту из прошлой главы, с одним важным отличием. Основа — открытая визуально-языковая модель на три миллиарда параметров, к которой пристроен отдельный «моторный» блок примерно на триста миллионов. И этот блок выдает не дискретные токены, а непрерывные действия через flow matching — младшего и более шустрого родственника диффузии. На выходе — чанки движений с частотой 50 герц, чего хватает и для ловких, и для быстрых манипуляций.

В феврале 2025-го Physical Intelligence выложила веса π0 в открытый доступ. Щедрый ход, и умный: половина академических работ по VLA с тех пор строится на их базе, а компания сидит в центре экосистемы.
Дальше пошли версии. π0.5 весной 2025-го училась на данных из порядка сотни разных жилых домов — и убиралась на кухнях, в которых никогда не бывала. Обобщение на незнакомую обстановку, ради которого все и затевалось, начало проклевываться.
А в конце 2025-го вышла π*0.6, и в ней появилось обучение на собственном опыте. Схема называется RECAP и по-человечески описывается как обычное наставничество: сначала показываем (демонстрации), потом поправляем (оператор вмешивается, когда робот косячит, и эти исправления — самые ценные данные), потом отпускаем работать самостоятельно, и робот дообучается уже на своих успехах и провалах через обучение с подкреплением. Прямо как со стажером: показал, поправил, отпустил, разобрал ошибки.
На этой схеме компания отчиталась о вещах, которые поражали воображение: часы непрерывной работы без вмешательства человека, удвоенная производительность на задачах вроде сборки картонных коробок, заправки эспрессо-машины и все того же белья, вдвое меньше провалов. Цифры, понятно, от самой компании, независимой проверки нет — но сам вектор правильный: не «смотрите, что робот может сделать один раз на камеру», а «смотрите, как долго и стабильно он это делает». Помним про девятки. π*0.6 — первая известная мне модель, которая девятки набирает системно, а не героизмом инженеров накануне демо.
Инвесторы, судя по всему, рассуждают похоже: к концу 2025 года Physical Intelligence оценивали в 5,6 миллиарда долларов, а весной 2026-го пресса писала о переговорах про новый раунд с оценкой уже за 11 миллиардов. У компании при этом нет ни одного серийного продукта. Есть модель и есть вера, что модель — это и есть продукт. Такие времена.
Есть в устройстве современных VLA одна хитрость, которую мне хочется разобрать отдельно, — уж больно она интересная. Называют ее по-разному, но чаще всего System 1 / System 2, в честь двух систем мышления из книжки Канемана: быстрой интуитивной и медленной рассудительной.
Проблема, из которой она выросла, чисто техническая. Большая визуально-языковая модель думает медленно — единицы герц, сотни миллисекунд на раздумье. А контур управления моторами хочет команды с частотой десятки и сотни герц, иначе движения выйдут вялыми и робот не сможет, скажем, подхватить заваливающийся предмет. Требования противоречат друг другу.
Решение — разделить труд. Медленная большая модель (System 2) смотрит на сцену, понимает задачу и несколько раз в секунду формулирует намерение — компактный вектор смысла: что делаем и с чем. А быстрая маленькая моторная сеть (System 1) сотни раз в секунду превращает это намерение в конкретные движения суставов, реагируя на то, что происходит прямо сейчас.
Самая известная реализация — модель Helix от американской компании Figure, показанная в начале 2025 года. Там семимиллиардная модель работает на семи-девяти герцах, а восьмидесятимиллионная моторная — на двухстах, и обе крутятся прямо на бортовых чипах робота, без облака. В первой же демонстрации два робота под управлением одной модели вдвоем разбирали пакеты с незнакомыми продуктами, передавая друг другу вещи, — и вот эта сцена с передачей из рук в руки произвела на всех огромное впечатление. Год спустя вышла Helix 02, которая тем же способом управляет уже всем телом — ходьбой, балансом и руками одновременно, одной сетью. Робот тащит тяжелую тележку и на ходу перекладывает детали. К этому мы еще вернемся в главе про заводы.
Тот же двухсистемный мотив — у NVIDIA в открытой модели GR00T N1 (медленная VLM плюс быстрый диффузионный генератор движений), которую они раздают всем производителям гуманоидов, как когда-то раздавали CUDA. И у Google DeepMind в семействе Gemini Robotics: там в 2025 году к паре «рассуждающая модель плюс моторная» добавили агентный слой — старшая модель Gemini Robotics-ER планирует, лезет при необходимости в интернет (например, посмотреть местные правила сортировки мусора), а младшая исполняет. Отдельно у DeepMind интересная история с переносом навыков между телами: движение, выученное на двурукой лабораторной станции, переносится на гуманоида Apollo без переобучения. Для отрасли, где каждый робот исторически был отдельной вселенной, это дорогого стоит.
Замечу на полях: сама идея «медленный думает — быстрый исполняет» в теории управления стара как мир. Новое — то, что оба уровня теперь выучиваются из данных, а не проектируются вручную. Старая архитектура, новая начинка. История техники любит такие ходы.
На этом с теорией закончим. Модели — это прекрасно, но модель без данных, симулятора и железа — просто файл с весами. Поговорим про станки нашего цеха.
Чем вообще пользуется человек, который сегодня занимается Physical AI?
Первое и главное — станции сбора данных. Про телеоперацию я уже рассказывал; добавлю, что зоопарк устройств тут разросся знатный. Ведущие руки-копии в духе ALOHA. VR-шлемы с контроллерами, где оператор видит мир глазами робота. Экзоскелетные захваты, которые надеваются на руки человека и пишут его движения напрямую. Перчатки с датчиками. У китайской AgiBot под это дело построен целый цех: рядами стоит под сотню роботов, перед каждым — оператор, и смена за сменой они наигрывают демонстрации. Со стороны выглядит как гребной зал галеры, только вместо весел — кухонная утварь. Данные, как я говорил, добываются руками. Вот этими вот конкретными руками за зарплату оператора.
Кстати, любопытная деталь: профессия «оператор данных для роботов» уже вполне себе существует, вакансии висят открыто. Требования — аккуратность и усидчивость. Двадцать первый век, у станка сидит человек и целый день складывает полотенца, чтобы машина научилась складывать полотенца. Луддиты такой поворот даже представить себе не могли.
Второе — открытая экосистема. Тут нельзя не сказать про LeRobot от Hugging Face: библиотека, форматы данных, готовые рецепты обучения и, главное, дешевейшие открытые манипуляторы серии SO-100/SO-101, которые собираются из напечатанных на 3D-принтере деталей и наборных сервоприводов — комплект обходится в сумму порядка сотни евро. Именно на этих пластмассках сейчас учится думать за роботов огромное количество людей по всему миру, которые никогда бы не подступились к железу за десятки тысяч. Эффект тот же, что был от Arduino в электронике: порог входа упал на два порядка, и в тему хлынули люди. А люди в итоге решают все.

Третье — симуляторы. Зачем нужна симуляция, понятно из экономики: реальный робот собирает опыт со скоростью реального мира и иногда при этом ломает себя и окружающее, а симулятор крутит тысячи параллельных копий мира быстрее реального времени и почти бесплатно. Помните тысячи лет опыта у Дактиля? Вот они откуда.
Рабочие лошадки сегодня такие.
MuJoCo — физический движок, который написал Эмо Тодоров, а DeepMind купил и выложил в открытый доступ; точная контактная физика, стандарт де-факто в академии.
Isaac Sim и Isaac Lab от NVIDIA — тяжелая артиллерия с фотореалистичным рендером и массовым параллелизмом на GPU, вокруг которой NVIDIA строит вообще всю свою роботическую вертикаль.
Из свежего — открытый Genesis, наделавший шуму заявленными скоростями симуляции. Плюс специализированные среды и наборы задач-бенчмарков, где модели можно сравнивать между собой хотя бы в теплице.
И тут важно рассказать про главную засаду, с которой сталкивается каждый, кто идет этим путем. Называется sim-to-real gap — разрыв между симуляцией и реальностью. То, что доведено в симуляторе до блеска, в реальности внезапно спотыкается: настоящее трение отличается от смоделированного, ремни люфтят, камера шумит, провода тянут.
Лечится разрыв по-разному: той самой рандомизацией доменов из истории про Дактиля, дообучением на реальных данных, тщательной калибровкой. Для ходьбы и бега sim-to-real сегодня работает отлично — все эти прыгающие и бегающие китайские гуманоиды выучены почти целиком в симуляции, и перенос удается. А вот для тонкой манипуляции — увы, пока со скрипом: контакты, трение и деформируемые предметы симулируются плохо. Футболку в симуляторе толком не помнешь. Поэтому ходьбу учат в матрице, а манипуляцию — руками кукловодов. Такое вот разделение труда.
Четвертое, самое свежее направление — мир-модели, world models. Идея: раз уж генеративные видеомодели научились правдоподобно продолжать видео, пусть они послужат «воображением» для робота — генерируют будущее по текущему кадру и действию. NVIDIA развивает под это платформу Cosmos, Google DeepMind показывает Genie — интерактивные миры, генерируемые на лету, у Meta свой подход с V-JEPA, обученной на сотнях тысяч часов видео предсказывать, что произойдет дальше.
Прямо сейчас это скорее генератор синтетических данных и тренажер, чем рабочий инструмент управления, и у видеомоделей пока туго с физической точностью — предметы в их воображении иногда проходят друг сквозь друга. Но направление, на мой вкус, из самых перспективных.
Данные из видео — единственный по-настоящему большой источник, который у человечества уже есть. Весь ютуб — это, в некотором смысле, гигантский архив демонстраций того, как физический мир реагирует на действия. Осталось научиться из него это вытаскивать. Physical Intelligence, к слову, в конце 2025-го публиковала работу о том, что перенос навыков из человеческого видео в робота начинает проявляться сам собой при масштабировании — без специальных ухищрений. Если тенденция подтвердится, проблема данных станет выглядеть совсем иначе.
Такой вот у нас цех: кукловоды, пластиковые ручки, матрица и ютуб. На этом заканчиваю первую часть — матчасть.
Во второй части расскажу что из этого уже работает на настоящих складах и заводах, а что существует только в роликах; как устроена китайская государственная машина поддержки гуманоидов и почему американцы отвечают на нее деньгами и моделями; что происходит в России — от танцующего перед президентом Грина до упавшего под музыку из «Рокки» Aidol. И список граблей, на которые вся отрасль наступает прямо сейчас.